独立的 AI 编程实战社区

最新帖子

LM Studio 配合 Local Server 搭建个人知识库 RAG 的踩坑记录

直接把 LM Studio 当成 OpenAI 的 API 替代品,是很多本地 RAG 玩家的初步尝试,但如果不对 Server 配置和 Embedding 模型做精细化处理,检索出来的结果基本都是在…

一杯咖啡日记 初级 ·AI编程实战 · 67 · 0 · 8 ·2026/5/3
LM Studio 配合 Local Server 搭建个人知识库 RAG 的踩坑记录

Cline 结合 MCP 协议实现本地数据库自动读写实测指南

Cline 配合 MCP (Model Context Protocol) 协议,直接把 AI 助手从「只会写代码的聊天机器人」变成了「能直接操纵数据的数据库管理员」。这次实测的核心在于:AI 不再是…

PromptCube 中级 ·行业动态 · 348 · 0 · 10 ·2026/5/3
Cline 结合 MCP 协议实现本地数据库自动读写实测指南

GitHub Copilot Extensions 正式发布:如何通过插件接入自定义 API 增强代码上下文

GitHub Copilot 终于把“生态位”开放了。这次发布的 Copilot Extensions 实际上是给 Copilot Chat 增加了一个插件系统,允许开发者通过定义特定的 API 接口…

PromptCube 中级 ·行业动态 · 183 · 0 · 8 ·2026/5/3
GitHub Copilot Extensions 正式发布:如何通过插件接入自定义 API 增强代码上下文

如何利用 CrewAI 搭建一套能自动调研并撰写行业分析报告的智能体工作流

把 CrewAI 的 流程跑通后,我才意识到它和单纯调用 LLM 最大的区别在于“角色约束”带来的稳定性。之前用单 Agent 写调研报告,最头疼的是 AI 容易在搜集信息阶段就直接开始写结论,导致内…

前端小哥哥 中级 ·AI编程实战 · 82 · 0 · 13 ·2026/5/2
如何利用 CrewAI 搭建一套能自动调研并撰写行业分析报告的智能体工作流

GPT-4o 语音模式实测:端到端延迟降低对实时翻译的影响

端到端(End to End)延迟的量级降低,是 GPT 4o 语音模式最核心的变量。在之前的语音交互中,流程是「语音转文字 (ASR) $\rightarrow$ LLM 处理 $\rightarr…

PromptCube 中级 ·行业动态 · 498 · 0 · 13 ·2026/5/2
GPT-4o 语音模式实测:端到端延迟降低对实时翻译的影响

低显存环境下通过 LoRA 适配器实现多任务模型快速切换的实操指南

在显存捉襟见肘的消费级显卡上,想要同时运行多个针对不同任务微调的模型,传统的“一个任务起一个进程”方案简直是灾难。但其实我们可以通过 LoRA 适配器(Adapter)的动态加载机制,在不重启模型、不…

PromptCube 初级 ·行业动态 · 344 · 0 · 3 ·2026/5/2
低显存环境下通过 LoRA 适配器实现多任务模型快速切换的实操指南

如何利用 Function Calling 将 LLM 接入企业私有数据库实现实时查询

大模型在面对企业私有数据时,最尴尬的不是它不聪明,而是它在“一本正经地胡说八道”。传统的 RAG(检索增强生成)虽然解决了知识库问题,但在处理“上个月销售额是多少”这种需要精确计算和实时聚合的结构化查…

PromptCube 高级 ·行业动态 · 366 · 0 · 1 ·2026/5/2
如何利用 Function Calling 将 LLM 接入企业私有数据库实现实时查询

用 Stable Diffusion 配合 ControlNet 实现电商产品背景无缝替换的实操参数分享

电商产品图背景替换最忌讳的就是“抠图感”太重,尤其是产品边缘的光影与新背景完全脱节。直接用 Inpaint 很容易导致产品形变,目前最稳的方案是 ControlNet Canny + Depth + …

摄影爱好者Tom 初级 ·AI编程实战 · 177 · 0 · 9 ·2026/5/2
用 Stable Diffusion 配合 ControlNet 实现电商产品背景无缝替换的实操参数分享

如何通过 RAG 优化长文本输入以解决上下文窗口丢失细节的问题

直接把 10 万字文档塞进 Claude 3.5 或 GPT 4o 的上下文窗口,结果往往是 AI 出现了典型的「中间丢失 (Lost in the Middle)」现象:开头和结尾记得清,中间的关键…

阿星在深圳 中级 ·AI编程实战 · 419 · 0 · 15 ·2026/5/2
如何通过 RAG 优化长文本输入以解决上下文窗口丢失细节的问题

用 Kimi 的超长上下文分析 50 份 PDF 论文并自动生成综述大纲的实践技巧

直接把 50 份 PDF 论文一股脑塞给 Kimi 的效果其实很差,因为即使上下文窗口够大,模型在处理海量文档时依然会出现“中间丢失(Lost in the Middle)”现象,导致生成的综述大纲像…

前端小哥哥 中级 ·AI编程实战 · 439 · 0 · 4 ·2026/5/2
用 Kimi 的超长上下文分析 50 份 PDF 论文并自动生成综述大纲的实践技巧

Ollama 支持多模型并行加载,本地部署多智能体工作流实测

Ollama 这次更新把 参数开放出来,实际上是给本地 LLM 玩家捅破了最后一张窗户纸。以前本地跑模型最头疼的就是“排队”,加载 A 模型时 B 模型被踢出显存,导致多模型协作时产生巨大的加载延迟,…

PromptCube 中级 ·行业动态 · 343 · 0 · 6 ·2026/5/2
Ollama 支持多模型并行加载,本地部署多智能体工作流实测

如何在本地用 Ollama 部署 Llama 3 并通过 LangChain 实现私有知识库问答

把 Llama 3 跑在本地做 RAG(检索增强生成)最头疼的不是部署,而是怎么让 LLM 别在检索到文档后还一本正经地胡说八道。我最近把这套流程跑通了,核心是利用 Ollama 的 API 接口配合…

一杯咖啡日记 初级 ·AI编程实战 · 241 · 0 · 2 ·2026/5/2
如何在本地用 Ollama 部署 Llama 3 并通过 LangChain 实现私有知识库问答

用 vLLM 部署 DeepSeek-V3:FP8 量化下的显存占用与吞吐实测分析

DeepSeek V3 这种 671B 参数的巨无霸,如果不走量化这条路,绝大多数公司根本没法私有化部署。这次用 vLLM 跑 FP8 量化版本的实测数据很有意思,最核心的结论是:FP8 几乎在不损失…

PromptCube 中级 ·行业动态 · 61 · 0 · 4 ·2026/5/2
用 vLLM 部署 DeepSeek-V3:FP8 量化下的显存占用与吞吐实测分析

用 Claude 3.5 Sonnet 快速重构旧项目代码并实现单元测试全覆盖

把一个维护了三年的旧 Python 项目丢给 Claude 3.5 Sonnet,最忌讳直接说「帮我重构」。这种指令只会让它在不改变逻辑的情况下把变量名改一遍,毫无意义。 我这次重构的策略是: 上下文…

数据分析师Lucy 中级 ·AI编程实战 · 85 · 0 · 0 ·2026/5/2
用 Claude 3.5 Sonnet 快速重构旧项目代码并实现单元测试全覆盖

用 Unsloth 优化 Llama 3 微调:显存占用降低 60% 的实操经验分享

显存焦虑一直是 Llama 3 这种量级模型微调的痛点,尤其是对于只有单张 3090 或 4090 的开发者,原生 Hugging Face 框架跑 8B 模型极其容易 OOM。这次实测 Unslot…

PromptCube 初级 ·行业动态 · 482 · 0 · 2 ·2026/5/2
用 Unsloth 优化 Llama 3 微调:显存占用降低 60% 的实操经验分享