自托管 LLM 助手:用“分类+主题”替代复杂 RAG 的脑洞

PromptCube 中级 2小时前 367 浏览 9 点赞 约 1 分钟

不是所有记忆模块都需要 embedding 向量召回。有时候,最烦人的 RAG 系统其实是伪命题——用户只想让 Assistant“记住一点点”,而不是构建一个语义检索集群。

这个项目叫 pawmc,作者失业后没闲着,自己用 Cloudflare Workers + Durable Objects 撸了一个极简 LLM 助手。它的逻辑简单到你可能一开始不信:新建会话时,你告诉它一个 category + topic,后台就会为这个组合维护一个摘要,并在之后所有相关对话中自动补充进去。摘要会随着对话累积——就像人脑中的“分类记忆”一样增长。

没有 embedding,没有 agent chain,没有 LangChain 套壳。就一个 DO 对象 + Workers AI / OpenRouter。

它怎么做到的

  • 用 Durable Object 单例存摘要缓存,免费 tier 能撑挺个人日常用
  • 新建对话 → 提供 category + topic → 自动加载历史摘要
  • 对话结束 → 喂给 LLM 总结一段文字,append 到对应摘要
  • 下次只要 category + topic 一样,就能顺滑拉出“之前聊的那些事”

实测下来,作者每天拿它记工作琐事、个人计划,毫无压力。

部署指南(保姆级)

1. 准备好 wrangler,安装依赖。

npm install

2. 配置 Workers AIOpenRouter,随便改 .dev.vars

PROVIDER=openrouter # or 'workersai'
MODEL=META/LLAMA-3-8B # 根据 provider 调整
API_KEY=your_key_here

3. 部署上 Cloudflare。

wrangler deploy

4. 本地调试也行。

wrangler dev

能用吗?

  • ✅ 成本为零(free tier)
  • ✅ 可扩展为团队记忆系统
  • ❌ 没有 Web UI,API-first
  • ❌ 摘要依赖 LLM 总结质量

如果你也想搞个像样的上下文记忆系统,但又懒得折腾 RAG 架构,pawmc 或许正中下怀——它不是“更强大的 Agent”,而是“更省心的助手”。
OpenRouterpawmcCloudflare WorkersDurable ObjectsWorkers AI

全部回复 (3)

阿海爱学习 高级 1小时前
最近在整理知识库,也踩过类似坑。我干脆直接在 SQLite 里存关键词和分类,一旦数据结构固定,查询速度比 vector DB 稳定多了,根本不用担心 embedding 维度的问题。
0 回复
运营喵小柯 中级 1小时前
这种简单方式确实好,我自己也做过类似的:用标签+时间戳存笔记,找起来比向量检索快多了,还不用调召回参数。
0 回复
数据分析师Neo 专家 1小时前
我之前用 Notion 的数据库标签功能存项目笔记,后来发现直接按标签+日期筛选,比Semantic Search快太多,especially when you have thousands of notes.
0 回复

发表回复

支持 Markdown 格式