Armature:给 MCP 工具装上产品分析和 eval 仪表盘

PromptCube 专家 1小时前 565 浏览 0 点赞 约 1 分钟

自己做 MCP server 的开发者都有个共同痛点:工具分发出去之后完全是个黑盒。有人拿去跑代码、有人拿去查资料、有人用你的工具失败了一次就再也不碰了——你统统不知道。好消息是有个 YC 出来的团队在填这个坑。

Armature(YC P25)干的事情很简单:在 MCP 外面包一层 SDK,几行代码接好,就能把用户会话完整重建出来。不是只看调用记录,而是能看到用户让 Agent 干了什么、Agent 当时怎么想的,把 Claude / ChatGPT 里那场对话搬到你自己后台里。还顺手做了三件事:

  • 会话自动聚类,告诉你工具最常被用来干嘛
  • 按场景排名展示热门的调用方式、高频功能
  • 自动识别用户 Agent 的报错路径,方便定位修复

这套玩法实测有点东西。他们自己做了 870 次跑测对比,带不带监控对成功率几乎没影响(89.17% vs 89.15%)。隐私这块也处理得比较稳,脱敏直接在客户端完成,服务端拿到的已经是清洗过的数据。

工具本身是 YC 内部先自用的,后来开放给几个 CTO 朋友试用,结果反馈质量比他们真实产品还高。原因也好理解:真实用户的 Agent 会话比问卷靠谱得多。目前自托管版公开上架,设置 5 分钟能搞定,还有免费额度。

他们下一步准备把 evals 闭环打通:从会话分析里自动生成测试用例,拿真实用户跑过的流程去跑回归,修完直接开 PR。等于把「排查→修复→验证」串成了自动流水线。

如果你手里正好有 MCP 在给外部用户用,可以去试试看,反正免费。这方向挺有意思,就是不知道对 RAG 这种无状态架构的支持做得怎么样,等官方完善吧。

AI工具mcpClaude CodeYCArmature

全部回复 (4)

调参侠小美 初级 1小时前
这问题问到点子上了。3行代码那段其实就是包装好的中间件,真要落地还得自己处理序列化。数据脱敏客户端做,但源码不敢不看。跟OTel比多了语义层,但生态太嫩。
0 回复
早八人AI炼丹师 专家 1小时前
我接的时候发现它对stdio日志兼容不错,排查问题方便多了。
0 回复
强迫症脚本小子 专家 1小时前
SDK 接入后对现有 MCP 请求延迟影响大吗?想先试下。
0 回复
产品狗小林 初级 1小时前
我试过,本地跑几乎无感,但网络请求多了点,建议压测下再上生产。
0 回复

发表回复

支持 Markdown 格式