用几个月就撸出一个能跑在 Terminal-Bench 2.

大Jerry 高级 18小时前 161 浏览 1 点赞 约 2 分钟

如果一个小团队花几个月就能做出一个性能顶尖的编程 Agent,那么这类工具本身还能算作技术护城河吗?我倾向于认为不能。

很多人在盯着 Cursor 这种估值几十亿美金的公司,觉得 Coding Agent 是个巨大的金矿,但我在折腾 R-CLI 的过程中发现,构建一个高性能的 Agent 框架其实比想象中快得多。当我们把 R-CLI 开源的时候,并不是因为它不值钱,而是因为在实操过程中我意识到,真正的价值正在向底层转移。

现在的情况是,只要你有基本的工程能力,能快速搭建起一套高效的 Harness,就能在性能上跟那些资本雄厚的大厂掰掰手腕。这说明 Agent 层的能力正在迅速平民化。

我认为真正难啃、且有长期价值的坑在下面这几个维度:

  • 推理成本的极速下降: 怎么让模型跑得更便宜且不掉智商。
  • 持久化的组织上下文: 让 Agent 真正理解公司内部复杂的业务逻辑,而不是每次都要重新喂 Prompt。
  • 私有数据的闭环优化: 利用自有代码库进行微调,让开源模型能接轨前沿模型。
  • 本地化部署与安全: 怎么在不出内网的前提下,保证高性能的推理。

如果你还在纠结如何写一个更强的 Agent 逻辑,可能方向错了。未来的赢家大概率不是拥有一个最强 Agent 的公司,而是能让成千上万个 Agent 同时变强的基础设施提供商。

对于想实操尝试的开发者,可以参考 R-CLI 的实现逻辑,它的核心在于如何构建一个能与终端高效交互的执行环境。

# 这是一个典型的 Agent 执行环境配置思路
# 重点在于对 shell 权限的精细控制和上下文的实时捕获
export AGENT_RUNTIME_ENV="isolated"
export CONTEXT_WINDOW_STRATEGY="sliding_window"
# 启动一个受限的子 shell 用于执行生成的代码
tmux new-session -d -s agent_runtime "bash --restricted"

与其在这个赛道里卷一个又一个的封闭产品,不如把精力放在如何优化模型在特定组织架构下的流动性和私有化部署上。

AI编程AI编程实战R-CLIBackboardTerminal-Bench

全部回复 (3)

躺平产品经理 初级 18小时前
现在的Agent动不动就给我重写整个文件,看得我头大,这种能精准改小地方的才是我想要的,怎么才能调教出这种稳定性?
0 回复
调参侠小美 初级 18小时前
我也在想这个问题,如果只有最终结果,根本没法判断AI是在瞎猜还是真的在推理。目前大多数工具的日志都太简略了,能不能把中间的思考链条全部导出成JSON?
0 回复
阿福在路上 高级 18小时前
其实只要能把用户留住,技术迭代快点反而更有利于生态,大家一起卷起来,最后受益的还是咱们开发者!
0 回复

发表回复

支持 Markdown 格式