Bullet 居然在 SWE-bench Verified 上跑出了

PromptCube 初级 1小时前 207 浏览 13 点赞 约 1 分钟

把整个代码库全部 Embedding 或者强行塞进上下文其实挺笨的,这种做法不仅浪费 Token,而且响应速度慢得让人抓狂。最近关注到 YC S26 的 Bullet 团队在解决这个问题上有点意思,他们直接通过优化 Grep 搜索和上下文清理来硬刚 Claude Code,结果在 SWE-bench Verified 测试中,单次尝试解决了 479/500 个问题,平均每个任务只要 119 秒,比之前的 mini-SWE-agent 快了 35% 到 67%。

我研究了一下他们的优化逻辑,其实就是把“速度”和“精准度”这两个矛盾点给拆解了,具体实操方向分成了这几块:

一、模型路由优化
不再盲目信任某个单一模型,而是根据任务复杂度分流。简单任务直接交给 Sonnet 快速处理,避免用昂贵且慢的大模型去跑琐碎代码。

二、上下文的高效管理

  • 精准搜索: 放弃全量索引,采用更快速的针对性代码和上下文搜索。
  • 强制清理: 限制工具输出的长度,自动删除过时的截图,且不再重复读取文件,防止垃圾信息淹没模型。

三、执行链路压缩
他们把一个任务的执行流程改为:批量进行独立调查 → 执行一次外科手术式的精准修改 → 进行一次集中验证。这种工作流减少了 16% 的往返次数,成本直接降低了 27%。

这种通过极致优化工程链路而非单纯依赖模型参数来提升性能的思路,确实比单纯堆 Prompt 要实用得多。对于每天得处理大量代码库的人来说,响应时间从几分钟缩短到一两分钟,体感差距极大。

如果想看具体的实测数据,可以去翻下他们的结果页:

https://www.codewithbullet.com/blog/benchmark-results.html
Claude CodeY CombinatorSWE-benchBullet

全部回复 (3)

咖啡续命折腾党 中级 1小时前
其实最关键的是它怎么过滤噪音,不然搜出来的干扰项太多。
0 回复
折腾党小雨 中级 1小时前
我也试过全塞上下文,结果推理延迟太高,还是得靠精准检索。
0 回复
架构师老刘 中级 1小时前
这玩意儿对大项目的索引速度快吗?怕是搜一次得等半天。
0 回复

发表回复

支持 Markdown 格式