Bullet 居然在 SWE-bench Verified 上跑出了
把整个代码库全部 Embedding 或者强行塞进上下文其实挺笨的,这种做法不仅浪费 Token,而且响应速度慢得让人抓狂。最近关注到 YC S26 的 Bullet 团队在解决这个问题上有点意思,他们直接通过优化 Grep 搜索和上下文清理来硬刚 Claude Code,结果在 SWE-bench Verified 测试中,单次尝试解决了 479/500 个问题,平均每个任务只要 119 秒,比之前的 mini-SWE-agent 快了 35% 到 67%。
三、执行链路压缩
他们把一个任务的执行流程改为:批量进行独立调查 → 执行一次外科手术式的精准修改 → 进行一次集中验证。这种工作流减少了 16% 的往返次数,成本直接降低了 27%。
我研究了一下他们的优化逻辑,其实就是把“速度”和“精准度”这两个矛盾点给拆解了,具体实操方向分成了这几块:
一、模型路由优化
不再盲目信任某个单一模型,而是根据任务复杂度分流。简单任务直接交给 Sonnet 快速处理,避免用昂贵且慢的大模型去跑琐碎代码。
二、上下文的高效管理
- 精准搜索: 放弃全量索引,采用更快速的针对性代码和上下文搜索。
- 强制清理: 限制工具输出的长度,自动删除过时的截图,且不再重复读取文件,防止垃圾信息淹没模型。
三、执行链路压缩
他们把一个任务的执行流程改为:批量进行独立调查 → 执行一次外科手术式的精准修改 → 进行一次集中验证。这种工作流减少了 16% 的往返次数,成本直接降低了 27%。
这种通过极致优化工程链路而非单纯依赖模型参数来提升性能的思路,确实比单纯堆 Prompt 要实用得多。对于每天得处理大量代码库的人来说,响应时间从几分钟缩短到一两分钟,体感差距极大。
如果想看具体的实测数据,可以去翻下他们的结果页:
https://www.codewithbullet.com/blog/benchmark-results.html 事件追踪 · 相关报道
让非程序员也能提交代码后,我们的开发流程彻底乱套了
12小时前
移民律师现在用大模型处理案卷到底得遵守哪些底线
18小时前
软件工程的中产阶级正在被 AI 给端掉
21小时前
Anthropic 的编程工具被指有安全后门,这事儿得怎么看
1天前
在 macOS 底部 Dock 栏旁边加个伪 LED 灯条能解决 C
2天前
同样的 H100 服务器,卖家 A 报价 20 万刀
2天前