用 Bullet 跑 SWE-bench Verified 能拿到

PromptCube 中级 1小时前 66 浏览 7 点赞 约 1 分钟

在编程 Agent 领域,很多人陷入了一个误区,觉得速度慢是因为模型推理慢。但其实真正拖后腿的是那些没完没了的往返对话(round trips)。我最近关注到 YC 的一个新项目 Bullet,他们给出的结论很直接:减少往返次数比提升模型单次响应速度重要得多。

这项目挺有意思,创始人之前在 Citadel 这种量化巨头待过,自带一种“性能强迫症”。他们觉得像 Claude Code 这种工具在处理上下文时太笨,要么把整个仓库塞进去,要么依赖低效的 embedding,导致模型在垃圾信息里打转。

Bullet 核心在搞这几件事,我觉得很有实操参考价值:

  • 并行化调研: 把独立的搜索、读取和命令执行全部并行化,只有必须依赖前一步的编辑和验证才走串行。这样能直接砍掉 16% 的往返次数。
  • 上下文强力清理: 限制工具输出长度,自动删除过期的截图,不再重复读取文件,防止上下文被垃圾信息淹没。
  • 精准搜索代替全量索引: 他们认为对整个 Repo 做 embedding 挺傻的,而是通过更高效的 grep 机制在代码和上下文中进行定向搜索。
  • 模型路由优化: 避免用昂贵的大模型去跑那些 Sonnet 就能搞定的简单任务。

从数据上看,Bullet 在 SWE-bench Verified 上的表现相当离谱,500 个任务解决了 479 个,速度比 mini-SWE-agent 配合 Fable 或 Sol 快了 35% 到 67%。

最让我好奇的是他们提到的一个细节:在做代码搜索时,正则方言的不匹配会导致 Agent 悄悄地找错方向,从而走入死胡同。这种极小的技术细节往往决定了 Agent 是在高效工作还是在“一本正经地胡说八道”。

对于需要长时间迭代、步骤依赖极强的任务(比如写数据流水线或跑评测循环),这种优化路径可能比单纯堆模型参数要有效得多。

Claude CodeYCSWE-benchBullet

全部回复 (4)

大鹏的日常 初级 1小时前
快确实重要,但如果生成代码质量不行,跑得再快也是在快速制造Bug,不知道这版在准确率上怎么平衡的?
0 回复
脚本小子小柯 专家 1小时前
这个方法好使吗?我正卡在注册这一步,赶紧试一下,希望能直接进去。
0 回复
脚本小子阿杰 专家 1小时前
笑死,这AI也太实诚了,直接把答案喂到嘴边,完全没给玩家留悬念啊。
0 回复
架构师Neo 中级 1小时前
心态放宽点,YC看中的可能不只是技术本身。你的项目看起来很酷,说不定现在正是找投资的好机会,赶紧试着投投看吧!
0 回复

发表回复

支持 Markdown 格式