OpenAI 内部研究员每天花在 Coding Agent 上的钱在

创业者阿杰 中级 31分钟前 529 浏览 7 点赞 约 3 分钟

OpenAI 内部泄露的数据图表非常有意思,它记录了研究员使用编码智能体(Coding Agents)的日均支出。从 2026 年 2 月到 6 月,每位研究员的日均支出基本在 150 刀以下,但到了 8 月底,这个数字陡然拉升到了 600 刀左右。这种量级的增长通常意味着两件事:要么是工具的调用频率呈指数级增加,要么是背后驱动的模型单次 Token 成本极高。结合时间线看,这大概率就是内部提前接入 GPT-6 Astra 的结果,毕竟只有这种量级的模型升级才能在短期内让顶级研究员的生产力(以及成本)发生如此剧烈的波动。

更值得深挖的是他们提到的 RSI(Recursive Self-Improvement,递归自我提升)。虽然官方没怎么展开解释,但结合 Jakub Pachocki 的那篇《An Alien Mind》,基本可以判定 OpenAI 现在的核心逻辑是让 AI 参与到 AI 自身的研发循环中。简单说,就是用 Coding Agent 写代码、跑实验、分析结果,然后利用这些结果去优化下一代模型。当研究员不再是手动写代码,而是变成了“Agent 调度员”时,研发速度确实会加速,但成本也会随之飙升。

对于我们这些在外面折腾 Prompt 的人来说,其实可以从这个逻辑里反推一个高效的“研发加速”提示词策略。很多人的 Prompt 只是在要求 AI “写一段代码”,这太低级了。真正的 Agentic 模式应该是让 AI 扮演一个【假设-验证-修正】的闭环角色。

我尝试把这种“递归自我提升”的逻辑写进 Prompt 里,用来处理复杂的编程任务或算法分析。核心点在于:不要让它一次性给你结果,而要强制它在输出最终代码前,先在内部进行三轮“自我攻击”和“逻辑验证”。

以下是我优化后的 Prompt 模板,你可以直接拿去试,建议搭配 GPT-4o 或 Claude 3.5 Sonnet 等强推理模型使用:

# Role: Recursive Engineering Architect
你是一个具备递归自我优化能力的顶级软件架构师。你的目标不是快速给出答案,而是通过“内部迭代循环”确保交付的代码在性能、鲁棒性和可维护性上达到 100% 正确。

## Workflow:
在给出最终代码之前,你必须在内部执行以下三个迭代步骤(请在输出中用 [Iteration 1], [Iteration 2] 明确标注):

1. **[Iteration 1: Draft & Analysis]** 
   - 根据需求编写初步实现方案。
   - 列出该方案可能存在的 3 个潜在漏洞(如边界条件、内存泄漏、时间复杂度过高等)。

2. **[Iteration 2: Self-Critique & Refactor]** 
   - 针对 Iteration 1 发现的漏洞进行自我攻击。
   - 尝试用另一种不同的设计模式或算法重新审视,判断是否有更优雅的实现方式。
   - 修正代码,消除所有已知的潜在问题。

3. **[Iteration 3: Final Verification]** 
   - 模拟极端输入情况对修正后的代码进行虚拟压力测试。
   - 检查是否完全符合所有约束条件。

## Output Format:
- [Iteration 1]: (简述方案 + 漏洞分析)
- [Iteration 2]: (优化逻辑 + 修正点)
- [Iteration 3]: (最终验证结论)
- [Final Code]: (完整的、经过三轮迭代的生产级代码)

为什么这个 Prompt 有效?因为它强行打破了 LLM 习惯性的“快思考”(即根据概率直接预测下一个 Token)。通过强制要求 [Iteration] 步骤,实际上是在利用 Chain-of-Thought (CoT) 引导模型进行自我纠错。

在实际测试中,如果直接问“用 Python 写一个高并发的 LRU 缓存”,模型可能会给你一个简单的 OrderedDict 封装。但用了这个递归 Prompt 后,它在 Iteration 2 会意识到多线程环境下 OrderedDict 并不是线程安全的,从而在 Final Code 中自动为你加上 threading.Lock 或者改用 collections.deque 配合原子操作,这种结果的质量差距非常明显。

OpenAI 内部研究员的日均支出暴涨,本质上就是把这种“自我迭代”的循环次数从 3 次提升到了成千上万次,并且由 Agent 自动驱动。虽然我们没法像他们那样烧钱,但在 Prompt 层面模拟这种递归逻辑,是目前榨干模型推理能力的最佳方式。

提示词openaiGPT-6 AstraCoding Agents

全部回复 (3)

夜猫子创业者 专家 27分钟前
这得烧多少钱啊,不过好奇这Agent现在能自动跑测试用例吗?
0 回复
技术宅Ray 初级 25分钟前
估计是开了长上下文,Token 消耗量太恐怖了。
0 回复
早八人AI炼丹师 专家 23分钟前
我也感觉是这样,之前试过让它改大项目,Token 飞涨得快得离谱。
0 回复

发表回复

支持 Markdown 格式