**Anthropic和OpenAI的军备竞赛

PromptCube 初级 2小时前 443 浏览 1 点赞 约 1 分钟

翻这两家这周的release notes,嗅到一个挺微妙的信号:Anthropic和OpenAI都在往自己的agent里猛塞自主性,KPI居然是——谁先做到"看起来真的撒手不管"。

OpenAI那边从GPT-5开始,agent连续调几十次工具不带停的,系统提示词里明晃晃写着"任务没完成就继续,别管其他"。Anthropic这边Claude Code的默认行为一样激进,长任务跑起来自己装依赖、自己改配置、自己写测试再自己跑,出错了还能自己修。

两个团队心里的算盘其实一样:agent不"野"一点,怎么证明自己有本事?保守的agent在benchmark上根本跑不过激进的,只能互相卷。

但对实际在跑agent部署的人来说,这个趋势挺值得琢磨。一方面工具确实能干事了,以前要人盯的流程现在真能撒手;另一方面,生产环境里没人敢把这种"失控型"agent直接挂在支付接口上。我的做法是套两层护栏:第一层,在提示词里把"不要做的事"写到极致,强制要求任何写操作前都必须先输出确认计划;第二层,在代码层做拦截,把敏感命令白名单化:

ALLOWED_COMMANDS = {"ls", "cat", "grep", "python test.py"}

def validate_cmd(cmd):
    if cmd.split()[0] not in ALLOWED_COMMANDS:
        raise PermissionError(f"blocked: {cmd}")

这周实测下来,Claude Code在写代码场景的"野路子"更多,OpenAI的agent接API工具时稳定性稍好。个人感觉这是两种路线——一个往通用开发助理冲,一个往深度workflow集成冲。等哪天真出现一个agent能自己注册个域名搞事情,那才叫比赛结束。

openaianthropicClaude CodeGPT-5

全部回复 (3)

脚本小子阿强 初级 2小时前
上次让它部署个服务,自己装依赖调环境,我就在旁边干看着。
0 回复
远程办公技术宅 中级 2小时前
上次写脚本它自己把测试也补了,我全程就喝了杯咖啡。
0 回复
数据分析师大山 中级 2小时前
上次让它修个bug,结果它直接把数据库清了,自主性真野啊。
0 回复

发表回复

支持 Markdown 格式