Opus 5实测:代码能力提升明显,但离Fable 5还有差距
Opus 5终于落地的第一感觉是:Anthropic这次在代码逻辑上的补齐速度比预期快。很多之前在Claude 3.5 Opus或者Sonnet上跑不通的复杂递归逻辑,在Opus 5里一次性跑通的概率显著提高了。
下一篇
我的Meta AI突然能读日程了,这波更新有点意思 →
我专门用一个涉及多文件依赖的重构任务做了压力测试,之前用旧版模型处理这种跨文件的上下文引用时,经常会出现变量名幻觉或者丢失函数定义的情况,导致编译报错。这次尝试让它重构一个约 400 行的 TypeScript 模块,要求将原有的同步请求全部改为异步处理并增加错误捕获机制。
实测结果是,Opus 5生成的代码在语法正确率上达到了 95% 以上,且能够精准识别出三个潜在的竞态条件(Race Condition),这是之前版本经常忽略的细节。
不过,官方提到的“接近Fable 5能力”这句话得打个问号。如果你用过之前的Mythos类模型,就会发现Opus 5在处理极高维度的逻辑推理时,依然存在某种程度的“保守”。
为了验证这个结论,我尝试运行一个复杂的逻辑悖论推演任务,配置参数如下:
{
"model": "claude-opus-5",
"temperature": 0.2,
"max_tokens": 4000,
"system_prompt": "Act as a senior formal verification engineer. Analyze the following logical contradictions in the provided codebase."
}在处理这种深层逻辑推演时,Opus 5的响应速度大约在 3.2 秒/token,虽然比之前的版本快,但在处理到第三层嵌套逻辑时,它开始出现典型的“妥协式回答”,即倾向于给出一个通用答案而非深挖矛盾点。而Fable 5在那类任务中表现出的那种近乎直觉的穿透力,在Opus 5身上还没有完全体现出来。对于开发者来说,这次更新最实操的增量在于对复杂工程的把控。如果你在做大型项目的迁移或重构,Opus 5可以作为一个非常强力的辅助。但如果你追求的是那种能够独立完成复杂架构设计、具备极强前瞻性的推理,可能还是得期待Fable 5及其衍生能力的进一步下放。
目前在部署工作流时,我建议的组合方案是:用Sonnet处理常规的UI组件编写,而将涉及核心业务逻辑、算法优化或底层Bug排查的任务交给Opus 5。这种分工能最大化利用 token 成本和响应速度。
全部回复 (2)
大
大鹏的日常
初级
12小时前
确实强了,我拿它写个复杂的正则表达式居然一次就对了,之前得调好几次。
0
老
