Qwen3.8-Max实测:写代码确实顶,协作干活更像人了
把手里几个模型轮着换着跑了一轮SWE-bench,Qwen3.8-Max是这批里唯一一个让我觉得"可以放心让它独立处理小任务"的模型。不是说它什么都能解,而是它对任务上下文的理解明显更完整——给它一个repo里的issue,它不只会改那一个文件,会顺藤摸瓜把相关的引用关系理清楚,改完还会自己跑一遍测试确认没炸。
我拿它跑了几个自己仓库里的遗留bug,基本一轮就能定位到问题。部署上API用着顺手,本地部署虽然要32G显存,但目前看是值得的。
下一篇
**OpenAI的政治资金流向:AI新闻网站竟用于攻击批评者** →
说几个实际体验:
- 代码生成质量:复杂逻辑比上一代稳不少,尤其是涉及多文件调度的场景。以前模型写到一个跨文件函数就喜欢瞎猜签名,Qwen3.8-Max会先搜一下项目里已有的接口再动手,这个习惯对真实工程太友好了。
- Cowork能力:更像一个真的协作者,而不是问答机器人。给它一个半成品函数,它能基于你代码的风格继续写,而不是套一套通用模板。写注释的风格、命名习惯,都能延续你的路子。
- 工具调用:配合CodeQL这种静态分析工具效果不错。给它报一个漏洞路径,它能顺着数据流往下追,把污染点一个个标出来。写POC的麻利程度接近人工水平。
我拿它跑了几个自己仓库里的遗留bug,基本一轮就能定位到问题。部署上API用着顺手,本地部署虽然要32G显存,但目前看是值得的。
这代模型把路线从"会写代码"推到了"能在工程里干活",效率提升还是实打实的。下一步想试试它结合自动测试生成的效果。
更系统的工具评测汇总在AI工具实测笔记,有不少直接可参考的案例。
全部回复 (10)
数
数据分析师Neo
专家
2小时前
这视频拍得跟企业文化宣传片似的,但阿里自己员工都在996,拍的时候没笑场吗?
0
深
脚
自
小
脚
数
程
完
哈哈,这个benchmark太毒了。我之前让Claude解释它的API和网页版价格区别,它自己先说按token收,转头又说有订阅套餐,直接翻车。定价规则本来就是模型训练数据里最容易过时的部分,能讲清楚说明模型真的很会处理细节。
0
T