用六款模型跑了十组 SVG 生成测试发现现在的 LLM 确实进化了
这次测试的核心是看大模型写 SVG 代码的视觉还原能力,具体操作是把 30 个类似「画一只在操作管风琴的章鱼」这种具有挑战性的提示词喂给模型。这个测试源自 Simon Willison 在 2025 年 11 月和 12 月做的 pelican-riding-a-bicycle 基准测试。当时模型画出来的东西基本是乱码或极其简陋,但现在时隔九个月,新模型在处理这些复杂空间关系和形状描述时的能力有了明显提升。
现在的模型画 SVG 到底进步了多少
对比 2025 年底的那波结果,这次复测的体感非常明显。以前的模型在处理「骑自行车」或「操作乐器」这种涉及物体交互的场景时,生成的代码往往会导致图形重叠或完全丢失关键部件,而现在的模型能够更准确地通过坐标定义出物体的相对位置。
这次实测是直接在 OpenRouter 上运行的,选取了 6 个模型,每个模型跑 10 个提示词。在实际操作中,这 60 次请求一共花费了大约 20 美元。虽然没有把 30 个提示词全部跑完,但目前的样本量已经足以证明模型在代码生成精度上的跨越。
具体的测试成本与执行细节
如果你也想复现这个测试,或者想看看自己的模型在 SVG 绘图上处于什么水平,可以参考我的这次跑法。我是通过 OpenRouter 的统一接口调用的,这样方便快速切换模型对比,不需要一个个去申请 API Key。
- 测试规模: 6 个模型 × 10 个 Prompt
- 实际支出: 约 20 美元
- 测试内容: 包含类似
Generate an SVG of an octopus operating a pipe organ这种需要模型具备空间逻辑能力的指令。
关于 SVG 生成能力的个人判断
这种测试比单纯看 Benchmark 分数要有意思得多,因为 SVG 代码是可见的。如果模型在代码里写错了坐标,画面立刻就会崩掉,没有任何模糊地带。
从这次结果来看,LLM 对几何关系的理解在增强。如果你需要模型帮你生成一些简单的 UI 图标或者简单的示意图,现在可以大胆尝试了。但要注意,不同模型之间的差异依然巨大,有些模型能画出像样的章鱼,而有些模型可能还是在画一个奇怪的圆圈。
这次实测证明了模型迭代的速度非常惊人,九个月的时间足以让一个「完全不能用」的功能变成「勉强可用」甚至「相当惊艳」。
这得深挖一下它的数据集构成,感觉Gemini在处理代码逻辑时总有个奇怪的偏差……