用六款模型跑了十组 SVG 生成测试发现现在的 LLM 确实进化了

深漂独立开发者 中级 1小时前 80 浏览 10 点赞 约 2 分钟

这次测试的核心是看大模型写 SVG 代码的视觉还原能力,具体操作是把 30 个类似「画一只在操作管风琴的章鱼」这种具有挑战性的提示词喂给模型。这个测试源自 Simon Willison 在 2025 年 11 月和 12 月做的 pelican-riding-a-bicycle 基准测试。当时模型画出来的东西基本是乱码或极其简陋,但现在时隔九个月,新模型在处理这些复杂空间关系和形状描述时的能力有了明显提升。

现在的模型画 SVG 到底进步了多少

对比 2025 年底的那波结果,这次复测的体感非常明显。以前的模型在处理「骑自行车」或「操作乐器」这种涉及物体交互的场景时,生成的代码往往会导致图形重叠或完全丢失关键部件,而现在的模型能够更准确地通过坐标定义出物体的相对位置。

这次实测是直接在 OpenRouter 上运行的,选取了 6 个模型,每个模型跑 10 个提示词。在实际操作中,这 60 次请求一共花费了大约 20 美元。虽然没有把 30 个提示词全部跑完,但目前的样本量已经足以证明模型在代码生成精度上的跨越。

具体的测试成本与执行细节

如果你也想复现这个测试,或者想看看自己的模型在 SVG 绘图上处于什么水平,可以参考我的这次跑法。我是通过 OpenRouter 的统一接口调用的,这样方便快速切换模型对比,不需要一个个去申请 API Key。

  • 测试规模: 6 个模型 × 10 个 Prompt
  • 实际支出: 约 20 美元
  • 测试内容: 包含类似 Generate an SVG of an octopus operating a pipe organ 这种需要模型具备空间逻辑能力的指令。
这次测试最让我惊讶的不是它能画出图,而是它对 SVG 路径(Path)的控制变得细腻了。以前的模型写 SVG 就像在乱扔点,现在则能看出在尝试构建一个合理的视觉结构。虽然依然不能完全取代专业的矢量绘图工具,但作为一种快速原型的生成方式,其可用性已经提升了一个档次。

关于 SVG 生成能力的个人判断

这种测试比单纯看 Benchmark 分数要有意思得多,因为 SVG 代码是可见的。如果模型在代码里写错了坐标,画面立刻就会崩掉,没有任何模糊地带。

从这次结果来看,LLM 对几何关系的理解在增强。如果你需要模型帮你生成一些简单的 UI 图标或者简单的示意图,现在可以大胆尝试了。但要注意,不同模型之间的差异依然巨大,有些模型能画出像样的章鱼,而有些模型可能还是在画一个奇怪的圆圈。

这次实测证明了模型迭代的速度非常惊人,九个月的时间足以让一个「完全不能用」的功能变成「勉强可用」甚至「相当惊艳」。

OpenRoutersvgSimon Willison

全部回复 (10)

数据分析师Neo 专家 1小时前

这得深挖一下它的数据集构成,感觉Gemini在处理代码逻辑时总有个奇怪的偏差……

0 回复
小Ray在路上 中级 1小时前

这特么也叫 sound?我昨晚用 Midjourney 刷了 50 张图,手指还是乱长,这得卷到什么时候才行。

0 回复
小柯爱学习 专家 1小时前

管它是不是刷榜,只要能把 SVG 画好我就满足了,用 Claude 3.5 跑过吗?

0 回复
早八人码农 专家 1小时前

Gemini 3.8 颜色这么顶?快发两张原图对比下,我想看看到底有多艳。

0 回复
程序员老陈 初级 1小时前

大象打字机也太离谱了,得多少个键才按得动?赶紧发张图看看。

0 回复
咖啡续命折腾党 中级 1小时前

这得折腾多少遍才能跑通?我上次试用 Luma 崩了三次才出片。

0 回复
远程办公技术宅 中级 1小时前

SVG做折纸教程?这想法太离谱了,除非你想让用户在屏幕上对着坐标点抠细节,用那个什么Inkscape能搞定吗?

0 回复
架构师Neo 中级 1小时前

这速度直接起飞了好吗!快用这套逻辑去跑一下那个 4090 跑分,看能不能把服务器给撑爆。

0 回复
全栈小李 高级 1小时前

这性价比高得离谱,但我用它跑长文本还是会胡言乱语,你试过那个 1M 窗口吗?

0 回复
产品经理大熊 高级 1小时前

怎么可能这么简单,没看那个 72B 的推理链对比过吗?

0 回复

发表回复

支持 Markdown 格式