别被模型单价给骗了,GPT-6 Astra 的低推理档位其实更省钱
我关注到了一个对比实验,测试目标很简单,就是让模型生成一张“骑自行车的鹈鹕”SVG 图像。在这个任务中,GPT-5.6 Sol 和 GPT-6 Astra 的表现拉开了巨大的代差。最让人惊讶的是,GPT-6 Astra 在 low 档位(最低推理等级)产出的图像质量,竟然直接碾压了 GPT-5.6 Sol 在 max 档位(最高推理等级)跑出来的结果。
在 SVG 这种对坐标和形状逻辑要求极高的任务里,GPT-5.6 Sol 即使把推理等级拉满,画出来的东西依然像是一堆随机抽象形状的堆砌,根本看不出是只鸟。而 Astra 表现得极其稳健,从 low 到 xhigh 的每一个档位,画出来的东西都像个正经的鹈鹕。当然,低推理档位依然有逻辑缺陷,比如 Astra 在非 max 档位时,偶尔会把鹈鹕的腿画在车架的同一侧,但整体构图的正确率已经远超前代。
这里最值得深挖的是成本与 Token 消耗的诡异关系。从账面价格看,Astra 确实贵得多:输入 10 美元/百万 token,输出 50 美元/百万 token;而 Sol 只有 5 美元和 30 美元。但实际运行数据却揭示了另一个真相:Astra 的编码效率极高,导致它在处理同一个 prompt 时消耗的 Token 数量远少于 Sol。
具体的细节数据是这样的:在这次测试中,Astra 和 Luna 的输入 Token 数全部是 16 个,而 Sol 和 Terra 却用了 26 个。这意味着不同模型在处理同一指令时的 Token 编码效率完全不同。算下来,用 Astra 的 low 档位生成一个质量远超 Sol 的鹈鹕,实际成本仅为 9.55 美分。
这打破了很多人对“贵模型 = 贵成本”的固有认知。在某些特定任务上,虽然 Astra 的单价高,但因为它逻辑更强、Token 消耗更低,实际花费反而更少,且结果好得多。而且从 Token 消耗模式几乎一模一样这一点来看,我猜测 Astra 和 Luna 在底层架构上的相似度可能比官方承认的要高得多。
这次对比给我的最大启发是,新一代模型的“底线”能力已经全面超过了前代模型的“天花板”。对于需要精确控制形状的 SVG 绘图这种任务,盲目追求 max 推理其实是浪费。如果你现在有 Astra 的权限,建议在尝试复杂任务时先从 low 或 medium 档位试起,因为在这种跨代压制面前,低档位的性价比才是最高的。