用 DeepSeek V4.1 Flash 跑了 21 亿 token 只花了 19 刀
在公司推 AI 落地的时候,大家最担心的就是 Token 成本,尤其是跑 Agent 这种需要反复读上下文、刷 Token 的场景。但我最近看的一组实测数据直接把这个成本逻辑给颠覆了,用 DeepSeek V4.1 Flash 处理了 21.5 亿个 token,最后 API 账单才 19.22 美金。
这里有个关键细节,不能只看总数,得看缓存命中率。在这次实测中,输入缓存命中率高达 99.30%。这意味着虽然 Agent 在处理海量上下文,但绝大部分是重复读取,并没有产生昂贵的新输入费用。折算下来,每处理 100 万个 token 的综合成本才 0.00892 美金。
这种成本结构直接改变了我们开发 Agentic Software Engineering(智能体软件工程)的思路。以前我们为了省钱,会拼命优化 Context 长度,或者精简 Prompt,但如果成本低到这个程度,我们可以让 Agent 像个真正的工程师一样,在整个项目的全量代码库里反复横跳,而不用担心账单爆炸。
这次实测的对象是一个叫 LovelaceSharp 的 C# 数值计算项目。在 9 月 10 日到 12 日这短短三天里,API 请求数达到了 12,253 次,总 Token 数 2,154,490,601 个。
最让我关注的不是这些数字,而是这 19 美金换回了什么。在之前的测试阶段,LovelaceSharp 已经实现了任意精度算术、优化的大整数算法、N 维数组、DSP、浏览器 IDE 等功能。但在这次低成本 Token 的支撑下,项目在 9 月 5 日之后又推进了 166 个 commit。
它居然直接搞出了一套原生的符号数学栈,而不是简单的 SymPy 封装。具体实现了的功能点非常硬核:
- 基于哈希共享(hash-consed)的不可变符号表达式 DAG
- 标准的加法、乘法和幂运算
- 精确的有理数算术
- 基于三值逻辑的假设处理
- 带有显式侧条件的条件重写
- 符号微分、极限、级数(包含 Laurent 行为)
- 符号积分、多项式算术、因式分解及无平方分解
- 实根隔离、方程求解及参数化解族
- Gröbner 基和多项式系统求解
- 符号矩阵、条件矩阵求逆与线性求解
- CSE 和 Horner 优化
- 复杂的符号/数值评估
- 一个名为 MathIR 的类型化计算中间表示
- 标量和向量化的编译评估
- 结构化结果类型(而非纯文本结果)
- 在 Studio 中进行符号检查
- 面向 Agent 的结构化执行协议
- 与 SymPy 的微分对比验证
- 以及围绕上述所有功能的完整正确性验证基础设施
在公司内部推 Agent 协作时,我经常提醒团队:不要把「实现了多少功能」作为 AI 编码的衡量标准,因为 LLM 极其擅长堆砌功能,但很容易写出没经过测试的垃圾代码。
真正的 Agent 生产力应该看「功能增长」与「验证增长」的比例。这次实测最强的地方在于,这 19 美金不仅买了功能的扩张,还同步扩张了验证这些功能的机器。当一个 Agent 能在极低成本下,一边写符号积分,一边同步写一套验证该积分正确性的基础设施时,这才是真正可落地的软件工程。
又是这种广告贴,赶紧告诉我这玩意儿能不能直接同步到 Notion?