用 DeepSeek V4.1 Flash 跑了 21 亿 token 只花了 19 刀

阿Max爱学习 初级 1小时前 357 浏览 1 点赞 约 2 分钟

在公司推 AI 落地的时候,大家最担心的就是 Token 成本,尤其是跑 Agent 这种需要反复读上下文、刷 Token 的场景。但我最近看的一组实测数据直接把这个成本逻辑给颠覆了,用 DeepSeek V4.1 Flash 处理了 21.5 亿个 token,最后 API 账单才 19.22 美金。

这里有个关键细节,不能只看总数,得看缓存命中率。在这次实测中,输入缓存命中率高达 99.30%。这意味着虽然 Agent 在处理海量上下文,但绝大部分是重复读取,并没有产生昂贵的新输入费用。折算下来,每处理 100 万个 token 的综合成本才 0.00892 美金。

这种成本结构直接改变了我们开发 Agentic Software Engineering(智能体软件工程)的思路。以前我们为了省钱,会拼命优化 Context 长度,或者精简 Prompt,但如果成本低到这个程度,我们可以让 Agent 像个真正的工程师一样,在整个项目的全量代码库里反复横跳,而不用担心账单爆炸。

这次实测的对象是一个叫 LovelaceSharp 的 C# 数值计算项目。在 9 月 10 日到 12 日这短短三天里,API 请求数达到了 12,253 次,总 Token 数 2,154,490,601 个。

最让我关注的不是这些数字,而是这 19 美金换回了什么。在之前的测试阶段,LovelaceSharp 已经实现了任意精度算术、优化的大整数算法、N 维数组、DSP、浏览器 IDE 等功能。但在这次低成本 Token 的支撑下,项目在 9 月 5 日之后又推进了 166 个 commit。

它居然直接搞出了一套原生的符号数学栈,而不是简单的 SymPy 封装。具体实现了的功能点非常硬核:

  • 基于哈希共享(hash-consed)的不可变符号表达式 DAG
  • 标准的加法、乘法和幂运算
  • 精确的有理数算术
  • 基于三值逻辑的假设处理
  • 带有显式侧条件的条件重写
  • 符号微分、极限、级数(包含 Laurent 行为)
  • 符号积分、多项式算术、因式分解及无平方分解
  • 实根隔离、方程求解及参数化解族
  • Gröbner 基和多项式系统求解
  • 符号矩阵、条件矩阵求逆与线性求解
  • CSE 和 Horner 优化
  • 复杂的符号/数值评估
  • 一个名为 MathIR 的类型化计算中间表示
  • 标量和向量化的编译评估
  • 结构化结果类型(而非纯文本结果)
  • 在 Studio 中进行符号检查
  • 面向 Agent 的结构化执行协议
  • 与 SymPy 的微分对比验证
  • 以及围绕上述所有功能的完整正确性验证基础设施

在公司内部推 Agent 协作时,我经常提醒团队:不要把「实现了多少功能」作为 AI 编码的衡量标准,因为 LLM 极其擅长堆砌功能,但很容易写出没经过测试的垃圾代码。

真正的 Agent 生产力应该看「功能增长」与「验证增长」的比例。这次实测最强的地方在于,这 19 美金不仅买了功能的扩张,还同步扩张了验证这些功能的机器。当一个 Agent 能在极低成本下,一边写符号积分,一边同步写一套验证该积分正确性的基础设施时,这才是真正可落地的软件工程。

工作流AI落地DeepSeek V4.1 FlashLovelaceSharpMathIR

全部回复 (3)

前端大山 专家 1小时前

又是这种广告贴,赶紧告诉我这玩意儿能不能直接同步到 Notion?

0 回复
脚本小子阿强 初级 58分钟前

这种快餐工具真能扛住高并发?要是请求量过万估计直接崩给你看。

0 回复
阿Sam的日常 高级 54分钟前

这账单怎么看怎么离谱,缓存命中率这么高,你这 Prompt 难道全是重复的垃圾话?

0 回复

发表回复

支持 Markdown 格式