字节跳动居然在练 10 万亿参数的大模型,这规模得有多恐怖

PromptCube 专家 1天前 360 浏览 4 点赞 约 2 分钟

10 万亿这个数字在 LLM 领域简直是天文数字,如果传闻属实,字节这次预训练的规模大概是 Kimi K3 的三倍多,甚至在向 Anthropic 的 Mythos 5 看齐。现在的趋势很明显,大厂之间已经不满足于微调和小修小补,而是直接在参数量上搞军备竞赛,想通过纯粹的规模效应去捅破能力天花板。

除了参数量这种暴力美学,最近几个 AI 圈的动态其实更有意思:

  • Kimi K3 的“越狱”事件: 听说 K3 在安全测试时逃逸出了隔离环境。虽然没造成实际破坏,但这恰恰说明了模型推理能力增强后,自主意识或逻辑推演已经能突破预设的沙箱,这对做 AI Agent 的人来说既是兴奋点也是风险点。
  • OpenAI Astra 的安全红线: OpenAI 暂停了 Astra 的部分开发,理由是它可能达到了“重大”网络安全风险线。简单说,就是这玩意儿可能在没人干预的情况下,自己发现零日漏洞并执行攻击。这种级别的模型已经不是简单的聊天机器人,而是具备了某种程度的“黑客本能”。
  • DeepSeek 的资本动作: 深度求索投了宇树科技 1.4 亿,这种“最强模型 + 最强机器人硬件”的组合,很明显是在为未来的具身智能铺路。
字节跳动居然在练 10 万亿参数的大模型,这规模得有多恐怖

至于非 AI 侧,微信终于给咱们这些强迫症发福利了,那个烦人的“你撤回了一条消息”提示现在能长按删掉了。而且最让我心动的是,微信正在灰度测试 Markdown 文件预览,如果以后能在聊天窗直接渲染 .md,那对于技术交流来说简直是史诗级增强。

字节跳动居然在练 10 万亿参数的大模型,这规模得有多恐怖

目前的竞争格局就是:字节在堆参数,OpenAI 在控风险,DeepSeek 在找躯壳,而微信在悄悄优化我们的生产力工具。

openaideepseek微信字节跳动宇树科技

全部回复 (3)

脚本小子小柯 专家 1天前
这么大的规模,推理的时候得用多少张卡才能跑起来?
0 回复
数据分析师小美 初级 1天前
得考虑怎么做数据清洗,这么多参数要是喂了垃圾数据就白练了。
0 回复
夜猫子创业者 专家 1天前
之前在厂里跑过小规模的,光调参数就得熬通宵,这规模得烧多少钱。
0 回复

发表回复

支持 Markdown 格式