老黄这次在 X 上聊 Open Weights(开放权重)的逻辑其实
很多人觉得开源/开放权重就是为了抢市场,但从 Jensen 的视角看,这更像是一种构建生态的“护城河”策略。如果美国能主导开放权重的标准和主流模型,那么全球的开发者都会在这个体系里写代码、构建工作流,这本质上是在定义 AI 时代的“底层操作系统”。
从这个维度看,Open Weights 实际上是把 AI 的竞争从“谁的模型最强”转移到了“谁的生态最广”。当全球的开发者都在用这些权重做微调、跑实操的时候,谁定义了权重标准,谁就掌握了 AI 领导权。
我把这次讨论的核心逻辑拆解了一下,几个关键点值得深思:
1. 开放权重 $\neq$ 完全开源
这里得区分清楚,Open Weights 只是给了你模型参数,让你能本地部署、微调,但并不意味着训练数据、清洗逻辑和训练代码全部公开。这对企业级厂商来说是最高性价比的方案:既能通过社区的实战反馈快速迭代,又不需要交出最核心的“配方”。
2. 算力霸权的闭环
这是一个很现实的商业闭环:模型权重越开放 → 部署的人越多 → 对高性能 GPU 的需求量呈指数级增长 → NVIDIA 的 H100/B200 卖得越好。老黄支持开放权重,其实是在给自己的硬件寻找更多的应用场景。
3. 开发者的“路径依赖”
当一个开发者习惯了在某个开放权重模型(比如 Llama 系列)上构建 AI Agent 或 RAG 工作流时,迁移成本是非常高的。这种生态粘性比任何封闭的 API 接口都要强得多。
为了验证这种开放权重的实际部署成本,我前两天试着在本地用 vLLM 起了一个模型做量化对比,给想实操的朋友提供个参考配置(以 70B 规模模型为例):
# 使用 vLLM 部署量化模型,降低显存占用
python -m vllm.entrypoints.openai.api_server \
--model meta-llama/Meta-Llama-3-70B \
--quantization awq \
--tensor-parallel-size 4 \
--gpu-memory-utilization 0.9 \
--max-model-len 4096实测踩坑点:
- 显存溢出: 很多人直接跑 FP16,结果 80G 的 A100 瞬间爆掉。建议必须上 AWQ 或 GPTQ 量化,显存占用能直接砍掉一半以上,而推理精度在大多数实战场景下几乎没感知。
- KV Cache 瓶颈: 如果
max-model-len设得太高,会导致可用显存被预分配光,建议根据实际 Token 需求精准设置,否则会频繁报OutOfMemory错误。
从这个维度看,Open Weights 实际上是把 AI 的竞争从“谁的模型最强”转移到了“谁的生态最广”。当全球的开发者都在用这些权重做微调、跑实操的时候,谁定义了权重标准,谁就掌握了 AI 领导权。
这种策略比单纯搞一个封闭的 GPT-4 要聪明得多,因为它把全球的算力资源和人才都变成了自己的“免费测试员”。
事件追踪 · 相关报道
Fly.
1小时前
给本地磁盘做一次全盘扫描,结果被 Codex 翻出了所有隐藏的凭据
2小时前
权重开放才是大模型竞争的真底牌
3小时前
裁员2.1万人换AI预算,Oracle这波操作太激进
3小时前
Flux 3 X Mimic 实操:视频动作模型怎么玩
7小时前
模型蒸馏水太深
10小时前