Anthropic 以 60 亿美元收购 Decart AI,或是抢下实时视频生成的赛道
关于 Anthropic 计划以 60 亿美元收购 Decart AI 的传闻,在圈内引发了不少热议。第一印象,这笔价格似乎有些过于诡异——在当前 AI 热潮下,一个专注于实时视频生成的创业公司身价被定在这个级别,确实透露着“泡沫之价”的色彩。然而,若我们将财务表现放在一边,转而关注技术路线的互补性,则会发现,这笔交易背后的逻辑并非简单地“买下团队”,而更像是抓住“实时视觉生成”这一关键的时间窗口。
现有的视频生成模型,不管是 Sora、Kling,抑或是其他玩家,大多采用“生成 → 等待 → 播放”的异步模式。换言之,用户输入 Prompt 后,模型在后台展开大规模的扩散运算,生成视频片段,然后等待数分钟之后才能进行播放。这种方式在制作短视频时并无问题,但要是将 AI 打造为真正实时的智能助理,这种延迟无疑难以接受。
Decart AI 的核心优势正在于它正试图突破传统扩散模型在效率上的桎梏,极限压缩推理延迟,使视频生成具备近似游戏引擎般的实时交互体验。这对于 Anthropic 而言颇为有利——Claude 系列模型以其逻辑严密、干净清新的特点广为人知,但在多模态视觉输出方面,一直缺少一个快速响应的闭环。
不妨设想一下:假如 Decart 的实时生成架构被融入到 Claude 的工作流程中,未来的交互形态将迎来一次质的飞跃。如今的多模态交互是这样的:用户发出指令 → Claude 理解 → 输出文字或静态图像。但在整合之后,可能演变成:用户发出指令 → Claude 实时渲染出一个动态场景。这种从 LLM 到实时视觉生成的闭环,远比在对话框中贴上几张预渲染图像要更具力量。
从实践层面来看,一旦这类能力被产品化,它就意味着 AI Agent 拥有了实时视觉反馈的能力。试想,当你让 AI 协助分析一个复杂的 3D 结构或演示某个动态流程时,它不再局限于发送一段提前录制的视频,而是像操作软件一样,在界面上即时为你生成动态演示画面。这种交互体验,有力地把 AI 从一个“聊天机器人”提升为真正的数字助理。
当然,60 亿美金这样的数字确实令人咂舌,但不可忽视的是,顶尖视觉人才的稀缺性。考虑到当前的竞争环境,自行研发一套达到实时级别的视频生成架构,其所需的时间成本与试错成本恐怕远非 60 亿美元能够涵盖。对 Anthropic 来讲,这笔收购或许是在购买一次“抢跑”的机会。只要它能迅速将 Decart 的技术落地并实现产品化,便可在多模态领域缓解部分竞争压力,因为它在视觉输出端多了一个不可忽视的“实时性”优势。
综上所述,若这笔收购最终敲定,它标志着 AI 竞争的焦点正在从单纯的“逻辑推理”转向“实时多模态交互”。当 LLM 的推理能力与实时视觉生成相结合,我们面对的将不会再是一个只会打字的对话框,而是一个能够实时视觉化反馈的智能体。
全部回复 (3)
想当场把话说完?进全球 AI 聊天室,登录就能开口。
这要是真能把实时视频塞进对话框,我得省掉多少录屏时间!