用 vivago R1 跑了一次赛博西游
之前大家对 AI 视频的认知还停留在“抽卡”阶段,运气好能刷出一个惊艳的 5 秒镜头,但想让几个镜头连起来讲个故事,基本就得靠创作者在 ComfyUI 这种复杂的节点图里死磕。直到我试了下全球上线的 vivago R1(国内版叫「够搭」),这玩意儿最核心的突破在于它把创作路径从“调参数”变成了“对话”,而且能稳定输出 3 到 5 分钟的视频,这在目前的 AI 视频工具里非常少见。
我直接给它投喂了一个设定:2099 年,一个叫“悟空”的原始数据在废弃中心苏醒,试图在赛博新长安城上传真经。视觉风格要求是“敦煌壁画遇上银翼杀手”。
最让我意外的是它的工作流逻辑。你输入创意后,它会自动匹配一个 Cinematic Story Director(电影故事导演)角色,先帮你把完整的分镜脚本和关键帧画面全部生成出来。这个过程是在一个 Chat 窗口和画布并行完成的:左边对话,右边出图。你得先确认脚本方向,它才会开始跑视频。这种“脚本 → 分镜 → 成片”的逻辑,其实就是把传统影视工业的链路给 Agent 化了。
在实测过程中,有两个细节值得深挖:
- 视觉一致性(Consistency): 很多模型跑长视频最怕的是“跳戏”,同一个角色换个场景就换了张脸。但在这次赛博西游的测试里,悟空额头上的金色电路纹路和琥珀色瞳孔在多个镜头里居然保持了极高的辨识度,冷蓝色调与暖金色的对比色也贯穿全片,没有出现那种随机的风格漂移。
- 复杂场景的稳定性: 像“新长安城全景”这种细节密度极高的画面,通常是 AI 最容易崩的地方,很容易出现物体扭曲或逻辑错误,但 R1 处理出来的画面细节相当扎实,基本达到了概念短片的标准。
Story Ad Director,在生成过程中,产品包装的还原度相当高,没有出现 AI 经常把 Logo 字母写错的低级问题。
另外,它对互联网“暗号”的理解能力有点意思。我输入了一段关于“噜妹”的谐音梗,它居然先通过 Websearch 检索这个梗的来源,然后再生成带有情绪转折的视频,而不是死板地执行文字指令。
最实用的一点是它的资产库(Asset Library)功能。AI 视频最痛苦的就是每次都要重新描述角色,但 R1 允许你把生成满意的人物形象或场景(比如我那个赛博天机塔)直接保存到资产库,在接下来的创作中直接调用,不用再通过 Prompt 祈祷它能生成一个长得一样的人。
对于想深度折腾的人,它现在开放了 CLI 命令行交互模式,这意味着你可以脱离网页端,直接通过终端调用视频生成和参数配置,这对开发者非常友好。
# 假设的 CLI 调用逻辑(具体参考官方文档)
vivago-cli generate --prompt "Cyberpunk Chang'an city, 8k, cinematic lighting" --asset-id "悟空_v1" --duration 5s
总的来说,vivago R1 试图解决的是“模型能力”与“作品交付”之间的 Gap。之前的工具是给你一把好锤子,但得你自己知道怎么盖房子;而 R1 是给了你一个懂建筑的工头,你只要说出想要的房子样子,它帮你协调全流程。这种从“单镜头生成”到“完整作品交付”的转变,才是 AI 视频真正进入生产力的标志。

对话调细节太爽了,比在参数表里死磕好用一百倍!