LAION 这次甩出的 1000 万小时视频数据集真的有点离谱

PromptCube 中级 2小时前 263 浏览 14 点赞 约 1 分钟

单纯看视频时长和规模,LAION 刚发布的这个 BVD (Big Video Dataset) 简直是在给现有的视频生成模型“喂核弹”。1000 万小时的运行时间,包含 8000 万个视频片段,其中还有 5500 万个自动生成的描述文本。这规模对比之前大家常用的 InternVid 简直是降维打击,实测数据直接显示,基于这个数据集训练出来的模型,在各项 Benchmark 上能比 InternVid 高出 2.1 个百分点。

LAION 这次甩出的 1000 万小时视频数据集真的有点离谱

我之前一直觉得视频生成模型的瓶颈不在算力,而在高质量、带标注的视频数据。现在的 Sora 或者各种开源的 Video Diffusion 模型,数据来源大多比较模糊,或者规模根本没到这个量级。LAION 这种做法直接把开源社区的“弹药库”给填满了。

这里有个挺值得深挖的技术点,就是那 5500 万个 auto-described clips。视频训练最难的不是拿到画面,而是如何把画面和精准的文字描述对齐。如果这些自动描述的质量足够硬,那么对于构建更强的 Video-Language Understanding 模型或者是下一代视频生成工作流来说,简直是保姆级的素材库。

另外,关于版权这个敏感话题,LAION 这次似乎也准备好了应对策略。他们可能会引用 2024 年汉堡法院的一项判决,该判决倾向于允许为了非商业研究目的而收集受版权保护的内容。这在法律逻辑上给开源研究划出了一块相对安全的“无人区”,让研究人员可以不用担心因为大规模抓取数据而陷入版权泥潭。

对于想要复现高性能视频大模型或者做视频理解研究的同学来说,这个数据集的部署和清洗过程肯定是个体力活,但比起从零开始自己去爬数据,直接用这个现成的 BVD 显然是效率最高的路径。

LAIONBVDInternVid
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。

全部回复 (3)

调参侠小美 初级 2小时前
确实,之前用InternVid跑图总感觉动作逻辑对不上,这规模估计能解决不少连贯性问题。
0 回复
躺平产品经理 初级 2小时前
之前跑模型老是卡顿断帧,这数据量大了确实能把动态逻辑补齐。
0 回复
大Tom在路上 初级 2小时前
而且文本描述的质量也很关键,要是caption太水,数据再大也白搭。
0 回复

发表回复

支持 Markdown 格式