LAION 这次甩出的 1000 万小时视频数据集真的有点离谱
单纯看视频时长和规模,LAION 刚发布的这个 BVD (Big Video Dataset) 简直是在给现有的视频生成模型“喂核弹”。1000 万小时的运行时间,包含 8000 万个视频片段,其中还有 5500 万个自动生成的描述文本。这规模对比之前大家常用的 InternVid 简直是降维打击,实测数据直接显示,基于这个数据集训练出来的模型,在各项 Benchmark 上能比 InternVid 高出 2.1 个百分点。
下一篇
马斯克搞了个秘密铸造厂,打算靠自研涡轮叶片来加速能源布局? →
我之前一直觉得视频生成模型的瓶颈不在算力,而在高质量、带标注的视频数据。现在的 Sora 或者各种开源的 Video Diffusion 模型,数据来源大多比较模糊,或者规模根本没到这个量级。LAION 这种做法直接把开源社区的“弹药库”给填满了。
这里有个挺值得深挖的技术点,就是那 5500 万个 auto-described clips。视频训练最难的不是拿到画面,而是如何把画面和精准的文字描述对齐。如果这些自动描述的质量足够硬,那么对于构建更强的 Video-Language Understanding 模型或者是下一代视频生成工作流来说,简直是保姆级的素材库。
另外,关于版权这个敏感话题,LAION 这次似乎也准备好了应对策略。他们可能会引用 2024 年汉堡法院的一项判决,该判决倾向于允许为了非商业研究目的而收集受版权保护的内容。这在法律逻辑上给开源研究划出了一块相对安全的“无人区”,让研究人员可以不用担心因为大规模抓取数据而陷入版权泥潭。
对于想要复现高性能视频大模型或者做视频理解研究的同学来说,这个数据集的部署和清洗过程肯定是个体力活,但比起从零开始自己去爬数据,直接用这个现成的 BVD 显然是效率最高的路径。
免费 AI 工具箱 · 全部完全免费
AI工具与大模型实操经验整理在Claude实战技巧汇总,有不少直接可参考的案例。
