LAION-BVD 现已发布,旨在通过提供大规模的开放获取视频数据集,使多模态研究平民化。从历史上看,此类资源仅限于专有技术公司使用,这阻碍了独立的科学探索和可复现性。该数据集旨在促进视频、音频和图像模型在开发与评估过程中的透明度。 LAION-BVD 仅供非商业性学术研究使用。鼓励研究人员优先考虑伦理使用,尊重内容创作者的权利,并遵守所有适用法律。用户还必须考虑到该数据集固有的局限性,包括潜在的偏见、刻板印象以及全球代表性不均衡等问题。由于基于此数据训练的模型可能会继承这些缺陷,研究人员有责任在报告研究结果的同时,对这些问题进行严谨的评估与说明。
本摘要概述了 **Linum v3** 数据流水线的演进过程,重点介绍了从脆弱的手动启发式方法向高性能、模型驱动的筛选机制的转变。
作者强调,模型的质量从根本上取决于其训练数据;高质量数据能让模型高效学习,而低质量数据只会浪费算力。其方法经历了三个阶段:
1. **2024 年(启发式方法):** 依赖基于 CPU 的计算机视觉(如 PySceneDetect、Haar 级联分类器)和 H.264 运动矢量。这种方法成本低廉,但过于脆弱、难以解释,且缺乏处理复杂视频概念所需的精度。
2. **2025 年初(微调大模型):** 摒弃人工规则,转而使用经过监督微调(SFT)的视觉语言模型(如 Qwen-2-VL)。通过利用数千个 GPU,他们高效处理了数十亿帧数据,取得了显著更好的效果。
3. **2025 年末(RLVR):** 采用带有可验证奖励的强化学习(RLVR)来训练美学评分器。与标准 SFT 相比,这种“手术式”的方法能够更精细地控制数据质量。
最终,Linum 流水线将数十亿个样本精炼为高质量数据集。其核心经验是:**数据筛选是提升模型性能最关键的杠杆。** 应避免使用“廉价”的启发式方法,并投入资源进行高质量、迭代式的模型驱动筛选,以确保模型有效学习。