9B模型主动清洗多模态数据
推荐指数 72.0 NO. 021 · 2026.06.24
upvotes65comments1
为什么值得看
DataClaw提出"Agentic Data Tailoring"范式,让模型主动从原始多模态流中提炼结构化数据,而非被动依赖人工规则或通用VLM标注。对苦于数据清洗成本高、质量差的AI团队,这可能是后训练阶段的关键基础设施。
媒体预览
编辑判断
当前业界处理原始多模态数据的主流做法是用 GPT-4V 或 Claude 做批量标注,成本高且无法捕捉视频/直播中的时序逻辑和深层程序性知识。DataClaw 的差异化在于把数据清洗本身变成可学习的智能体能力,用 SFT+GRPO 让 9B 小模型自主决定"哪些帧值得保留、如何重组叙事结构"。
论文提到在自有 benchmark 上做了验证,但未披露与商业 API 标注的成本对比和具体数据集规模。如果后续开源代码和训练数据,对做垂直领域视频理解(如自动驾驶、工业质检)的团队价值最大——这些场景的数据隐私性强,无法上传云端标注。