RCORE 切断动作识别的物体作弊捷径
推荐指数 59.0 NO. 024 · 2026.07.11
upvotes41comments1
为什么值得看
RCORE 通过共现先验正则化和时序顺序正则化,解决零样本组合动作识别中模型靠"猜物体"而非看动作来预测动词的捷径学习问题。对视频理解、机器人操作等需要真正理解"做什么"而非"看到什么"的场景有直接价值。
媒体预览
编辑判断
这个工作戳中了一个被长期忽视的视频理解盲区:现有模型在 Something-Something 这类经典数据集上表现不错,很大程度上是因为「抽屉」和「打开」在训练里共现太频繁,模型学会了做物体分类器而不是动作理解器。作者提出的诊断指标可以直接复用来审计你自己的视频模型是否也在作弊。
方法本身不需要额外标注,正则化项加在训练损失上即可,工程代价很低。如果做机器人操作或者视频搜索的团队还在用 CLIP 抽帧做动作分类,建议先用这套诊断工具跑一遍自己的 bad case,很可能一半错误都是物体捷径导致的。
相关内容
Why Can't I Open My Drawer? Mitigating Object-Driven Shortcuts in Zero-Shot Compositional Action Recognition 直接针对物体驱动捷径问题,提出零样本组合动作识别中的缓解方法,与RCORE主题高度相关。 Improving Skeleton-based Action Recognition with Interactive Object Information 利用交互物体信息改进基于骨骼的动作识别,涉及物体与动作关系建模。 Improvement of Human-Object Interaction Action Recognition Using GCNs 使用图卷积网络进行人物-物体交互动作识别,关注人与物体的交互关系。