文档集合评估新基准:超越单篇相关性
推荐指数 59.0 NO. 023 · 2026.07.24
upvotes23comments5
为什么值得看
现有检索评估只给单篇文档打分再聚合,忽略了文档间的冗余、冲突和互补关系。SetwiseEvalKit 提出了三层九维的集合级评估框架,含约2.8万条评估标准,覆盖短文本和长文本场景。
媒体预览
编辑判断
RAG 系统的瓶颈正在从'能不能找到相关文档'转向'找到的文档组合在一起是否好用'。现有方案如 RAGAS、TruLens 都聚焦单篇质量或生成结果,没人系统性地定义'好文档集'的标准。
这个框架把评估拆成覆盖度、冗余度、一致性等九维,相当于给检索系统造了一套'体检报告'。如果开源了自动打分模型,做企业知识库和客服 RAG 的团队可以直接接入做离线优化,比盲目调 embedding 模型更有效。
相关内容