法律AI代理首个真实工作基准测试
推荐指数 62.0 NO. 004 · 2026.08.10
Stars769
为什么值得看
Harvey LAB 开源了一套评估 LLM 代理处理真实法律任务的基准,包含任务数据集和执行框架。法律是 AI Agent 落地的高价值场景,但此前缺乏贴近实际工作的评估标准,这个基准填补了空白。
A benchmark built to evaluate and improve agent capabilities for supporting legal work.
媒体预览
编辑判断
法律领域是 Agent 落地的黄金场景——高客单价、流程标准化、文档密集型,但之前大家评估法律 AI 要么用通用基准如 MMLU 的法律子集,要么自己造私有测试集,结果不可比。Harvey LAB 的关键价值在于任务设计来自真实律所工作流,不是简答题而是完整任务链。
跟 LegalBench 这类学术基准比,Harvey LAB 强调执行环境(execution harness),测的是端到端完成度而非单步准确率。做法律科技产品的团队可以直接用它做回归测试,避免每次模型升级都靠人工抽检。
最值得关注的隐含信号:Harvey 作为估值 7 亿美元的 AI 法律独角兽,选择开源基准而非闭源收费,说明法律 AI 赛道还在抢标准制定权阶段,谁先成为行业默认测试标准,谁就能影响客户采购决策。
Star History
生态分析
Beta
法律AI Agent领域首个开源评估基准,填补行业标准化评测空白。
独特价值:聚焦真实法律工作流,提供可执行的任务数据集与评测框架。