LLM 链上推理专用评测集
推荐指数 69.0 NO. 008 · 2026.05.06
Stars147创建1 天前Forks100Issues0
为什么值得看
ChainReason 是首个针对以太坊和 DeFi 场景的 LLM 推理评测套件,覆盖协议机制理解、合约漏洞识别、交易意图推断等 5 类任务。对做链上 AI Agent、审计工具或量化策略的团队来说,终于有一个能测模型"真懂不懂链"的 benchmark 了。
A benchmark for evaluating LLM reasoning on Ethereum and DeFi tasks
编辑判断
之前测 LLM 链上能力,大家要么用通用代码 benchmark 如 HumanEval,要么自己攒私有测试集,结果不可比、场景也不真实。ChainReason 的聪明之处在于把 DeFi 分析师的日常活拆解成 5 个可自动评分的原子任务,特别是 AMM 计算和交易意图推断这两类,直接对应 MEV bot、审计 Agent 的核心能力缺口。
跟 EleutherAI 的 LM Evaluation Harness 或 BigCode 的评测相比,它不是泛用框架而是垂直场景的深度定制,更适合做链上 Agent 的「准入考试」。如果你在做加密领域的 AI 工具,建议直接拿它筛模型,比看通用排行榜靠谱得多。
Star History
生态分析
Experimental
首个专注以太坊与DeFi场景的LLM推理评测基准,填补链上AI能力评估空白。
独特价值:唯一覆盖协议机制、漏洞识别、交易意图等链上专属推理任务的评测套件。