AMAZINGINDEX.COM 日报快照
58.4
VOL. 2026.05
2026.05.06
← 返回 2026.05.06 日报
日报快照 · Daily Snapshot
NO. 008

LLM 链上推理专用评测集

#REPO GitHub Search 2026.05.06
推荐指数 69.0 NO. 008 · 2026.05.06
Stars147创建1 天前Forks100Issues0

ChainReason 是首个针对以太坊和 DeFi 场景的 LLM 推理评测套件,覆盖协议机制理解、合约漏洞识别、交易意图推断等 5 类任务。对做链上 AI Agent、审计工具或量化策略的团队来说,终于有一个能测模型"真懂不懂链"的 benchmark 了。

A benchmark for evaluating LLM reasoning on Ethereum and DeFi tasks

之前测 LLM 链上能力,大家要么用通用代码 benchmark 如 HumanEval,要么自己攒私有测试集,结果不可比、场景也不真实。ChainReason 的聪明之处在于把 DeFi 分析师的日常活拆解成 5 个可自动评分的原子任务,特别是 AMM 计算和交易意图推断这两类,直接对应 MEV bot、审计 Agent 的核心能力缺口。

跟 EleutherAI 的 LM Evaluation Harness 或 BigCode 的评测相比,它不是泛用框架而是垂直场景的深度定制,更适合做链上 Agent 的「准入考试」。如果你在做加密领域的 AI 工具,建议直接拿它筛模型,比看通用排行榜靠谱得多。

Star History
Experimental

首个专注以太坊与DeFi场景的LLM推理评测基准,填补链上AI能力评估空白。

独特价值:唯一覆盖协议机制、漏洞识别、交易意图等链上专属推理任务的评测套件。

查看原文 →