小模型做 GraphRAG 提取,省 90% 成本
推荐指数 81.0 NO. 023 · 2026.07.21
upvotes108comments3
为什么值得看
RAGU 是一个开源 GraphRAG 引擎,用两阶段提取+DBSCAN 去重+Leiden 社区发现替代传统单次抽取,并证明领域适配的小模型足以胜任知识图谱构建中的语言任务。对预算有限的团队,这意味着可以用 7B 级模型替代 70B+ 模型做图谱构建,成本大幅下降且噪声更少。
媒体预览
编辑判断
现有 GraphRAG 方案如 Neo4j 的 GraphRAG 实现或微软的 GraphRAG 项目,普遍依赖大模型一次性完成实体关系抽取,结果里同名不同义、同义不同名的实体噪音极难清理。RAGU 的关键设计是把"提取"和"合并"拆成独立阶段,用 DBSCAN 做聚类去重而非 LLM 自纠正,这比让模型自己判断"这两个实体是否一样"更可控也更便宜。
论文的核心假设——图谱构建所需的语言技能(理解、提取、推理)随模型尺寸增长缓慢——如果成立,将动摇当前"做 GraphRAG 必须上 GPT-4/Claude"的共识。项目已开源,正在做知识图谱或企业 RAG 的团队可以用自己的领域数据验证这个假设是否成立,如果 7B-13B 模型表现足够,管线成本可以从每月数千美元降到几十美元。
相关内容
GraphRAG 太贵?一种成本降低90% 的Agentic-... 通过LangExtract轻量化按需提取,无需一次性全量构建图谱,相比微软GraphRAG节省90%索引成本。 RAGU: A Multi-Step GraphRAG Engine with a Compact Domain-Adapted LLM 开源模块化GraphRAG引擎,用小模型分步提取替代单次全量提取,减少噪声实体和脆弱依赖。 Five Papers Quietly Killing the LLM Tax in GraphRAG 五篇论文逐阶段拆解GraphRAG成本结构,针对微软架构的高昂实践成本提出优化方案。 Retrieval-Augmented Generation with Graphs (GraphRAG) GraphRAG综述论文,涵盖图检索增强生成的核心方法与技术框架。