多模型评审代码替代单LLM打分
推荐指数 71.0 NO. 003 · 2026.07.31
Stars115创建6 天前Forks20Issues0
为什么值得看
CodeJury 是一个终端优先的编程智能体,用独立多模型组成的评审团替代单一LLM做代码审查,并通过持久化代码图和语义搜索精准定位修改位置。对苦于AI生成代码质量不稳定、审查流于表面的团队,这是可落地的工程化解法。
Terminal-first, knowledge-grounded multi-agent software delivery pipeline: scope requirements, implement changes, run tests, and gate pull requests with deterministic QA and ensemble code review.
媒体预览
编辑判断
当前AI编程工具如Cursor、Copilot的痛点不是生成速度,而是生成后的质量把控——让同一个模型既写代码又审代码,本质是用偏见验证偏见。CodeJury的评审团机制借鉴了软件工程中的代码评审实践,但成本结构是关键问题:多模型调用意味着单次审查token消耗可能翻倍,它用代码图缩小审查范围来对冲成本,这个取舍是否划算需要实测。
与SWE-agent、Devin等端到端智能体不同,CodeJury选择做"可观测的管道"而非黑盒,每个阶段(Planner→Dev→QA→Jury)的耗时和成本透明展示,这对企业采购决策很重要。如果你团队已经在用AI辅助编码但缺乏系统化的质量门禁,这个项目的架构比直接上Devin更务实。
Star History
生态分析
Experimental
面向SDLC的垂直多智能体代码审查工具,以评审团机制替代单LLM
独特价值:多模型评审团+持久化代码图+语义搜索,确定性QA替代概率生成
竞品: