AMAZINGINDEX.COM 日报快照
60.6
VOL. 2026.08
2026.08.08
← 返回 2026.08.08 日报
日报快照 · Daily Snapshot
NO. 013

DeepSeek V4 Flash 2美元破ARC-AGI-2

#ARTICLE HackerNews 2026.08.08
推荐指数 77.0 NO. 013 · 2026.08.08
发布2026/08/07Score89Comments53

DeepSeek V4 Flash 0731以极低推理成本($0.02-$0.04/任务)在ARC-AGI-1/2基准上达到89.0%/61.4%,提供Max/High/Low三档推理强度可选。这对需要平衡推理质量与成本的AI工程团队是可直接落地的性价比方案。

ARC-AGI-2被设计为故意挫败LLM的基准,此前o3-high以数千美元成本才勉强突破,V4 Flash把成本压到4美分且提供三档推理控制,说明DeepSeek在推理效率架构上有实质性突破。三档变体的设计本身比分数更重要——它把test-time compute从黑箱变成了可调旋钮,这对做生产环境推理优化的工程师是可直接借鉴的模式。

值得关注的是ARC-AGI-3尚未公布分数,如果该模型在更难的版本上同样保持低成本优势,意味着推理效率的scaling law可能找到了新路径。做Agent或复杂推理产品的团队应该直接测试Low档位是否够用,这关系到你的单位经济模型能否跑正。

意见分歧 49 条评论

核心争论:低价是否可持续,以及价格是否掩盖了模型真实能力差距

tosh

results comparable to gpt 5.6 luna but cheaper promising!

minimaxir

Since the x-axis is log-scaled, DeepSeek is much cheaper than visually implied (mousing over the raw values, it's 1/4th the cost of Luna).

literallyroy

Is this pricing from Deepseek with training on usage?

替代方案: GPT 5.6 LunaKimi K3MiniMax M3GLM 5.2Muse Spark 1.2OpenCode Go
查看原文 →