DeepSeek V4 Flash 2美元破ARC-AGI-2
推荐指数 77.0 NO. 013 · 2026.08.08
发布2026/08/07Score89Comments53
为什么值得看
DeepSeek V4 Flash 0731以极低推理成本($0.02-$0.04/任务)在ARC-AGI-1/2基准上达到89.0%/61.4%,提供Max/High/Low三档推理强度可选。这对需要平衡推理质量与成本的AI工程团队是可直接落地的性价比方案。
编辑判断
ARC-AGI-2被设计为故意挫败LLM的基准,此前o3-high以数千美元成本才勉强突破,V4 Flash把成本压到4美分且提供三档推理控制,说明DeepSeek在推理效率架构上有实质性突破。三档变体的设计本身比分数更重要——它把test-time compute从黑箱变成了可调旋钮,这对做生产环境推理优化的工程师是可直接借鉴的模式。
值得关注的是ARC-AGI-3尚未公布分数,如果该模型在更难的版本上同样保持低成本优势,意味着推理效率的scaling law可能找到了新路径。做Agent或复杂推理产品的团队应该直接测试Low档位是否够用,这关系到你的单位经济模型能否跑正。
社区反馈
意见分歧 49 条评论
核心争论:低价是否可持续,以及价格是否掩盖了模型真实能力差距
相关内容
DeepSeek V4-Flash is cheapest major AI model to run DeepSeek V4-Flash定价为每百万输入Token 0.14美元、输出Token 0.28美元,成为运行成本最低的主流AI模型。 DeepSeek V4 Flash Is Beating Models That Cost 50x MORE! V4-Flash以约3美分/任务的成本击败GLM-5.2,性价比碾压贵60倍的中端模型。 DeepSeek V4 Review V4-Pro-Max在ARC-AGI-2等基准测试中落后于Gemini 3.1 Pro,后者ARC-AGI-2得分77.1%。 DeepSeek V4 Flash一刀斩碎AI定价 百万输出Token仅2元人民币,对比Claude Opus 4.8的170元,V4 Flash成为模型性价比斩杀线。
results comparable to gpt 5.6 luna but cheaper promising!
Since the x-axis is log-scaled, DeepSeek is much cheaper than visually implied (mousing over the raw values, it's 1/4th the cost of Luna).
Is this pricing from Deepseek with training on usage?