Claude Fable 5 碾压级解 NP-hard 难题
推荐指数 68.0 NO. 012 · 2026.07.19
发布2026/07/18Score165Comments83
为什么值得看
同一份未公开的 NP-hard 优化问题测试中,Claude Fable 5 表现远超 GPT-5.6 Sol,且稳定性惊人。/goal 模式并非万能"更努力"开关,而是改变搜索路径,效果因题而异。
编辑判断
这个测试的含金量在于作者有人类专家基准——他多年前花一周写的 C++ 解法可以作为锚点,而不是像大多数模型评测那样只看相对排名。Fable 5 的"一致性"比单次最优解更关键,说明 Anthropic 在推理时的采样稳定性上做了实质性优化,这对需要多次运行取最优的生产环境极其重要。
/goal 的失效提示一个反直觉结论:当前模型的"深度思考"模式不是简单的计算量堆叠,而是特定控制策略的切换,适合结构化搜索类问题,对需要直觉跳跃的组合优化可能反而绕弯路。做运筹学、调度算法落地的团队,现在应该把手上的经典问题拿出来跑一遍 Fable 5,重新评估哪些人类专家规则可以被替代。
社区反馈
意见分歧 75 条评论
核心争论:/goal 模式是否有效:是改变搜索路径的关键,还是仅因任务类型而异的噪声
A deepdive on the /goal effect on a problem literally made for this.
The chart at the top is somewhat confusing. It says, “lower is better” but the y-axis is inverted! So visually higher in the chart is better but lower in terms of # value.
well thank you so much for this