OpenAI 新模型视觉能力首测曝光
推荐指数 63.0 NO. 015 · 2026.08.18
发布2026/08/17Score222Comments119
为什么值得看
第三方基准测试显示,GPT-5.6 系列中的 Sol 模型在物体检测、计数、OCR 等视觉任务上大幅超越 OpenAI 此前所有模型。该评测由独立团队完成,完整 benchmark 将于数周内公开,可作为选型参考。
编辑判断
OpenAI 发布会重点宣传的是 computer use 和 3D 可视化,但真正的跃升其实在底层视觉理解——这解释了为什么 UI agent 产品突然变得可用。Sol 的检测和计数能力进步,意味着多模态模型终于跨过了"能看懂界面"到"能精准操作界面"的临界点。
对做 AI agent 的团队来说,这是一个信号:纯文本 agent 的窗口期正在关闭,视觉-动作闭环将成为标配。如果你还在用 OCR+规则引擎做 RPA 替代方案,需要评估是否直接切换到端到端 VLM 方案。
该 benchmark 尚未公开,但 119 条 HN 评论中已有开发者质疑测试集是否包含训练数据,建议等完整 release 后再做生产决策。
社区反馈
意见分歧 107 条评论
核心争论:视觉模型能否真正理解设计质量,还是只能机械遵循规则
相关内容
刚刚,OpenAI全新模型Astra曝光! OpenAI内部长时程模型Astra曝光,曾推翻Erdős单位距离猜想,展现持续探索复杂开放问题的能力,文章涉及该模型的安全问题与对齐研究。 GPT-5.4发布:OpenAI首个大一统模型 GPT-5.4视觉能力大幅提升,支持1024万像素原图输入,MMMU-Pro测试达81.2%,视觉多样性和审美获人类评审偏好。 隆重推出 GPT-5.2 | OpenAI GPT-5.2 Thinking是OpenAI迄今最强视觉模型,图表推理和软件界面理解错误率降低约一半,支持专业视觉信息工作流。 GPT-5.4 震撼登场 | OpenAI GPT-5.4擅长复杂垂直前端任务,审美与功能性显著提升,通用视觉感知能力增强,支持计算机使用与实时可视化调试。 Thinking with images | OpenAI o3和o4-mini首次实现思维链中使用图像进行推理,而非仅视觉感知,标志视觉推理能力的重大突破。
Anecdotal, opinion: Gpt is really good in vision stuff, or at least their MoE seems to be really cohesive. From my experience Claude models can be really good at language but the moment they need to look at a picture and decide why the design is not good what parts need improvement it degrades a lot
Assessing the subjective quality of a thing is in my experience one of the worst ways to use any LLM.
anthropic frontend-design skill does a great job with it.