开源版 GPT-Image-2 来了
推荐指数 70.0 NO. 024 · 2026.07.17
upvotes107comments2
为什么值得看
Boogu-Image-0.1 是统一多模态理解与生成模型家族,含 Base/Turbo/Edit 四个变体,支持文生图、指令编辑和中英双语文字渲染。它证明不用闭源系统的黑箱集成,单靠模型本身优化就能追上 Nano-Banana-Pro 和 GPT-Image-2 的效果,对想自建图像管线又不想绑闭源 API 的团队是重要备选。
媒体预览
编辑判断
闭源多模态系统靠'模型+后处理+外部工具'的集成套路刷分已经是公开秘密,但工程团队很难复现。Boogu 的 Edit-Turbo 变体把编辑延迟压到秒级,这对电商素材批量修改、游戏 UGC 场景是刚需,目前开源方案里能做到实时编辑的几乎没有。
论文提到用了 agentic inference-time scaling,但没给具体实现细节,这是最大的悬念——如果只是在采样阶段叠个 refiner,那工程成本可控;如果要调多个专家模型,那落地性价比会打折扣。建议等代码开源后重点测 Edit-Turbo 的端到端延迟和显存占用。