让文生图模型学会自己调用工具
推荐指数 70.0 NO. 023 · 2026.08.07
upvotes45comments0
为什么值得看
ToolArtist 通过后期训练统一多模态模型,让文生图系统能自主推理、调用外部工具并生成图像,而非依赖固定工作流。对需要复杂语义理解和多步推理的开放域图像生成任务,这是从"预设脚本"到"自主代理"的关键跃迁。
媒体预览
编辑判断
当前文生图的 Agent 化探索分成两派:ComfyUI 工作流派把节点编排交给人类,模型只执行;AutoGPT 派把推理交给 LLM,但图像生成是黑盒调用。ToolArtist 的解法是让单一 UMM 同时掌握推理决策和视觉生成,本质是把"规划-工具调用-执行"压缩进一个模型权重里,避免了多模块协作的误差累积。
这个架构选择和 Janus、Show-o 等统一多模态模型的路线一致,但 ToolArtist 把工具使用能力也纳入了统一空间。如果开源,它可能成为替代 Stable Diffusion + ComfyUI 复杂工作流的轻量方案;如果闭源,则更像 Midjourney 下一代产品的技术预研。值得跟踪其工具调用准确率的具体数字和实际推理开销。