给纯文本Codex装"视觉外挂"
推荐指数 46.0 NO. 007 · 2026.08.03
Stars196创建1 天前Forks8Issues1
为什么值得看
一个Python代理服务,让连接DeepSeek的纯文本Codex能调用内置视觉工具处理图像,返回详细描述而非报错。无需额外MCP或CLI配置,适合想快速获得多模态体验又不愿折腾基础设施的开发者。
让纯文本模型在 Codex 中无障碍调用内置看图工具(view_image)的方案,附为纯文本 LLM 设计的视觉工具包&skill | Let text-only models call Codex's built-in view_image seamlessly, plus a vision toolkit&skill designed for text-only LLMs.
媒体预览
编辑判断
这个项目的巧妙之处在于绕过了OpenAI Codex的系统层限制——当模型本身被锁定为文本模式时,不试图破解权限,而是在中间层做能力嫁接。之前常见的做法是另起一个MCP服务或直接用GPT-4V替代,但这会带来配置碎片化的问题,特别是团队里已经统一用了DeepSeek路由的场景。
同类方案里,mcp-vision-server需要额外部署SSE端点,而本项目直接作为透明代理运行,对现有工作流侵入性更低。196 stars但仅8 forks说明围观多、实际踩坑反馈少,生产环境稳定性待验证。最该试的人群:已经在用Codex+DeepSeek组合、且频繁遇到"模型拒绝看图片"报错的小团队,可以先用它替代手动截图发Claude/Gemini的折中流程。
Star History
生态分析
Experimental
纯文本LLM与Codex多模态能力之间的轻量级桥接适配层
独特价值:零配置让纯文本模型无缝调用Codex视觉工具,无需MCP或CLI改造
竞品: