Claude Code 省 60% 成本:把文本转图片让模型 OCR
推荐指数 68.0 NO. 011 · 2026.07.04
发布2026/07/03Score94Comments31
为什么值得看
pxpipe 通过将系统提示、工具文档等密集文本渲染为 PNG 图片,利用图像 token 按像素计费而非按字符计费的特性,将 Claude Code 输入 token 成本降低约 60%。这对高频调用 API 的 AI 工程团队有直接的成本优化价值,尤其适合上下文冗长的代码助手场景。
编辑判断
这个 trick 的底层逻辑是 Anthropic 视觉编码器的定价漏洞:图像 token 只算固定网格,不解析内容密度。之前大家降本主要靠 prompt 压缩(如 Gist、LLMLingua)或缓存(prompt caching),但都会损失语义精度或受限于平台支持。pxpipe 的取巧之处在于完全保留原始信息,只是换了个模态通道,且本地代理部署不依赖服务商配合。
潜在风险是两个:一是多模态 OCR 的稳定性,复杂代码缩进、特殊符号可能误读;二是 Anthropic 随时可能调整图像 token 计算方式堵上这个洞。建议短期可以接入降低现有 Claude Code 开销,但不要把核心架构押注在这个套利空间上。做 AI coding 工具的团队尤其该试试,你们的上下文膨胀速度最快。
社区反馈
意见分歧 28 条评论
核心争论:是定价漏洞套利还是视觉编码的本质效率优势
there's also a DeepSeek whitepaper on this technique https://www.seangoedecke.com/text-tokens-as-image-tokens
This seems like a pricing hack that burns resources, that when the loophole gets closed the price of OCR will have to rise?
It’s not a loophole, it just happens that encoding information as optical tokens is much more efficient than text.