3.8B小模型干翻6B+大模型
推荐指数 71.0 NO. 025 · 2026.05.26
upvotes89comments1
为什么值得看
Lens 用 3.8B 参数在文生图任务上超越 6B+ 参数的 SOTA 模型,核心靠密集 caption 数据、多分辨率 batching 和架构优化。对算力有限的团队来说,这是用工程技巧换性能的典型路径,可直接参考复现。
媒体预览
编辑判断
文生图领域一直迷信参数规模,Stability AI 和 SD3 的教训是参数堆上去效果未必好。Lens 的突破口在数据侧——用密集 caption 替代稀疏标注,这实际上是把 CLIP 时代的文本理解经验反哺到生成模型。
多分辨率 batching 不是新 trick,但和 3.8B 小模型结合后推理成本可以压到消费级 GPU 实时运行。如果代码开源,这会是替代 SDXL/SD3 轻量部署的有力候选。
做图像生成工具创业的团队建议重点关注它的 caption 构建流程,这比架构本身更容易迁移到现有管线。