AMAZINGINDEX.COM 日报快照
54.3
VOL. 2026.05
2026.05.28
← 返回 2026.05.28 日报
日报快照 · Daily Snapshot
NO. 007

三模态统一训练框架开源

#REPO GitHub Search 2026.05.28
推荐指数 65.0 NO. 007 · 2026.05.28
Stars158创建3 天前Forks0Issues0

UniMM-Trainer 是一个极简的多模态训练库,支持文本+视觉+音频任意两两组合,通过配置化方式将冻结的编码器接入语言模型 backbone。适合不想重复造轮子、又受够了 fork 别人代码再删一半假设的工程师。

A small library for training multimodal LLMs combining text, vision, and audio

多模态训练目前的主流做法要么是直接 fork LLaVA 系列仓库改来改去,要么用 HuggingFace 的 TRL 但得自己拼数据流水线和投影模块。这个库的聪明之处在于把"组合冻结编码器+训练投影层"这件事做成了声明式配置,而不是让你继承五个类再重写 forward。

跟 LLaVA-1.5 的原生训练代码相比,它把音频模态也纳进来了,而且明确支持 Q-Former 和 Perceiver 两种重采样器——做音视频理解的小团队不用再维护两套代码。158 star 但 0 fork 说明刚发布不久,窗口期还在。

如果你正在用 Whisper+CLIP 拼一个自己的 GPT-4o mini,这个库能省掉至少一周的 boilerplate 时间。

Star History
Beta

填补轻量级多模态训练工具空白,面向需快速组合冻结编码器的开发者

独特价值:极简配置化接入任意两模态,避免深度改造他人代码库

查看原文 →