MLLM 可解释性调试工具箱
推荐指数 68.0 NO. 005 · 2026.05.28
Stars131创建4 天前Forks0Issues0
为什么值得看
MM-Probe 是一套针对多模态大模型的探针工具集,通过 forward hooks 提取注意力图、隐藏状态与模态对齐信息,支持 LLaVA、Qwen-VL、BLIP-2 等主流架构。MLLM 的可解释性长期被单模态工具主导,这个工具把跨模态边界(vision encoder ↔ projector ↔ LM)的调试流程标准化了,能省下大量 copy-paste 时间。
A small, hackable toolkit for probing multimodal LLMs — attention, hidden states, alignment, and causal tracing.
编辑判断
做 MLLM 研究的团队以前调试跨模态对齐时,通常要针对不同模型家族手写 hook 注册逻辑,LLaVA 用 CLIP 视觉编码器加 MLP projector,Qwen-VL 用 Q-Former,BLIP-2 又是另一套——代码很难复用。MM-Probe 把这套差异抽象成了统一接口,比直接拿 transformers 的 debug 工具或 Captum 这类通用可解释性库更贴合多模态场景。
如果你正在做视觉指令微调、模态融合机制分析,或者审稿时被 reviewer 追问 attention 模式,这个工具能帮你快速出图。131 stars 说明需求真实存在,但生态还早期,遇到新模型架构可能需要自己补 hook。
Star History
生态分析
Experimental
填补多模态LLM可解释性工具空白,专注跨模态边界调试的标准化探针工具集
独特价值:首个针对MLLM跨模态链路(vision→projector→LM)的统一hook探针方案