Lightricks开源音视频DiT模型LTX-2
推荐指数 66.0 NO. 004 · 2026.06.19
Stars7,461
为什么值得看
LTX-2是首个基于DiT架构的统一音视频生成基础模型,22B参数支持同步音画生成并提供蒸馏版。对视频生成创业者意味着可直接调用API获得生产级输出,无需自建复杂音画同步管线。
Official Python inference and LoRA trainer package for the LTX-2 audio–video generative model.
编辑判断
音视频同步生成一直是Runway、Pika等工具的隐性成本——它们大多先生成视频再后期配音,口型对齐需要额外工作流。LTX-2把音频作为原生模态内嵌到DiT里,这意味着生成阶段就锁定音画一致性。
对比来看,CogVideo、Wan 2.1等国产开源视频模型目前都不带原生音频,这是LTX-2最差异化的卡位。但22B参数对消费级GPU不友好,蒸馏版1.1的实际质量需要验证。
做短视频工具、广告生成、AI短剧的团队值得优先测试API版本,特别是需要人物口型精准匹配的场景。自托管的话,建议等社区出GGUF或FP8量化方案再动手。
Star History
生态分析
Production
LTX模型生态的官方核心基础设施层,提供模型推理与微调能力
独特价值:唯一官方支持的LoRA训练与API级音视频同步生成方案
竞品: