已关闭
建议:MindSpeed-MM增加图文生成统一文生图/图生图的蒸馏训练方案 #602
崇理战队创建于  8月11日关闭于  7 天前
崇理战队
8月11日 创建

问题背景

昇腾多模态只涵盖理解大模型训练,缺少图像生成(文生图、图生图)统一训练方案,AIGC与多模态理解的跨域训练能力缺失。

问题表现

  1. Stable Diffusion DiT与理解VLM不能共用训练框架,代码无法复用
  2. 训练中缺少昇腾NPU对低秩知识蒸馏(LoRA-Distill)的高效实现
  3. 文生图模型的INT8后训练量化缺少昇腾侧Per-channel/Per-block校准策略
  4. 缺少多模态理解和生成模型统一昇腾NPU训练环境的部署方案
likedislike
yeqm成员
8月21日 评论:

👋 您好,欢迎向 MindSpeed MM 提交 Issue!
我们已收到您的反馈,感谢你对开源社区的支持。🎉
📅 处理时效: 维护团队将在 24 小时内 查看并回复您的问题(工作日)。
🚨 紧急联系: 如果您的问题非常紧急,可通过微信联系我们。
请确保 Issue 描述清晰,包含复现步骤和日志,这将帮助我们更快定位问题。谢谢!

likedislike
young256
young256成员
7 天前 评论:

您好,感谢您对昇腾多模态训练能力的关注与细致反馈!
关于 issue 中提到的几点,我们核实后认为与当前 MindSpeed-MM 的实际能力存在一定出入,这里先做几点澄清与说明:

  1. 关于"只涵盖理解、缺少生成训练方案"
    MindSpeed-MM 并非仅支持理解类模型,生成侧已有完整支持,例如 Wan2.2、LTX2.3 等 DiT 类生成模型均已提供训练示例与配置,覆盖文生视频、图生视频等生成类任务。因此"代码完全无法复用、缺少生成训练方案"的表述与实际情况不符。如您关注的是特定的文生图 / 图生图模型,烦请指明具体的模型名称与任务形态,我们据此判断是否已在支持范围内或纳入后续规划。
  2. 关于"缺少 LoRA 微调 / LoRA-Distill 实现"
    当前 Qwen3.5 等模型已支持 LoRA 微调。该项描述较为笼统,为便于我们准确评估,恳请您补充:具体是哪个模型 / 哪条训练链路不支持 LoRA?以及期望的 LoRA-Distill 具体形态(如教师-学生蒸馏、低秩适配训练等)。如确有模型缺失对应能力,我们会记录并排期。
  3. 关于"缺少理解与生成统一的部署方案"
    需要客观说明:理解与生成的统一训练/部署,目前业界尚无成熟、被广泛认可的开源方案,属于前沿探索方向,并非昇腾侧单点的能力缺失。我们也在持续跟进该方向的技术演进。
  4. 关于 INT8 后训练量化校准策略
    该需求我们已记录。量化能力通常与具体模型结构、量化工具链版本强相关,如您有明确的落地场景,欢迎补充目标模型与精度要求,便于我们评估优先级。
    综上,建议本 issue 按"待补充具体信息"处理。烦请您针对上述第 1、2 点补充具体模型名称与场景,我们将据此判断是否作为需求推进,并给出针对性的方案或替代建议。
    再次感谢您的反馈与对社区的贡献,期待您的补充信息。祝您工作顺利、生活愉快!
likedislike
young256young256成员
7 天前 issue状态由 TODO 改变为 DONE
young256young256成员
7 天前 关闭了 issue
ascend-robotascend-robot成员
7 天前 添加了label:resolved