已关闭
建议:MindSpeed-MM增加图文生成统一文生图/图生图的蒸馏训练方案 #602
崇理战队创建于 8月11日关闭于 7 天前
yeqm
8月21日 评论:
8月21日 评论:
👋 您好,欢迎向 MindSpeed MM 提交 Issue!
我们已收到您的反馈,感谢你对开源社区的支持。🎉
📅 处理时效: 维护团队将在 24 小时内 查看并回复您的问题(工作日)。
🚨 紧急联系: 如果您的问题非常紧急,可通过微信联系我们。
请确保 Issue 描述清晰,包含复现步骤和日志,这将帮助我们更快定位问题。谢谢!


young256
7 天前 评论:
7 天前 评论:
您好,感谢您对昇腾多模态训练能力的关注与细致反馈!
关于 issue 中提到的几点,我们核实后认为与当前 MindSpeed-MM 的实际能力存在一定出入,这里先做几点澄清与说明:
- 关于"只涵盖理解、缺少生成训练方案"
MindSpeed-MM 并非仅支持理解类模型,生成侧已有完整支持,例如 Wan2.2、LTX2.3 等 DiT 类生成模型均已提供训练示例与配置,覆盖文生视频、图生视频等生成类任务。因此"代码完全无法复用、缺少生成训练方案"的表述与实际情况不符。如您关注的是特定的文生图 / 图生图模型,烦请指明具体的模型名称与任务形态,我们据此判断是否已在支持范围内或纳入后续规划。 - 关于"缺少 LoRA 微调 / LoRA-Distill 实现"
当前 Qwen3.5 等模型已支持 LoRA 微调。该项描述较为笼统,为便于我们准确评估,恳请您补充:具体是哪个模型 / 哪条训练链路不支持 LoRA?以及期望的 LoRA-Distill 具体形态(如教师-学生蒸馏、低秩适配训练等)。如确有模型缺失对应能力,我们会记录并排期。 - 关于"缺少理解与生成统一的部署方案"
需要客观说明:理解与生成的统一训练/部署,目前业界尚无成熟、被广泛认可的开源方案,属于前沿探索方向,并非昇腾侧单点的能力缺失。我们也在持续跟进该方向的技术演进。 - 关于 INT8 后训练量化校准策略
该需求我们已记录。量化能力通常与具体模型结构、量化工具链版本强相关,如您有明确的落地场景,欢迎补充目标模型与精度要求,便于我们评估优先级。
综上,建议本 issue 按"待补充具体信息"处理。烦请您针对上述第 1、2 点补充具体模型名称与场景,我们将据此判断是否作为需求推进,并给出针对性的方案或替代建议。
再次感谢您的反馈与对社区的贡献,期待您的补充信息。祝您工作顺利、生活愉快!


7 天前 issue状态由 TODO 改变为 DONE
7 天前 关闭了 issue
7 天前 添加了label:resolved
问题背景
昇腾多模态只涵盖理解大模型训练,缺少图像生成(文生图、图生图)统一训练方案,AIGC与多模态理解的跨域训练能力缺失。
问题表现