已开启
【Feature】体验提issue #359
LKONE创建于  5月18日
LKONE
LKONE成员
5月18日 创建

任务描述

跑通MindSpeed MM仓上的快速体验或者其他模型(多模态生成、理解),总结使用的经验总结,提出改进意见。

验收标准

一、任务交付件
本期任务为基于MindSpeed MM开放仓库代码进行使用体验。主要开发点如下:
(1)跑通模型功能,基于开源数据训练1000step, 完成实践文档,提出改进issue。
(2)任务完成标准
本次任务完成标准为:
实践文档提交到仓库issue。

PR 合入

本地完成测试验证后,向MindSpeed-MM的main分支发起PR。

对接人

待补充

欢迎加入社区,感谢您对社区的贡献 🎉!

likedislike
LKONELKONE成员
5月18日 添加了label:feature
LKONELKONE成员
5月18日 修改了issue 的描述
LKONE
LKONE成员
5月18日 评论:

👋 您好,欢迎向 MindSpeed MM 提交 Issue!

我们已收到您的反馈,感谢你对开源社区的支持。🎉

📅 处理时效: 维护团队将在 24 小时内 查看并回复您的问题(工作日)。

🚨 紧急联系: 如果您的问题非常紧急,可通过以下方式联系我们:

💬 微信: WeChat

请确保 Issue 描述清晰,包含复现步骤和日志,这将帮助我们更快定位问题。谢谢!

likedislike
Ronald1995
6月11日 评论:

/label add good-first-issue

likedislike
ascend-robotascend-robot成员
6月11日 添加了label:good-first-issue
JeffDing
JeffDing
6月25日 评论:

认领

likedislike
Ronald1995
6月25日 评论:

认领

@JeffDing

欢迎认领任务,请参考https://gitcode.com/Ascend/MindSpeed-MM/issues/356 社区任务池明确该任务的:

  • 完成的截止日期
  • 开发进展反馈
  • 微信答疑群
  • 任务交付注意事项

等信息。如果您同时认领了多项任务,但无法都能进行投入,可以在部分任务中回复退出.

麻烦您加入到对应微信群,群备注名修改为"社区任务+您的gitcode账号", 后续有相关消息和问题都可以在微信群咨询答疑。 等您加入到微信群后,我这边会在社区任务池里面登记任务责任人。

likedislike
JeffDing
JeffDing
6月26日 评论:

认领

@JeffDing

欢迎认领任务,请参考https://gitcode.com/Ascend/MindSpeed-MM/issues/356 社区任务池明确该任务的:

  • 完成的截止日期
  • 开发进展反馈
  • 微信答疑群
  • 任务交付注意事项

等信息。如果您同时认领了多项任务,但无法都能进行投入,可以在部分任务中回复退出.

麻烦您加入到对应微信群,群备注名修改为"社区任务+您的gitcode账号", 后续有相关消息和问题都可以在微信群咨询答疑。 等您加入到微信群后,我这边会在社区任务池里面登记任务责任人。

@Ronald1995

已加微信群

likedislike
JeffDing
JeffDing
6月28日 评论:

20260628进度

体验反馈

目前在HIDevLab使用910C的机器体验MindSpeed-MM使用pytorch后端能够正常微调Qwen3.5-4B模型,4B模型能够推理其他规格的Qwen3.5模型应该大差不差,代码仓的example中也提供了现成的yaml文件进行参考使用。

接下去需要做:
争取能够Qwen3.6-27B使用MindSpeed-MM的微调跑起来,目前遇到的问题是910C芯片使用COCO2017数据集会出现OOM,更换到其他平台4卡机器使用COCO2017也会OOM,随后使用自己的小数据集进行微调出现其他的算子类报错,不知道是不是A2机器的关系。有时间换910C进行体验试试

目前的文档写在飞书平台,地址如下:
https://my.feishu.cn/docx/GiSzdYnAEoavlExUVltcfGHRnTg?from=from_copylink

体验过程中遇到的问题

  1. 建议后续新模型的example中的实例其实可以给出昇腾镜像仓的一些镜像让用户使用docker或者hidevlab进行快速体验。手动安装环境的话对于新手来说目前阶段其实还是有一丢丢难度。
  2. Qwen3.6根据文档进行体验,目前进度:遇到COCO2017进行微调910C单卡和4*910B3的机器都会出现OOM,在4卡910B的机器上更换小的自定义数据集进行微调出现以下报错,不知道是不是910B芯片不支持某些算子的 关系还是?准备有时间使用910C使用小数据集进行微调尝试看看。
[rank1]:[E628 20:10:10.955677683 compiler_depend.ts:444] malloc:build/CMakeFiles/torch_npu.dir/compiler_depend.ts:89 NPU function error: c10_npu::acl::AclrtSynchronizeDeviceWithTimeout(), error code is 507015
[ERROR] 2026-06-28-20:10:10 (PID:211197, Device:1, RankID:1) ERR00100 PTA call acl api failed
[Error]: The aicore execution is abnormal. 
        Rectify the fault based on the error information in the ascend log.
EZ9999: Inner Error!
EZ9999[PID: 211197] 2026-06-28-20:10:10.260.789 (EZ9999):  The error from device(chipId:1, dieId:0), serial number is 1, there is an exception of fftsplus aicore error, core id is 12, error code = 0x800000, dump info: pc start: 0x12c0856a3318, current: 0x12c0856ac368, vec error info: 0, mte error info: 0x9e030000d8, ifu error info: 0x79b32d070a380, ccu error info: 0xf2db0da6310641f, cube error info: 0, biu error info: 0, aic error mask: 0x6500020bd00028c, para base: 0x12c140182080.[FUNC:PrintCoreInfo][FILE:device_error_core_proc.cc][LINE:347]
        TraceBack (most recent call last):
       The extend info: errcode:(0x800000, 0, 0) errorStr: The DDR address of the MTE instruction is out of range. fixp_error0 info: 0x30000d8, fixp_error1 info: 0x9e, fsmId:0, tslot:3, thread:0, ctxid:0, blk:23, sublk:0, subErrType:4.[FUNC:PrintCoreInfo][FILE:device_error_core_proc.cc][LINE:360]
       Kernel task happen error, retCode=0x26, [aicore exception].[FUNC:PreCheckTaskErr][FILE:davinci_kernel_task.cc][LINE:1582]
       rtDeviceSynchronizeWithTimeout execution failed, reason=aicore exception[FUNC:FuncErrorReason][FILE:error_message_manage.cc][LINE:61]
       wait for compute device to finish failed, runtime result = 507015.[FUNC:ReportCallError][FILE:log_inner.cpp][LINE:148]

Exception raised from malloc at build/CMakeFiles/torch_npu.dir/compiler_depend.ts:89 (most recent call first):
frame #0: c10::Error::Error(c10::SourceLocation, std::__cxx11::basic_string<char, std::char_traits<char>, std::allocator<char> >) + 0xd4 (0xffffb1ce3ea4 in /root/.conda/envs/ascend_lab/lib/python3.10/site-packages/torch/lib/libc10.so)
frame #1: c10::detail::torchCheckFail(char const*, char const*, unsigned int, std::__cxx11::basic_string<char, std::char_traits<char>, std::allocator<char> > const&) + 0xe4 (0xffffb1c83e44 in /root/.conda/envs/ascend_lab/lib/python3.10/site-packages/torch/lib/libc10.so)

建议

在阅读qwen3.6的文档的时候,他有一部分openai数据集的处理说明,这一部分建议标注一下如果默认COCO2017数据集可以跳过这部分设置,有些初学者或者新手会以为COCO2017的数据集也是openai格式的,然后去做了这部分处理,然后就会出现微调的时候标签数量和图片数量不一致的问题。所以建议还是建议做一个说明如果是自定义数据集并且是openai格式的,可以参考这一部分,如果使用默认COCO2017数据集的话这部分可以跳过。

likedislike
gcw_MTeIQk9o
6月29日 评论:

认领这个任务

likedislike
Ronald1995
7月2日 评论:

认领这个任务

@gcw_MTeIQk9o

当前一个任务只分配一个开发,根据评论时间分配,你可以分配其他开发 https://gitcode.com/org/Ascend/discussions/4

likedislike
ascend-robotascend-robot成员
7月3日 关联了看板:MindStudio ISSUE管理
JeffDing
JeffDing
7月6日 评论:

20260706 进度

文章已经提交Issue,issue地址:
https://gitcode.com/Ascend/MindSpeed-MM/issues/483

likedislike
young256young256成员
7月8日 关联了里程碑:MindSpeed 26.2.0
且奏长歌
且奏长歌成员
8月19日 评论:

@JeffDing 您好!

MindSpeed-MM 邀请您参加 2026-08-20 16:00 召开的WeLink会议

会议主题:MindSpeed MM 社区例会

会议内容:
1.社区关键issue解答
2.代码合入评审

会议链接:https://meeting.huaweicloud.com:36443/#/j/980887584

会议纪要&签到链接:https://etherpad.ascend.osinfra.cn/p/sig-MindSpeed-MM

likedislike
JeffDing
JeffDing
8月19日 评论:

@JeffDing 您好!

MindSpeed-MM 邀请您参加 2026-08-20 16:00 召开的WeLink会议

会议主题:MindSpeed MM 社区例会

会议内容:
1.社区关键issue解答
2.代码合入评审

会议链接:https://meeting.huaweicloud.com:36443/#/j/980887584

会议纪要&签到链接:https://etherpad.ascend.osinfra.cn/p/sig-MindSpeed-MM

@WendongPang

16点这个时间段不一定有时间入会啊,有其他工作安排,目前看17:00可能有时间,或者不知道手机能否入会,能的话16点30可能也可以

likedislike
且奏长歌且奏长歌成员
15 天前 关联了里程碑:MindSpeed 26.3.0