/label add good-first-issue


认领


认领
欢迎认领任务,请参考https://gitcode.com/Ascend/MindSpeed-MM/issues/356 社区任务池明确该任务的:
- 完成的截止日期
- 开发进展反馈
- 微信答疑群
- 任务交付注意事项
等信息。如果您同时认领了多项任务,但无法都能进行投入,可以在部分任务中回复退出.
麻烦您加入到对应微信群,群备注名修改为"社区任务+您的gitcode账号", 后续有相关消息和问题都可以在微信群咨询答疑。 等您加入到微信群后,我这边会在社区任务池里面登记任务责任人。


认领
欢迎认领任务,请参考https://gitcode.com/Ascend/MindSpeed-MM/issues/356 社区任务池明确该任务的:
- 完成的截止日期
- 开发进展反馈
- 微信答疑群
- 任务交付注意事项
等信息。如果您同时认领了多项任务,但无法都能进行投入,可以在部分任务中回复退出.
麻烦您加入到对应微信群,群备注名修改为"社区任务+您的gitcode账号", 后续有相关消息和问题都可以在微信群咨询答疑。 等您加入到微信群后,我这边会在社区任务池里面登记任务责任人。
已加微信群


20260628进度
体验反馈
目前在HIDevLab使用910C的机器体验MindSpeed-MM使用pytorch后端能够正常微调Qwen3.5-4B模型,4B模型能够推理其他规格的Qwen3.5模型应该大差不差,代码仓的example中也提供了现成的yaml文件进行参考使用。
接下去需要做:
争取能够Qwen3.6-27B使用MindSpeed-MM的微调跑起来,目前遇到的问题是910C芯片使用COCO2017数据集会出现OOM,更换到其他平台4卡机器使用COCO2017也会OOM,随后使用自己的小数据集进行微调出现其他的算子类报错,不知道是不是A2机器的关系。有时间换910C进行体验试试
目前的文档写在飞书平台,地址如下:
https://my.feishu.cn/docx/GiSzdYnAEoavlExUVltcfGHRnTg?from=from_copylink
体验过程中遇到的问题
- 建议后续新模型的example中的实例其实可以给出昇腾镜像仓的一些镜像让用户使用docker或者hidevlab进行快速体验。手动安装环境的话对于新手来说目前阶段其实还是有一丢丢难度。
- Qwen3.6根据文档进行体验,目前进度:遇到COCO2017进行微调910C单卡和4*910B3的机器都会出现OOM,在4卡910B的机器上更换小的自定义数据集进行微调出现以下报错,不知道是不是910B芯片不支持某些算子的 关系还是?准备有时间使用910C使用小数据集进行微调尝试看看。
[rank1]:[E628 20:10:10.955677683 compiler_depend.ts:444] malloc:build/CMakeFiles/torch_npu.dir/compiler_depend.ts:89 NPU function error: c10_npu::acl::AclrtSynchronizeDeviceWithTimeout(), error code is 507015
[ERROR] 2026-06-28-20:10:10 (PID:211197, Device:1, RankID:1) ERR00100 PTA call acl api failed
[Error]: The aicore execution is abnormal.
Rectify the fault based on the error information in the ascend log.
EZ9999: Inner Error!
EZ9999[PID: 211197] 2026-06-28-20:10:10.260.789 (EZ9999): The error from device(chipId:1, dieId:0), serial number is 1, there is an exception of fftsplus aicore error, core id is 12, error code = 0x800000, dump info: pc start: 0x12c0856a3318, current: 0x12c0856ac368, vec error info: 0, mte error info: 0x9e030000d8, ifu error info: 0x79b32d070a380, ccu error info: 0xf2db0da6310641f, cube error info: 0, biu error info: 0, aic error mask: 0x6500020bd00028c, para base: 0x12c140182080.[FUNC:PrintCoreInfo][FILE:device_error_core_proc.cc][LINE:347]
TraceBack (most recent call last):
The extend info: errcode:(0x800000, 0, 0) errorStr: The DDR address of the MTE instruction is out of range. fixp_error0 info: 0x30000d8, fixp_error1 info: 0x9e, fsmId:0, tslot:3, thread:0, ctxid:0, blk:23, sublk:0, subErrType:4.[FUNC:PrintCoreInfo][FILE:device_error_core_proc.cc][LINE:360]
Kernel task happen error, retCode=0x26, [aicore exception].[FUNC:PreCheckTaskErr][FILE:davinci_kernel_task.cc][LINE:1582]
rtDeviceSynchronizeWithTimeout execution failed, reason=aicore exception[FUNC:FuncErrorReason][FILE:error_message_manage.cc][LINE:61]
wait for compute device to finish failed, runtime result = 507015.[FUNC:ReportCallError][FILE:log_inner.cpp][LINE:148]
Exception raised from malloc at build/CMakeFiles/torch_npu.dir/compiler_depend.ts:89 (most recent call first):
frame #0: c10::Error::Error(c10::SourceLocation, std::__cxx11::basic_string<char, std::char_traits<char>, std::allocator<char> >) + 0xd4 (0xffffb1ce3ea4 in /root/.conda/envs/ascend_lab/lib/python3.10/site-packages/torch/lib/libc10.so)
frame #1: c10::detail::torchCheckFail(char const*, char const*, unsigned int, std::__cxx11::basic_string<char, std::char_traits<char>, std::allocator<char> > const&) + 0xe4 (0xffffb1c83e44 in /root/.conda/envs/ascend_lab/lib/python3.10/site-packages/torch/lib/libc10.so)
建议
在阅读qwen3.6的文档的时候,他有一部分openai数据集的处理说明,这一部分建议标注一下如果默认COCO2017数据集可以跳过这部分设置,有些初学者或者新手会以为COCO2017的数据集也是openai格式的,然后去做了这部分处理,然后就会出现微调的时候


认领这个任务




20260706 进度
文章已经提交Issue,issue地址:
https://gitcode.com/Ascend/MindSpeed-MM/issues/483


@JeffDing 您好!
MindSpeed-MM 邀请您参加 2026-08-20 16:00 召开的WeLink会议
会议主题:MindSpeed MM 社区例会
会议内容:
1.社区关键issue解答
2.代码合入评审
会议链接:https://meeting.huaweicloud.com:36443/#/j/980887584
会议纪要&签到链接:https://etherpad.ascend.osinfra.cn/p/sig-MindSpeed-MM


@JeffDing 您好!
MindSpeed-MM 邀请您参加 2026-08-20 16:00 召开的WeLink会议
会议主题:MindSpeed MM 社区例会
会议内容:
1.社区关键issue解答
2.代码合入评审会议链接:https://meeting.huaweicloud.com:36443/#/j/980887584
会议纪要&签到链接:https://etherpad.ascend.osinfra.cn/p/sig-MindSpeed-MM
16点这个时间段不一定有时间入会啊,有其他工作安排,目前看17:00可能有时间,或者不知道手机能否入会,能的话16点30可能也可以


任务描述
跑通MindSpeed MM仓上的快速体验或者其他模型(多模态生成、理解),总结使用的经验总结,提出改进意见。
验收标准
一、任务交付件
本期任务为基于MindSpeed MM开放仓库代码进行使用体验。主要开发点如下:
(1)跑通模型功能,基于开源数据训练1000step, 完成实践文档,提出改进issue。
(2)任务完成标准
本次任务完成标准为:
实践文档提交到仓库issue。
PR 合入
本地完成测试验证后,向MindSpeed-MM的main分支发起PR。
对接人
待补充
欢迎加入社区,感谢您对社区的贡献 🎉!