| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
migrate-benchmarks-to-master Co-authored-by: LG<luguang6@huawei.com> # message auto-generated for no-merge-commit merge: !40570 merge migrate-benchmarks-v2.7.1-to-master into master migrate-benchmarks-to-master Created-by: Lu_G Commit-by: LG Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ https://gitcode.com/Ascend/pytorch/issues/2999 > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!40570 | 2 个月前 | |
fix(benchmark): restrict remote model code execution Co-authored-by: liuyutong_bury<liuyutong25@huawei.com> # message auto-generated for no-merge-commit merge: !46978 merge codex/llm-remove-remote-code-master into master fix(benchmark): restrict remote model code execution Created-by: liuyutong_bury Commit-by: liuyutong_bury Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [x] 资料更新 关联 Issue:Fixes #5082 https://gitcode.com/Ascend/pytorch/issues/5082 # 【修改方案】 1. 删除 Transformers 4.57.1 已原生支持模型的 trust_remote_code=True,避免默认执行模型仓自定义 Python 代码。 2. Baichuan2 保留架构所需能力,但改为默认关闭的 --trust-remote-code 显式开关;远程仓启用时必须通过 --revision 固定完整 commit hash,本地模型目录不强制 revision。 3. 删除 Mamba2 和 Qwen2VL 样例中的个人绝对模型路径,改为必填参数。 4. 更新 Baichuan2/GLM4 README,说明远程代码风险、可信来源要求以及原生 GLM4 模型要求。 5. 修复本次涉及文件的尾随空格和 EOF 换行问题。 # 【资料变更】 涉及。Baichuan2 README 新增远程代码执行风险声明与固定 revision 要求;GLM4 README 说明使用 Transformers 内置实现,不执行模型仓自定义代码。 # 【接口变更】 涉及命令行参数变更: - Baichuan2 新增 --trust-remote-code,默认关闭。 - Baichuan2 新增 --revision;远程模型开启远程代码时必须提供完整的 40 位 commit hash。 - Mamba2 的 --model_path 和 Qwen2VL 的 --model_name_or_path 改为必填参数。 # 【功能验证】 - transformers==4.57.1 环境下完成 Mamba2、Qwen3、Qwen2VL、Llama3、GPT-OSS 原生配置/tokenizer/processor 加载 smoke 验证。 - Baichuan2 参数默认值验证为 trust_remote_code=False;远程路径开启开关但未提供固定 revision 时,会在模型加载前拒绝执行。 - 42 个分支相关 Python 文件通过 py_compile。 - 6 个 Baichuan2 启动脚本通过 bash -n。 - git diff --check、EOF 换行、尾随空格、Tab、120 字符行长及硬编码 trust_remote_code=True 扫描通过。 - 未执行完整模型训练,待 PR 流水线进一步验证。 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [x] 代码注释完备,正确记录错误日志 - [x] 代码实现进行了返回值、空指针等校验 - [x] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!46978 | 17 天前 | |
feat(benchmark): huggingface runner 接入 5 个 LLM 真实形状条目(DistillGPT2/XLNet/gemma-2-2b/gemma-3-4b-it /T5Small文本主干) Co-authored-by: huyuchao<huyuchao2@huawei.com> # message auto-generated for no-merge-commit merge: !46686 merge huyuchao/hf-llm-runner-entries into master feat(benchmark): huggingface runner 接入 5 个 LLM 真实形状条目(DistillGPT2/XLNet/gemma-2-2b/gemma-3-4b-it /T5Small文本主干) Created-by: huyuchao Commit-by: huyuchao Merged-by: ascend-robot Description: ## 内容(5 提交,3 文件 +153/-9,自洽交付——单独 checkout 本分支即可复现全部结论) | commit | 内容 | |---|---| | bfcadd70 | **四 LLM EXTRA_MODELS 真实形状条目**(config 随机初始化、无权重下载)+ gemma 版本守卫 + 显式 bs + seq=512 | | 70cfb9ce | 五条目 config ** use_cache=False** + NPU eager 非确定**豁免覆写** | | 769e97c2 | common.py **恢复上游 eager 非确定豁免机制**(基类空集,默认零行为变化) | | d2c83ad5 | **gemma_3_4b_it 入 SKIP_ACCURACY_CHECK_MODELS**(上游既有类别) | | be15d0e3 | **恢复上游 T5Small 条目**(急切 config 写法)+ 豁免集/use_cache 补齐 | ### 五条目明细 | 模型 | 承载 | 关键超参 | 性质 | |---|---|---|---| | DistillGPT2 | GPT2LMHeadModel | 6L/768d/12h, vocab 50257 | 修复死条目(transformers 无同名类,stock 必 AttributeError) | | XLNetLMHeadModel | XLNetLMHeadModel | xlnet-base 真实形状 12L/768d/12h/64hd, mem_len=null | 覆盖 XLNetConfig() 玩具形状(d_model=32) | | T5Small | T5ForConditionalGeneration | 6L/512d/8h/64d_kv/2048d_ff, vocab 32128 | **恢复上游既有条目**(上游 AutoConfig 懒加载,改为急切 config 避开 import 期网络依赖) | | gemma_2_2b | Gemma2ForCausalLM | 26L/2304d/8h-4kv/256hd, vocab 256000, sw 4096, softcap 50/30 | 新增 | | gemma_3_4b_it | Gemma3ForCausalLM(文本主干) | 34L/2560d/8h-4kv/256hd, vocab 262208, sw 1024/pattern 6, rope linear×8 | 新增;vision tower 不在文本 runner 范围 | 全部 config 随机初始化(无权重下载,runner 惯例);gemma 需 transformers>=4.50(ImportError 守卫:旧版条目自动缺席 + 启动版本 warning,其余套件不受影响);T5 无版本要求。 ## 五个精度堵点与对应修复(全部实测到代码/对象级) | 堵点 | 根因(实证) | 修复 | |---|---|---| | DistillGPT2/gemma_2/T5Small 被 eager_two_runs_differ 门拦 | 910B2 loss 路径 eager 偶发 1~2 ulp 非位确定(设备级、与后端无关,probe 实证);**上游对此类模型有官方豁免通道而本仓 common.py 丢失**(dynamobench/common.py:2401 有 skip_accuracy_check_as_eager_non_deterministic,fork 继承了门丢了豁免) | 769e97c2 恢复机制 + 70cfb9ce/be15d0e3 套件覆写 {DistillGPT2, gemma_2_2b, T5Small}(扩到 inference——上游仅 training 开)。豁免只跳过 tol=0 参考系自检门,**不跳过任何数值比对** | | 豁免后 fail_accuracy | 模型输出含 past_key_values(DynamicCache)(CausalLM 与 Seq2SeqLM 输出均如此)→ same() 对该结构**结构性崩**(探针进程级异常;runner 被 except 吞成 False)。XLNet 无 cache 对象通过,自洽 | 五 config use_cache=False(benchmark 推理本不需要 KV cache) | | gemma_3 eager_1st_run_OOM | accuracy 协议存活集(orig + maybe_cast 副本 + fp64 副本闭包残留)峰值 ~58GB > 60GB 卡实际余量;**协议语义本身仅需 ~33GB**(probe 复刻验证) | d2c83ad5 入 SKIP 名单(与上游 llama_v2_7b_16h/hf_GPT2_large 同类别——上游按"40GB 机器放不下"标定跳过)。runner 内存纪律修复(fp64 副本闭包释放 + maybe_cast 同 dtype 免拷贝)后可移出 | | T5Small 死键 | fork 演化时丢了 EXTRA 条目、仅剩 BATCH_SIZE_DIVISORS 残键(benchmark 仓历史 2475580 实证上游原有) | be15d0e3 按急刻 config 写法恢复(超参抄自官方 config.json)+ bs=8 | | (附带)import 期网络依赖 | 上游 T5 用 AutoConfig.from_pretrained 懒加载,需 HF Hub 可达 | 急切 config 构造:import 期零网络/零缓存(CI、内网必需) | ## 验证(910B2,torch 2.13.0+cpu,triton-ascend 3.2.2,最新 master b29d5da) ### performance(eager vs triton_experimental,最新 master b29d5da + 并行编译,同场冷缓存) | 模型 | bs | eager ms/iter | compiled ms/iter | speedup | 编译墙钟 | |---|---|---|---|---|---| | DistillGPT2 | 8 | 15.38 | 14.53 | **1.058x** | 67s | | XLNetLMHeadModel | 8 | 103.68 | 82.71 | **1.254x** | 95s | | T5Small | 4 | 21.18 | 15.06 | **1.407x** | 79s | | gemma_2_2b | 2 | 87.54 | 79.59 | **1.100x** | 148s | | gemma_3_4b_it | 2 | 135.57 | 128.76 | **1.053x** | 154s | 五模型全部编译通过全部加速(1.05~1.41x);gemma 两模型整图零断点,DistillGPT2 2 图 2 断。绝对 ms/speedup 随 master 前进与机况浮动(另一场四 LLM 复核:1.141/1.082/1.097/1.061x,eager 15.8/46.6/88.0/134.9ms),以同场比值为准。 ### accuracy(本 PR 五提交全量) | 模型 | 修复前 | 修复后 | |---|---|---| | DistillGPT2 | 门拦 → fail_accuracy | **pass_accuracy** | | XLNetLMHeadModel | pass_accuracy | **pass_accuracy**(回归无恙,不在豁免集) | | T5Small | (条目丢失不可测) | **pass_accuracy** | | gemma_2_2b | 门拦 → fail_accuracy | **pass_accuracy** | | gemma_3_4b_it | eager_1st_run_OOM(58.68GB) | **SKIP**(上游既有类别;协议语义需求 33GB,runner 内存纪律修复后可移出恢复完整检查) | 数值佐证:compiled-vs-eager 相对误差 1.2~1.8e-06、cos≈1.0(与设备自身 1~2 ulp 抖动同阶=fp32 累加序噪声,距比对容差 1e-3 三个数量级);compiled 自身位确定。 ## 环境要求 - gemma 两模型需 transformers>=4.50(守卫缺席+版本 warning);DistillGPT2/XLNet/T5Small 无额外要求 - perf 依赖 TE 后端编译通道修复(PR #46616 或 #46891 任一) 关联 issue: [#4981](https://gitcode.com/Ascend/pytorch/issues/4981)、[#5062](https://gitcode.com/Ascend/pytorch/issues/5062) See merge request: Ascend/pytorch!46686 | 12 天前 | |
migrate-benchmarks-to-master Co-authored-by: LG<luguang6@huawei.com> # message auto-generated for no-merge-commit merge: !40570 merge migrate-benchmarks-v2.7.1-to-master into master migrate-benchmarks-to-master Created-by: Lu_G Commit-by: LG Merged-by: ascend-robot Description: <!-- PR描述模板更新日期:20260203 --> # 【合入来源】 > <font color="red">**如有社区issue,请关联issue链接**</font>\ https://gitcode.com/Ascend/pytorch/issues/2999 > <font color="red">**请勿携带内部流程信息(需求链接、问题单、内部issue等)**</font> - [ ] 需求 - [ ] 问题单 - [x] issue/工单 - [ ] 重构优化 - [ ] 资料更新 # 【修改方案】 > 请描述修改内容的具体实现,涉及哪些组件之间进行交互,可以用1、2、3、...进行罗列\ > 如果是需求或者重构类的PR,需要补充详细设计文档(说明上下游组件关系、时序图、类图、DFX能力等内容) # 【资料变更】 > 请确认是否涉及资料变更。如涉及,需要在PR中体现,并简要说明修改内容。如不涉及,需填写“不涉及” # 【接口变更】 > 请确认是否涉及跨代码仓或者客户面可见的接口变更。如涉及,需要详细说明接口以及对应的变更内容,同时需要在资料中体现。如不涉及,需填写“不涉及” # 【功能验证】 > 说明测试场景,测试方法。如果本次测试方式与常规单元测试不同,请详细说明您的测试步骤\ > 新增/变更内容是否已新增/适配UT测试用例看护,并补充测试自验证截图 # 【CheckList】 > PR提交人对以下CheckList自检项进行全量自检,自检通过或不涉及,均修改 [ ] 为 [x] - [ ] 代码注释完备,正确记录错误日志 - [ ] 代码实现进行了返回值、空指针等校验 - [ ] PR标题正确使用类型标签,如:feat、fix、refactor、docs、test等 - [ ] PR持续集成流水线(CI)执行通过,代码检查无异常 See merge request: Ascend/pytorch!40570 | 2 个月前 |
| 文件 | 最后提交记录 | 最后更新时间 |
|---|---|---|
| 2 个月前 | ||
| 17 天前 | ||
| 12 天前 | ||
| 2 个月前 |