用户可参与大模型低精度量化竞赛,优化模型训练与推理性能。项目围绕文本到图像/视频生成任务,设量化感知训练和后训练量化方向,提供HiFloat等低精度格式支持及评估体系。【此简介由AI生成】
IEEE国际多媒体与博览会会议(ICME)2026大模型低精度量化挑战赛(大模型低位宽格式量化挑战赛)
本挑战赛是IEEE国际多媒体与博览会会议(ICME)2026的官方挑战赛道。
🔹 快速开始
1. 挑战赛详情
本挑战赛围绕文本到图像和文本到视频生成任务展开。挑战赛设立了两个主要研究方向,聚焦于大语言模型(LLM)的低精度计算。
方向A——量化感知训练(QAT)。
参赛者需使用指定的公共数据集和预训练模型,采用HiFloat8(HiF8) 数值格式[1]进行量化感知微调。目标是在降低训练和计算成本的同时,优化模型在下游任务上的精度。
方向B——训练后量化(PTQ)。
参赛者需直接对预训练模型进行推理时量化,以实现模型压缩和加速。本方向使用HiFloat4(HiF4) 或MXFP4等低精度格式。
基于这两个研究方向,设立了两个子挑战赛。每个子挑战赛均遵循“评估标准”部分规定的统一原则。
每位参赛者只能选择一个子挑战赛参与。
子挑战赛1:用于推理的W4A4量化(HiF4 / MXFP4)
LLM推理面临高昂的部署成本,这往往限制了应用的普及。对LLM中线性层的权重和激活进行量化,能有效提升推理性能。
本子挑战赛专注于4位权重和激活量化(W4A4),限定使用HiF4或MXFP4数值格式。参赛者需开发量化策略并应用于开源的最先进多模态生成模型Wan 2.2。 我们将使用综合的OpenS2V-5M数据集及相关的VBench[2]指标进行评分排名。
允许参赛者将有限数量的Transformer块保持高精度:MXFP4最多5层,HiF4最多2层。
W4A4量化迷你挑战赛
为促进和鼓励低精度数据格式量化研究,本分项挑战赛下设迷你挑战赛。该赛道不会与主竞赛排行榜进行正式排名。但提交至该赛道的成果将共同有资格参与创新奖类别的评选。
本迷你挑战赛的参考模型为Pangu-72B-2512。评估在标准下游任务数据集上进行,采用平均绝对百分比精度损失作为最终指标。
目标是在以下数据集上实现W4A4推理平均精度损失不超过BF16平均基线的1%:
- SuperGPQA
- IF-Eval
- AIME2025
- LiveCodeBench V6
- BFCL-V3
只有满足此目标的提交才有资格参与创新奖的评估。
分项挑战赛2:训练用W8A8量化(HiF8)
大型语言模型(LLM)训练成本高昂且迭代周期漫长,限制了快速发展。对线性层的权重和激活进行量化,并在注意力层中使用低精度格式,可有效降低数据移动成本,并通过低精度计算加速训练。
本任务专注于8位权重与激活量化以及注意力量化,且严格限定使用HiF8数值格式。测试模型为Wan2.1 T2V-1.3B。
鼓励参赛者尽可能采用延迟缩放策略[3],以进一步降低量化开销并加速训练。
训练方法将根据训练后模型使用BestWishYsh数据集生成的视频质量进行评估。
评估将使用Vbench指标,目标是精度损失低于0.5%。
允许参赛者保留有限数量的Transformer块采用高精度:使用HiF8训练时,最多可保留5层。
W8A8量化迷你挑战赛
本次子挑战赛下设一个迷你挑战赛,旨在鼓励对低精度训练方法的进一步探索。该赛道不会在主竞赛排行榜上进行正式排名,但符合条件的提交作品将有机会角逐创新奖。
本迷你挑战赛的测试模型为OpenPangu1B。鼓励参赛者采用延迟缩放策略,以降低量化开销并加速训练。
评估将在一系列语言模型基准上进行,包括但不限于:
- MMLU
- GSM8K
- MATH500
- HellaSwag
- ARC
- PIQA
目标指标为:
- 训练损失低于0.5%
- 精度损失低于1.0%
只有同时满足上述两个目标的提交作品才有资格参与创新奖的评选。
2. 参与和注册
🔗 报名表:
挑战赛注册
备用报名表 (仅在无法打开第一个注册链接时使用此链接。)
注册咨询:
📧 zhaoy21@tsinghua.org.cn
参与条款
- 获奖团队需在GitCode上开源其最终提交作品,包括所有源代码、相关材料及团队信息。相关要求参见开源说明。
- 参赛者应确保在参与前已获得所有必要的内部批准(如机构、公司或法律层面的批准)。
- 参与本次挑战赛即表示接受主办方制定的所有条款和条件。
- 每个参赛团队仅允许注册并提交一个子挑战赛。
严禁同一团队在不同子挑战赛中进行多次注册或提交。
如发现此类行为,组委会保留取消该团队参赛资格的权利。
3. 评估指标
所有提交作品将基于以下主要标准进行评估,总分100%。
评估分为两大类别:客观评估和主观评估。
I. 客观评估(占总分的70%)
本部分采用定量指标衡量模型性能。
最终得分基于比较排名计算。客观评估的分数依据以下各项的百分位排名得出。
1. 基线要求
该指标用于衡量模型输出与目标数据之间的差异或损失程度。损失越低,表明模型性能越优异、越准确。
要求:
-
Sub1
- 将全精度基线模型与MXFP4量化模型进行比较时,VBench精度指标的平均损失必须小于1%。
- 将全精度基线模型与HiF4量化模型进行比较时,VBench精度指标的平均损失必须小于0.5%。
-
Sub2
- 精度损失小于0.5%。
只有满足此基线要求的提交作品才能进入排名阶段。
2. 质量与多样性指标:VBench(50%)
- VBench:
用于视频生成性能的综合基准测试。
3. 量化比例(20%)
- 指从指定基准测试中的量化性能排名中得出的分数。
| 百分位排名 | 核心质量得分(权重:50%) | 量化比例得分(权重:20%) |
|---|---|---|
| 前10% | 50 | 20 |
| 前11% – 25% | 45 | 18 |
| 前26% – 50% | 35 | 14 |
| 前51% – 75% | 20 | 8 |
| 后25% | 10 | 4 |
| 不合格 | 0 | 0 |
II. 主观评价(占总分的30%)
本部分由技术专家和大学生志愿者组成的评审团进行感知质量评分。
1. 真实性与清晰度(20%)
-
评审人员:
大学生志愿者。 -
评价标准:
志愿者将对生成内容的视觉真实性进行评估。评审将根据语义一致性、图像质量和动态性,判断图像或视频在多大程度上看起来像是真实拍摄的,而非合成或AI生成的。
2. 创新性(10%)
-
评审人员:
技术专家。 -
评价标准:
-
算法原创性(权重:40%)
评估量化方法的创新程度,重点关注是否引入了新颖概念或对现有方法进行了实质性改进。 -
HiFloat原生探索(权重:30%)
考察解决方案是否深入利用了HiFloat数据格式的独特特性,并包含针对其高度优化的量化算法或计算流程。 -
泛化性(权重:20%)
评估解决方案的可迁移性及其在其他模型架构或不同任务场景中的潜在适用性。 -
工程价值(权重:10%)
关注代码质量与标准化程度、可复现性以及实际部署的便捷性。
-
4. 重要日期
| 阶段 | 描述 | 日期 |
|---|---|---|
| 报名 | 挑战赛报名期 | 2026年2月10日 – 2026年4月10日 |
| 提交 | 结果提交窗口 | |
| 评审 | 评审与可复现性验证 | |
| 公布 | 最终结果公布 | |
| 最终版本提交截止 | 最终版本提交截止 | 2026年5月15日 |
5. 提交方式
所有挑战赛的提交材料均须通过电子邮件发送,且应包含以下完整材料。材料不完整的提交可能被视为无效。
📧 提交邮箱: zhaoy21@tsinghua.org.cn
每次提交须打包为单个压缩文件(.zip / .tar.gz 格式),并包含:
- 量化后的模型权重文件(.pt / .ckpt / 或其他等效格式)
- 源代码(训练和/或推理相关)
- 技术报告(PDF 格式)
- 复现脚本及说明文档
请注意:
- 获奖团队需将所有源代码、材料及团队信息进行开源。
- 参赛团队确认并同意所提交材料为原创,且不侵犯任何第三方权利。
详情请参考奖项设置部分。
重要须知
- 所有提交材料必须完整且可复现。
- 缺乏充分文档或复现支持的提交可能被取消资格。
- 组委会保留在需要时要求提供补充信息或进行说明的权利。
6. 代码、工具与数据集
本挑战赛所使用的HiFloat8/4(HiF8/4)仿真工具包已正式发布。
参赛者需从以下仓库下载并使用 HiF8/4 仿真工具:
仓库的 README 文件中提供了详细的部署说明、环境配置及使用示例。
7. 奖项设置与成果发表政策
本次挑战赛设置奖项,以表彰在综合性能和技术创新方面表现突出的团队。
一、二、三等奖将根据各子挑战赛内的综合评估分数,为每个子挑战赛分别颁发;创新奖将在所有子挑战赛(包括迷你挑战赛提交作品)中进行评选,评选标准仅为原创性和突破性。
-
一等奖(每个子挑战赛):
3,000 美元 — 每个子挑战赛排名第 1 的参赛团队 -
二等奖(每个子挑战赛):
2,000 美元 — 每个子挑战赛排名第 2 的参赛团队 -
三等奖(每个子挑战赛):
1,000 美元 — 每个子挑战赛排名第 3 的参赛团队 -
创新奖(共四个名额,跨赛道):
每个奖项 800 美元
评选标准仅基于创新性指标
(符合条件的提交作品包括所有主赛道和迷你挑战赛的参赛作品)
发表机会
经过组委会评审并符合相关发表要求的优秀参赛作品,将有机会被推荐以技术报告形式发表于IEEE Xplore,并被EI Compendex收录。
此发表机会旨在表彰高质量且具创新性的研究成果,并为挑战赛的优秀成果提供更多学术与专业领域的曝光机会。
强制开源要求
所有获奖团队均需在GitCode上开源其最终提交材料,包括源代码、相关资料及团队信息。
这是获得任何奖项的强制条件。若在获奖结果公布后7个工作日内未按要求执行,可能导致资格取消及奖项撤销。
此外,若团队选择不遵守开源要求,可自愿放弃奖项。
8. 官方联系方式
有关挑战赛的任何问题,请联系:
主办方
-
全球计算联盟(GCC) Qianlin Zhang
-
清华大学 Wenbo Ding 博士
参考文献
[1] Luo Y., Zhang Z., Wu R., et al.
Ascend HiFloat8 Format for Deep Learning.
arXiv preprint, arXiv:2409.16626, 2024.
[2] Luo Y., Huang J., Cheng Y., et al. HiFloat4 Format for Language Model Inference. arXiv preprint, arXiv:2602.11287, 2026.
[3] Rouhani B D, Zhao R, More A, et al. Microscaling data formats for deep learning. arXiv preprint, arXiv:2310.10537, 2023.
[4] Peng H., Wu K., Wei Y., et al.
FP8-LM: Training FP8 Large Language Models.
arXiv preprint, arXiv:2310.18313, 2023.
[5] Huang Z., He Y., Yu J., et al.
VBench: Comprehensive Benchmark Suite for Video Generative Models.
In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2024, pp. 21807–21818.
注:基线代码、仿真工具、数据集及评估脚本将分阶段发布。请关注GitCode仓库获取更新。
Introduction
用户可参与大模型低精度量化竞赛,优化模型训练与推理性能。项目围绕文本到图像/视频生成任务,设量化感知训练和后训练量化方向,提供HiFloat等低精度格式支持及评估体系。【此简介由AI生成】
Customize your domain