模型使用导读
MindSpeed LLM 提供端到端的大语言模型训练方案,涵盖分布式预训练、分布式微调及推理等。
在快速入门(基于Megatron训练后端)或快速入门(基于FSDP2训练后端)中,用户可以基于Qwen3-8B模型快速掌握大语言模型的预训练和微调任务,下表详细介绍了MindSpeed LLM的模型使用方法。
表 1 模型训练方案及使用说明
| 分类 | 内容 | 使用场景 | 说明 |
|---|---|---|---|
| 预训练 | 大模型分布式预训练 | 提供数据预处理及预训练脚本,进行模型离线预训练 |
|
| 预训练 | 数据和权重在线加载训练 | 将数据预处理、权重转换和训练融为一体,提供从 HuggingFace 开源数据和权重到训练的一键式方案 |
|
| 微调 | 单样本微调 | 适用于单轮、无历史依赖任务的通用指令微调 | 微调脚本中训练参数的并行配置(如TP/PP/EP/VPP等)需与权重转换时保持一致。 |
| 推理 | 流式推理 | 支持 greedy_search、beam_search 等多种生成策略的流式输出 |
流式推理当前为固定Instruction输入,用于对比模型推理效果。 |