已合并
[mindspore][master][sh&doc]add finetune data convert #2949
kongdeshuo创建于 2025年7月2日
[mindspore][master][sh&doc]add finetune data convert #2949
已合并
kongdeshuo创建于 2025年7月2日
refs/pull/2949/head合入到master
2 个文件变更+34-3
Mexamples/mindspore/qwen25/README.md+21-3
@@ -78,9 +78,10 @@ torch.configs.set_pyboost(False)
78 78 
79### 数据预处理79### 数据预处理
80 80 
81-当前MindSpore后端已完全支持MindSpeed-LLM的多种任务场景下的数据预处理,数据预处理指南参见[数据预处理](../../../docs/pytorch/solutions/pretrain/pretrain_dataset.md)。81+当前MindSpore后端已完全支持MindSpeed-LLM的多种任务场景下的数据预处理
82 82 
83-预训练场景为例,只需在预训练数据预处理脚本`data_convert_qwen25_pretrain.sh`中配置好数据输入/输出路径、tokenizer模型路径,并启动即可:83+#### 预训练
84+以Alpaca数据集为例,在进行[数据预处理](../../../docs/pytorch/solutions/pretrain/pretrain_dataset.md)时,只需在预训练数据预处理脚本`data_convert_qwen25_pretrain.sh`中配置好数据输入/输出路径、tokenizer模型路径,并启动即可:
84```sh85```sh
85bash examples/mindspore/qwen25/data_convert_qwen25_pretrain.sh86bash examples/mindspore/qwen25/data_convert_qwen25_pretrain.sh
86```87```
@@ -89,6 +90,23 @@ bash examples/mindspore/qwen25/data_convert_qwen25_pretrain.sh
89./dataset/alpaca_text_document.bin90./dataset/alpaca_text_document.bin
90./dataset/alpaca_text_document.idx91./dataset/alpaca_text_document.idx
91```92```
93+预训练时,数据集路径 --data-path 参数传入 ./dataset/alpaca_text_document 即可
94+ 
95+#### 微调
96+以[Alpaca风格微调数据集处理](../../../docs/pytorch/solutions/finetune/datasets/alpaca_dataset.md)为例,只需在预训练数据预处理脚本`data_convert_qwen25_instruction.sh`中配置好数据输入/输出路径、tokenizer模型路径,并启动即可:
97+```sh
98+bash examples\mindspore\qwen25\data_convert_qwen25_instruction.sh
99+```
100+微调数据集处理结果如下:
101+```log
102+./finetune_dataset/alpaca_packed_attention_mask_document.bin
103+./finetune_dataset/alpaca_packed_attention_mask_document.idx
104+./finetune_dataset/alpaca_packed_input_ids_document.bin
105+./finetune_dataset/alpaca_packed_input_ids_document.idx
106+./finetune_dataset/alpaca_packed_labels_document.bin
107+./finetune_dataset/alpaca_packed_labels_document.idx
108+```
109+微调时,数据集路径输入 ./finetune_dataset/alpaca 即可
92 110 
93### 训练111### 训练
94 112 
@@ -144,7 +162,7 @@ cd MindSpeed-LLM
144bash examples/mindspore/qwen25/evalute_qwen25_7b_ms.sh162bash examples/mindspore/qwen25/evalute_qwen25_7b_ms.sh
145```163```
146 164 
147-用户需要根据实际情况修改脚本中以下变量165+用户需要根据实际情况修改脚本中以下变量。关于数据集,可参考[评估数据集](../../../docs/pytorch/solutions/evaluation/evaluation_datasets/mmlu_evaluation.md)
148 166 
149 | 变量名 | 含义 |167 | 变量名 | 含义 |
150 |--------|-----------------------|168 |--------|-----------------------|
Aexamples/mindspore/qwen25/data_convert_qwen25_instruction.sh+13-0
@@ -0,0 +1,13 @@
1+# 请按照您的真实环境修改 set_env.sh 路径
2+source /usr/local/Ascend/ascend-toolkit/set_env.sh
3+mkdir ./finetune_dataset
4+ 
5+python ./preprocess_data.py \
6+ --input ./dataset/train-00000-of-00001-a09b74b3ef9c3b56.parquet \
7+ --tokenizer-name-or-path ./model_from_hf/qwen2.5_7b_hf/ \
8+ --output-prefix ./finetune_dataset/alpaca \
9+ --handler-name AlpacaStyleInstructionHandler \
10+ --tokenizer-type PretrainedFromHF \
11+ --workers 4 \
12+ --log-interval 1000 \
13+ --prompt-type qwen