已合并
[mindspore][master][sh&doc]add finetune data convert #2949
kongdeshuo创建于 2025年7月2日
[mindspore][master][sh&doc]add finetune data convert #2949
已合并
从refs/pull/2949/head合入到master
共 2 个文件变更+34-3
| @@ -78,9 +78,10 @@ torch.configs.set_pyboost(False) | |||
| 78 | 78 | ||
| 79 | ### 数据预处理 | 79 | ### 数据预处理 |
| 80 | 80 | ||
| 81 | -当前MindSpore后端已完全支持MindSpeed-LLM的多种任务场景下的数据预处理,数据预处理指南参见[数据预处理](../../../docs/pytorch/solutions/pretrain/pretrain_dataset.md)。 | 81 | +当前MindSpore后端,已完全支持MindSpeed-LLM的多种任务场景下的数据预处理 |
| 82 | 82 | ||
| 83 | -以预训练场景为例,只需在预训练数据预处理脚本`data_convert_qwen25_pretrain.sh`中配置好数据输入/输出路径、tokenizer模型路径,并启动即可: | 83 | +#### 预训练 |
| 84 | +以Alpaca数据集为例,在进行[数据预处理](../../../docs/pytorch/solutions/pretrain/pretrain_dataset.md)时,只需在预训练数据预处理脚本`data_convert_qwen25_pretrain.sh`中配置好数据输入/输出路径、tokenizer模型路径,并启动即可: | ||
| 84 | ```sh | 85 | ```sh |
| 85 | bash examples/mindspore/qwen25/data_convert_qwen25_pretrain.sh | 86 | bash examples/mindspore/qwen25/data_convert_qwen25_pretrain.sh |
| 86 | ``` | 87 | ``` |
| @@ -89,6 +90,23 @@ bash examples/mindspore/qwen25/data_convert_qwen25_pretrain.sh | |||
| 89 | ./dataset/alpaca_text_document.bin | 90 | ./dataset/alpaca_text_document.bin |
| 90 | ./dataset/alpaca_text_document.idx | 91 | ./dataset/alpaca_text_document.idx |
| 91 | ``` | 92 | ``` |
| 93 | +预训练时,数据集路径 --data-path 参数传入 ./dataset/alpaca_text_document 即可 | ||
| 94 | + | ||
| 95 | +#### 微调 | ||
| 96 | +以[Alpaca风格微调数据集处理](../../../docs/pytorch/solutions/finetune/datasets/alpaca_dataset.md)为例,只需在预训练数据预处理脚本`data_convert_qwen25_instruction.sh`中配置好数据输入/输出路径、tokenizer模型路径,并启动即可: | ||
| 97 | +```sh | ||
| 98 | +bash examples\mindspore\qwen25\data_convert_qwen25_instruction.sh | ||
| 99 | +``` | ||
| 100 | +微调数据集处理结果如下: | ||
| 101 | +```log | ||
| 102 | +./finetune_dataset/alpaca_packed_attention_mask_document.bin | ||
| 103 | +./finetune_dataset/alpaca_packed_attention_mask_document.idx | ||
| 104 | +./finetune_dataset/alpaca_packed_input_ids_document.bin | ||
| 105 | +./finetune_dataset/alpaca_packed_input_ids_document.idx | ||
| 106 | +./finetune_dataset/alpaca_packed_labels_document.bin | ||
| 107 | +./finetune_dataset/alpaca_packed_labels_document.idx | ||
| 108 | +``` | ||
| 109 | +微调时,数据集路径输入 ./finetune_dataset/alpaca 即可 | ||
| 92 | 110 | ||
| 93 | ### 训练 | 111 | ### 训练 |
| 94 | 112 | ||
| @@ -144,7 +162,7 @@ cd MindSpeed-LLM | |||
| 144 | bash examples/mindspore/qwen25/evalute_qwen25_7b_ms.sh | 162 | bash examples/mindspore/qwen25/evalute_qwen25_7b_ms.sh |
| 145 | ``` | 163 | ``` |
| 146 | 164 | ||
| 147 | -用户需要根据实际情况修改脚本中以下变量 | 165 | +用户需要根据实际情况修改脚本中以下变量。关于数据集,可参考[评估数据集](../../../docs/pytorch/solutions/evaluation/evaluation_datasets/mmlu_evaluation.md) |
| 148 | 166 | ||
| 149 | | 变量名 | 含义 | | 167 | | 变量名 | 含义 | |
| 150 | |--------|-----------------------| | 168 | |--------|-----------------------| |
| @@ -0,0 +1,13 @@ | |||
| 1 | +# 请按照您的真实环境修改 set_env.sh 路径 | ||
| 2 | +source /usr/local/Ascend/ascend-toolkit/set_env.sh | ||
| 3 | +mkdir ./finetune_dataset | ||
| 4 | + | ||
| 5 | +python ./preprocess_data.py \ | ||
| 6 | + --input ./dataset/train-00000-of-00001-a09b74b3ef9c3b56.parquet \ | ||
| 7 | + --tokenizer-name-or-path ./model_from_hf/qwen2.5_7b_hf/ \ | ||
| 8 | + --output-prefix ./finetune_dataset/alpaca \ | ||
| 9 | + --handler-name AlpacaStyleInstructionHandler \ | ||
| 10 | + --tokenizer-type PretrainedFromHF \ | ||
| 11 | + --workers 4 \ | ||
| 12 | + --log-interval 1000 \ | ||
| 13 | + --prompt-type qwen | ||