用户可利用该项目进行高效推理和低成本训练,其核心功能包括采用Multi-head Latent Attention和DeepSeekMoE架构,实现无辅助损失的负载均衡策略与多 token 预测训练目标,在14.8万亿高质量 token 上预训练,性能超越多数开源模型。【此简介由AI生成】
用户可利用该项目进行高效推理和低成本训练,其核心功能包括采用Multi-head Latent Attention和DeepSeekMoE架构,实现无辅助损失的负载均衡策略与多 token 预测训练目标,在14.8万亿高质量 token 上预训练,性能超越多数开源模型。【此简介由AI生成】