DeepSeek-V3:基于混合专家(MoE)架构的大型语言模型项目

用户可利用该项目进行高效推理和低成本训练,其核心功能包括采用Multi-head Latent Attention和DeepSeekMoE架构,实现无辅助损失的负载均衡策略与多 token 预测训练目标,在14.8万亿高质量 token 上预训练,性能超越多数开源模型。【此简介由AI生成】

分支1Tags1

项目介绍

用户可利用该项目进行高效推理和低成本训练,其核心功能包括采用Multi-head Latent Attention和DeepSeekMoE架构,实现无辅助损失的负载均衡策略与多 token 预测训练目标,在14.8万亿高质量 token 上预训练,性能超越多数开源模型。【此简介由AI生成】

定制我的领域