可用于实时音视频交互、跨模态理解与处理等场景,是拥有5600亿参数(激活270亿)的顶尖开源全模态模型,具备高效多模态感知、低延迟音视频处理、128K上下文窗口及早期融合训练等核心亮点。【此简介由AI生成】