全部58
- 用户可利用该项目进行文本、视觉、音频的统一处理与生成。它采用离散原生自回归范式,整合语言、视觉和音频于单一离散空间,支持视觉理解与生成、语音交互及定制化语音克隆,性能强劲。【此简介由AI生成】Star
- like
- like
- 可用于实时音视频交互、跨模态理解与处理等场景,是拥有5600亿参数(激活270亿)的顶尖开源全模态模型,具备高效多模态感知、低延迟音视频处理、128K上下文窗口及早期融合训练等核心亮点。【此简介由AI生成】Star
- 可用于全面评估全模态模型的单模态与全模态能力,项目包含44种任务类型、5种模态组合的高质量数据集,创新多步开放式问题格式,配备自动评分模型,支持6种题型且准确率达95%。【此简介由AI生成】Star
- 暂无简介Star
- Star
- 暂无简介Star
- 暂无简介Star
- 暂无简介Star
- 暂无简介Star
- Star
- 暂无简介like
- 可用于为语音大语言模型提供音频 token 处理能力,实现极低码率下的高保真音频重建。该项目支持并行生成语义和声学 token,具备低帧率分词、低延迟流式解码及超分辨率功能。【此简介由AI生成】Star
- 暂无简介Star
- 暂无简介Star
- 暂无简介Star
- like
- 暂无简介Star
- 暂无简介Star
总计: 58