LongCat-AudioDiT:基于扩散模型的文本转语音项目

可用于高质量文本转语音及零样本语音克隆,是直接在波形潜在空间运行的扩散式TTS模型,简化了TTS pipeline,采用自适应投影引导提升生成质量,在Seed基准测试中实现SOTA性能。【此简介由AI生成】

Branch1Tags0

Introduction

可用于高质量文本转语音及零样本语音克隆,是直接在波形潜在空间运行的扩散式TTS模型,简化了TTS pipeline,采用自适应投影引导提升生成质量,在Seed基准测试中实现SOTA性能。【此简介由AI生成】

Customize your domain