跳转到内容

输入关键词开始搜索

    资料摘要:LongCat-AudioDiT

    资料摘要更新 2026-05-08置信度 high待阅读原始来源 ↗#音频生成#语音合成#扩散模型

    非自回归扩散 TTS,直接在波形潜空间(Wav-VAE)上建模,绕过 mel-spectrogram 实现高保真零样本语音克隆,2026 年 3 月。 🔒 LongCat-AudioDiT - High-Fidelity Diffusion TTS

    • 波形潜空间建模:使用 Wav-VAE 直接在波形潜空间上做扩散,绕过传统 mel-spectrogram 中间表示
    • 3.5B 参数 DiT:大规模 Diffusion Transformer 用于 TTS
    • 零样本语音克隆 SOTA:Seed-ZH SIM 0.818,Seed-Hard SIM 0.797
    • 非自回归:扩散生成,避免 AR 模型的误差累积

    传统 TTS 依赖 mel-spectrogram 作为中间表示,存在信息损失。LongCat-AudioDiT 直接在波形潜空间建模,减少信息瓶颈。

    • Wav-VAE:将波形压缩到潜空间
    • 3.5B 参数 DiT 在潜空间上做扩散生成
    • 非自回归生成,避免误差累积
    • 零样本语音克隆超越 Seed-TTS 等专用模型
    • 中英文场景均表现优异
    • 时间:2026.03
    • arXiv: 2603.29339
    • 规模:3.5B 参数