跳转到内容

输入关键词开始搜索

    资料摘要:DreamAudio

    资料摘要更新 2026-05-08置信度 high待阅读原始来源 ↗#音频生成#个性化#扩散模型

    定制化文本到音频生成(CTTA),从少量参考样本学习个性化音频概念,同时保持通用 T2A 性能,IEEE/ACM TASLP 2026 已接收。 🔒 DreamAudio - Customized Text-to-Audio Generation

    • 定制化音频生成(CTTA):从少量参考音频样本学习用户指定的音频概念(如特定声音风格、音效特征)
    • 保持通用能力:在学会新概念的同时不遗忘通用 T2A 能力
    • 少样本学习:仅需几段参考音频即可完成个性化
    • 首个 CTTA 方向系统工作:填补了音频生成从“通用”到“个性化”的空白

    文本到图像生成已有 DreamBooth 等定制化方法,但音频生成领域一直缺乏对应的个性化方案。DreamAudio 填补了这一空白。

    • 基于扩散模型的定制化训练策略
    • 少量参考样本即可学习个性化音频概念
    • 同时保持通用 T2A 性能(避免灾难性遗忘)

    为音频生成领域开辟了“个性化”方向,类似 DreamBooth 对图像生成的影响。

    • 发表:IEEE/ACM TASLP(已接收),2026
    • arXiv: 2509.06027