跳转到内容

输入关键词开始搜索

    资料摘要:Fugatto

    资料摘要更新 2026-05-08置信度 high待阅读原始来源 ↗#音频生成#基础模型#深度学习

    NVIDIA 的首个基础音频生成 Transformer 模型,支持自由文本指令和 ComposableART 组合控制,可合成前所未有的声音,ICLR 2025。 🔒 Fugatto 1 - Foundational Generative Audio Transformer Opus 1

    • 首个音频基础模型:Foundational Generative Audio Transformer,业界首个“音频基础模型”概念落地
    • 自由文本指令:支持自然语言描述驱动的音频合成与变换
    • ComposableART:推理时组合引导技术,可无缝组合、插值和否定指令,产生训练分布外的音频
    • 多任务能力:音乐、音效、语音的合成与变换
    • 2.5B 参数,训练于 50,000+ 小时音频数据,32 块 NVIDIA H100 GPU

    音频生成领域长期缺乏类似 GPT 的“基础模型”。Fugatto 旨在构建一个通用的音频合成与变换模型,能理解自由形式的文本指令。

    • 基于 T5 的 Transformer 架构,最大 25 亿参数
    • ComposableART:扩展 classifier-free guidance 到组合引导(compositional guidance),在推理时灵活组合不同指令
    • 专门的数据集生成方法,创造音频与语言的对应关系
    • 在多种任务上与专用模型持平或超越
    • 展现出“生成前所未闻的声音”的新兴能力
    • 可组合、插值、否定不同指令
    • 发表:ICLR 2025 (Poster)
    • 机构:NVIDIA
    • 规模:2.5B 参数,50,000+ 小时音频
    • Demo: fugatto.github.io