跳转到内容

输入关键词开始搜索

    资料摘要:通用听觉智能综述

    资料摘要更新 2026-05-08置信度 high待阅读原始来源 ↗#音频生成#综述#多模态#基础模型

    综述 LLM 与音频融合的最新进展:理解、生成、口语对话和视听联合,提出“通用听觉智能”路线图,2025 年 11 月。 🔒 Towards General Auditory Intelligence - Survey

    • LLM + 音频融合全景:系统梳理大语言模型与音频的深度整合
    • 四大方向:音频理解、音频生成、口语对话、视听联合
    • 通用听觉智能路线图:提出音频生成向 AGI 靠拢的发展路径
    • 关键挑战:数据稀缺、评测不统一、实时性需求
    1. 音频理解(ASR、音频分类、音频问答等)
    2. 音频生成(TTS、音乐、音效、通用音频生成)
    3. 口语对话系统
    4. 视听联合学习
    5. 未来方向:音频原生 token、统一多模态架构

    为音频 AI 研究提供了宏观视角,将音频生成置于“通用听觉智能”的大框架下思考。

    • 时间:2025.11
    • arXiv: 2511.01299