Knowledge domain
🤖 AI
大模型、生成模型、语音与音频智能、训练方法和 AI 基础设施。
103个知识页面
主题入口
核心概念
全部概念概念 · 2026-07-19CALM(连续自回归语言建模)一种将自回归 next-token prediction 从离散 token 扩展到连续潜变量的生成范式:在因果 LM 的每个位置用流匹配头(flow-matching head)替代 softmax 预测 rectified-flow 速度,消除离散 codec 的量化瓶颈,保留全部 LM 工具链(流式推理、上下文条件、高效训练)。概念 · 2026-07-19DiffRO(可微奖励优化)CosyVoice 3 提出的在离散语音 token 级别直接优化奖励的后训练方法,通过 Token2Text 模型将 ASR 后验概率作为可微奖励信号,避免完整波形合成的计算开销。概念 · 2026-07-19DPO(直接偏好优化)一种无需显式奖励模型和强化学习的偏好对齐方法,通过重参数化将 RLHF 目标转化为简单的二元交叉熵损失,仅需几行 PyTorch 代码即可实现。概念 · 2026-07-19FSQ(有限标量量化)将中间表示投影到低维空间后对每个维度独立做有界舍入取整,替代向量量化(VQ),实现码本 100% 利用率且无需学习码本。概念 · 2026-07-19GQA(分组查询注意力)一种多头注意力的变体,将多个查询头分组共享同一个键值头,大幅减少 KV 缓存大小,是 MHA 和 MQA 的中间方案,已成为 2023-2024 年大模型的标准配置。概念 · 2026-07-19KV Cache自回归 Transformer 推理时缓存历史 token 的 Key 和 Value 张量,避免每一步重复计算,以内存换速度的核心推理优化技术。概念 · 2026-07-19MLA(多头潜在注意力)DeepSeek-V2 提出的一种注意力机制创新,对 Key 和 Value 做低秩联合压缩到潜空间,将 KV 缓存减少 93.3% 的同时性能优于标准多头注意力(MHA)。概念 · 2026-07-19MoE(混合专家)一种神经网络架构模式,将模型参数划分为多个"专家"子网络,每个输入 token 仅激活其中少数几个专家,从而以较低的推理计算量获得巨大的总参数量。概念 · 2026-07-19RMSNormLayerNorm 的简化变体,仅使用均方根(RMS)统计量做归一化,去除了均值中心化步骤,计算更快且效果相当,已成为大模型的事实标准。概念 · 2026-07-19RoPE(旋转位置编码)一种通过旋转矩阵在注意力计算中编码相对位置信息的方法,已成为 2023 年后大模型的事实标准(LLaMA、DeepSeek、Qwen 等均采用)。概念 · 2026-07-13得分匹配(Score Matching)训练扩散模型的核心方法:让神经网络回归得分函数 $\nabla\log pt(x)$(对数似然的梯度)。因边缘得分不可算,改回归可解析的条件得分(去噪得分匹配),二者梯度相同。概念 · 2026-07-13离散扩散模型(CTMC)把流/扩散模型从连续空间 $\mathbb{R}^d$ 搬到离散状态空间(文本、DNA)的方法:用连续时间马尔可夫链(CTMC)替代 ODE/SDE、用速率矩阵 $Qt$ 替代向量场。训练退化为逐位置分类(交叉熵),掩码扩散语言模型(MDLM)是其代表。
综合分析
综合判断 · 2026-05-17LLM架构演进:Transformer已死?基于 2019-2026 年 67 个核心开源模型的架构演进回顾,论证 Transformer Decoder-Only 架构五大组件的创新空间已基本枯竭。这里的"死"并非技术消失,而是创新的低垂果实被摘完,进入边际效益递减的微调阶段。综合判断 · 2026-05-09DiT 论文全景DiT(Diffusion Transformer)自 2022 年底提出以来,已从图像生成扩散至视频、音频、语音合成等领域,并在 2024-2026 年经历了效率优化(MoE/量化/动态计算)和架构进化(MMDiT/RAE/PixelDiT)两轮浪潮,正成为扩散/流匹配模型的主流骨干。综合判断 · 2026-05-03CosyVoice 系列对比梳理阿里通义语音团队 CosyVoice 三代演进:从零样本 TTS 基础架构到流式合成再到百万小时多语言野外场景。
资料摘要
全部资料已读 · paper · 2026-07-19资料摘要:AudioCALMHKUST + 阿里通义 Fun Team 提出 CALM(Continuous Autoregressive Language Modeling) 范式——将自回归 next-token prediction 从离散 token 扩展到连续音频潜变量,以单一模型统一语音、音效和音乐生成,并在三类基准上均达到 SOTA。待阅读 · paper · 2026-07-19资料摘要:InstructGPTOpenAI 提出 RLHF(Reinforcement Learning from Human Feedback)方法的开创性论文,证明了用人类反馈微调可以让 1.3B 模型在指令遵循上超越 175B 的 GPT-3。已读 · paper · 2026-07-19资料摘要:MAR用扩散过程(Diffusion Loss)建模每个 token 的连续概率分布,证明自回归图像生成不需要向量量化。NeurIPS 2024 Spotlight,MIT/FAIR(Kaiming He 组)。已读 · paper · 2026-07-19资料摘要:UniMoE-Audio哈工大 + 微信 AI 提出 Dynamic-Capacity MoE 框架——通过 Top-P 动态路由、三类专家(路由/共享/空专家)和三阶段课程训练,首次在单一 7.1B 模型中统一语音合成与音乐生成,避免了联合训练的性能退化,在多项基准上达到 SOTA。待阅读 · video · 2026-07-13资料摘要:A100 SXM GPU 节点认识、配置与带宽测试五道口纳什的 32 分钟 A100 节点实操入门。以一台 8× A100 80GB SXM4 + 6× NVSwitch 节点为例,建立从 GPU 封装、节点内拓扑到算力/PCIe/NVLink/HBM 分层测试的最小心智模型。AI Infra 的关键不是背某个跑分,而是先判断数据正在跨越哪条硬件边界。待阅读 · paper · 2026-07-13An Introduction to Flow Matching and Diffusion Models(MIT 6.S184)MIT 6.S184《Generative AI With Stochastic Differential Equations》(2026) 官方讲义,Peter Holderrieth & Ezra Erives 著,84 页。以微分方程为统一语言,从零推导流匹配(Flow Matching)与扩散模型(Diffusion Models):把"生成"形式化待阅读 · paper · 2026-07-10资料摘要:GSRM(生成式语音奖励模型)Meta Superintelligence Labs 等提出 GSRM(Generative Speech Reward Model)——一个面向语音自然度评测、以「推理为中心」的生成式奖励模型。针对现有自然度评测器「把原始音频直接回归成一个标量分数」导致不可解释、跨领域难泛化的痛点,GSRM 把评测拆成两阶段:先做可解释的声学特征提取(音高/强度/时长等已读 · paper · 2026-07-09资料摘要:SD3(MMDiT)Stability AI 的 Stable Diffusion 3 技术报告。两大贡献:① 系统化改进 Rectified Flow 训练的噪声采样(提出偏向感知相关尺度的 logit-normal / mode / CosMap 时间步采样器);② 提出 MM-DiT(多模态扩散 Transformer)——文本流与图像流各持一套权重、在注意力处联合,实现已读 · paper · 2026-07-09资料摘要:TangoFluxTango 系列的第三代,换掉扩散生成范式:改用 Rectified Flow(Flow Matching)+ MMDiT/DiT 主干,仅 515M 参数即可在 A40 上 3.7s 生成 30s/44.1kHz 音频。提出在线偏好优化 CRPO(CLAP-Ranked Preference Optimization),迭代生成偏好数据对齐 rectifi已读 · paper · 2026-07-08资料摘要:Tango 2Tango 的直系升级:架构不变(仍是 Flan-T5 + LDM),在合成偏好数据集 Audio-alpaca 上用 DPO-diffusion 微调,让模型从"好/坏音频对比"中学习,显著提升与文本提示的语义对齐和多事件时序正确性。ACM MM 2024。已读 · paper · 2026-07-08资料摘要:Tango新加坡科技设计大学等提出的 TTA 模型,首次以指令微调 LLM(Flan-T5)作文本编码器,用 AudioLDM 63 分之 1 的数据量实现反超。待阅读 · paper · 2026-07-07资料摘要:Audio Flamingo 3NVIDIA + 马里兰大学的完全开源 SOTA 大型音频语言模型(LALM):统一语音/声音/音乐三模态的理解与推理。核心创新为 AF-Whisper 统一音频编码器、按需思考(on-demand thinking)、多轮多音频对话、长音频理解(≤10 分钟)与语音-语音交互。仅用开源音频数据即在 20+ 基准上超越 Qwen2.5-Omni、Gemini
最近更新
concept · 2026-07-19CALM(连续自回归语言建模)一种将自回归 next-token prediction 从离散 token 扩展到连续潜变量的生成范式:在因果 LM 的每个位置用流匹配头(flow-matching head)替代 softmax 预测 rectified-flow 速度,消除离散 codec 的量化瓶颈,保留全部 LM 工具链(流式推理、上下文条件、高效训练)。concept · 2026-07-19DiffRO(可微奖励优化)CosyVoice 3 提出的在离散语音 token 级别直接优化奖励的后训练方法,通过 Token2Text 模型将 ASR 后验概率作为可微奖励信号,避免完整波形合成的计算开销。concept · 2026-07-19DPO(直接偏好优化)一种无需显式奖励模型和强化学习的偏好对齐方法,通过重参数化将 RLHF 目标转化为简单的二元交叉熵损失,仅需几行 PyTorch 代码即可实现。concept · 2026-07-19FSQ(有限标量量化)将中间表示投影到低维空间后对每个维度独立做有界舍入取整,替代向量量化(VQ),实现码本 100% 利用率且无需学习码本。concept · 2026-07-19GQA(分组查询注意力)一种多头注意力的变体,将多个查询头分组共享同一个键值头,大幅减少 KV 缓存大小,是 MHA 和 MQA 的中间方案,已成为 2023-2024 年大模型的标准配置。concept · 2026-07-19KV Cache自回归 Transformer 推理时缓存历史 token 的 Key 和 Value 张量,避免每一步重复计算,以内存换速度的核心推理优化技术。