Knowledge library
浏览全部知识
这里展示的是内容价值,而不是仓库文件结构。通过领域、类型、标签和阅读状态找到下一条学习线索。
143个可搜索页面
显示 143 个页面
🤖 AI · concept · 2026-07-19CALM(连续自回归语言建模)一种将自回归 next-token prediction 从离散 token 扩展到连续潜变量的生成范式:在因果 LM 的每个位置用流匹配头(flow-matching head)替代 softmax 预测 rectified-flow 速度,消除离散 codec 的量化瓶颈,保留全部 LM 工具链(流式推理、上下文条件、高效训练)。🤖 AI · concept · 2026-07-19DiffRO(可微奖励优化)CosyVoice 3 提出的在离散语音 token 级别直接优化奖励的后训练方法,通过 Token2Text 模型将 ASR 后验概率作为可微奖励信号,避免完整波形合成的计算开销。🤖 AI · concept · 2026-07-19DPO(直接偏好优化)一种无需显式奖励模型和强化学习的偏好对齐方法,通过重参数化将 RLHF 目标转化为简单的二元交叉熵损失,仅需几行 PyTorch 代码即可实现。🤖 AI · concept · 2026-07-19FSQ(有限标量量化)将中间表示投影到低维空间后对每个维度独立做有界舍入取整,替代向量量化(VQ),实现码本 100% 利用率且无需学习码本。🤖 AI · concept · 2026-07-19GQA(分组查询注意力)一种多头注意力的变体,将多个查询头分组共享同一个键值头,大幅减少 KV 缓存大小,是 MHA 和 MQA 的中间方案,已成为 2023-2024 年大模型的标准配置。🤖 AI · concept · 2026-07-19KV Cache自回归 Transformer 推理时缓存历史 token 的 Key 和 Value 张量,避免每一步重复计算,以内存换速度的核心推理优化技术。🤖 AI · concept · 2026-07-19MLA(多头潜在注意力)DeepSeek-V2 提出的一种注意力机制创新,对 Key 和 Value 做低秩联合压缩到潜空间,将 KV 缓存减少 93.3% 的同时性能优于标准多头注意力(MHA)。🤖 AI · concept · 2026-07-19MoE(混合专家)一种神经网络架构模式,将模型参数划分为多个"专家"子网络,每个输入 token 仅激活其中少数几个专家,从而以较低的推理计算量获得巨大的总参数量。🤖 AI · concept · 2026-07-19RMSNormLayerNorm 的简化变体,仅使用均方根(RMS)统计量做归一化,去除了均值中心化步骤,计算更快且效果相当,已成为大模型的事实标准。🤖 AI · concept · 2026-07-19RoPE(旋转位置编码)一种通过旋转矩阵在注意力计算中编码相对位置信息的方法,已成为 2023 年后大模型的事实标准(LLaMA、DeepSeek、Qwen 等均采用)。🤖 AI · source · 2026-07-19资料摘要:AudioCALMHKUST + 阿里通义 Fun Team 提出 CALM(Continuous Autoregressive Language Modeling) 范式——将自回归 next-token prediction 从离散 token 扩展到连续音频潜变量,以单一模型统一语音、音效和音乐生成,并在三类基准上均达到 SOTA。🤖 AI · source · 2026-07-19资料摘要:InstructGPTOpenAI 提出 RLHF(Reinforcement Learning from Human Feedback)方法的开创性论文,证明了用人类反馈微调可以让 1.3B 模型在指令遵循上超越 175B 的 GPT-3。🤖 AI · source · 2026-07-19资料摘要:MAR用扩散过程(Diffusion Loss)建模每个 token 的连续概率分布,证明自回归图像生成不需要向量量化。NeurIPS 2024 Spotlight,MIT/FAIR(Kaiming He 组)。🤖 AI · source · 2026-07-19资料摘要:UniMoE-Audio哈工大 + 微信 AI 提出 Dynamic-Capacity MoE 框架——通过 Top-P 动态路由、三类专家(路由/共享/空专家)和三阶段课程训练,首次在单一 7.1B 模型中统一语音合成与音乐生成,避免了联合训练的性能退化,在多项基准上达到 SOTA。💰 金融投资 · concept · 2026-07-14成交量某一时段内已成交证券的数量,是交易活跃度与分歧的重要但非独立信息。💰 金融投资 · concept · 2026-07-14出水芙蓉低位长期缩量整理、均线粘合后,以放量大阳线突破多条均线的课程内形态。💰 金融投资 · concept · 2026-07-14大盘分时图以指数为对象展示市场日内变化,可比较加权与非加权口径。💰 金融投资 · concept · 2026-07-14大阳线实体显著为正的阳线;本课程以实体涨幅超过 7% 作为教学阈值。💰 金融投资 · concept · 2026-07-14大阴线实体显著为负的阴线;本课程以实体跌幅超过 7% 作为教学阈值。💰 金融投资 · concept · 2026-07-14个股分时图展示单只股票日内实时价格、分时均价和分钟成交量的图表。💰 金融投资 · concept · 2026-07-14黄昏之星中大阳线、十字星(或小实体)、中大阴线组成的三 K 线反转候选结构。💰 金融投资 · concept · 2026-07-14十字星开盘与收盘非常接近、实体极小且通常带影线的 K 线。💰 金融投资 · concept · 2026-07-14乌云盖顶阳线后高开深跌阴线构成的两 K 线看跌反转候选形态。💰 金融投资 · concept · 2026-07-14早晨之星大阴线、十字星(或小实体)、中大阳线组成的三 K 线反转候选结构。💰 金融投资 · concept · 2026-07-14长下影K线下影线明显长于实体和上影线的 K 线,记录盘中深跌后回收。💰 金融投资 · concept · 2026-07-14K线(蜡烛图)由开盘价、收盘价、最高价、最低价四个价格构成的可视化价格柱,是技术分析的最基本单元,每根 K 线即时反映该时段多空双方博弈的结果。💰 金融投资 · concept · 2026-07-14T形与倒T形K线开收盘与某一极值重合的特殊十字类 K 线。💰 金融投资 · topic · 2026-07-14股票基础知识教程B站 UP主「爱学习的小刚子」出品的股票基础知识系列教程,目前共 68 个分 P(标题称“全 70 讲”)。本页作为课程索引,记录已完成学习并已摄取的讲次;内容主要覆盖 K 线、分时图、成交量和基础形态。课程中的技术分析观点是条件化观察框架,不构成投资建议。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-002-个股分时图的看盘技巧本讲把个股分时图视为单根 K 线在盘中的展开:实时价格、分时均价线和分钟成交量共同呈现日内交易过程。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-003-大盘分时图的看盘技巧本讲区分大盘与个股分时图:以加权指数和不加权指数的相对位置,辅助观察权重股和中小盘股的相对表现。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-004-成交量、放量与缩量本讲定义成交量、成交额和换手率,强调放量与缩量都必须有比较基准,并应与价格方向和位置一同解读。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-005-大阳线的实操价值本讲以实体涨幅超过 7% 作为课程内大阳线定义,讨论其在起涨、高位和深跌后出现时的不同含义。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-006-经典K线形态“出水芙蓉”本讲将出水芙蓉描述为低位长期缩量整理、均线粘合后,以放量大阳线突破多条均线的课程内形态。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-007-大阴线出现后的应对策略本讲以实体跌幅超过 7% 的阴线为大阴线,强调高位大阴线与深跌后的大阴线要在不同风险框架下处理。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-008-经典K线形态“乌云盖顶”本讲介绍两根 K 线组成的乌云盖顶:阳线后高开深跌的阴线收盘深度进入前日阳线实体,在上升末端常被视为看跌反转警示。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-009-“十字星”K线的实操价值本讲强调十字星本身只表示当日多空暂时均衡;缩量/放量和后续中大阳线或中大阴线,才为反转叙事提供更多信息。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-010-经典K线组合形态“早晨之星”本讲以“大阴线—十字星—中大阳线”描述早晨之星,强调第三根中大阳线才是多方转强的关键确认。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-011-经典K线形态“黄昏之星”本讲将黄昏之星视为早晨之星镜像:中大阳线、十字星、中大阴线;第三根阴线是空方转强的确认。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-012-“T形”与“倒T形”K线的实操技巧本讲用 OHLC 位置定义 T 形和倒 T 形:前者开收高相同、留长下影,后者开收低相同、留长上影;操作解释高度依赖位置和背景。💰 金融投资 · source · 2026-07-14资料摘要:股票基础知识教程-013-长下影K线的实操技巧本讲将长下影 K 线解释为盘中深跌后被拉回;同样的外观在低位、上涨初期、高位和下跌途中可能对应完全不同的情境。🤖 AI · concept · 2026-07-13得分匹配(Score Matching)训练扩散模型的核心方法:让神经网络回归得分函数 $\nabla\log pt(x)$(对数似然的梯度)。因边缘得分不可算,改回归可解析的条件得分(去噪得分匹配),二者梯度相同。🤖 AI · concept · 2026-07-13离散扩散模型(CTMC)把流/扩散模型从连续空间 $\mathbb{R}^d$ 搬到离散状态空间(文本、DNA)的方法:用连续时间马尔可夫链(CTMC)替代 ODE/SDE、用速率矩阵 $Qt$ 替代向量场。训练退化为逐位置分类(交叉熵),掩码扩散语言模型(MDLM)是其代表。🤖 AI · concept · 2026-07-13GPU 节点互联与分层带宽GPU 性能不是一个 FLOPS 数字,而是 HBM、GPU 间 NVLink/NVSwitch、CPU–GPU PCIe、节点间网络 四层数据通路的共同结果。🤖 AI · concept · 2026-07-13VAE(变分自编码器)用概率化编码器 $q\phi(z\mid x)$ + 解码器 $p\theta(x\mid z)$ + KL 正则把数据压进一个"好采样"的低维潜空间。它是潜空间扩散(latent diffusion)的基础——让扩散/流模型在低维潜空间训练,从而支撑高分辨率图像/视频生成。🤖 AI · source · 2026-07-13资料摘要:A100 SXM GPU 节点认识、配置与带宽测试五道口纳什的 32 分钟 A100 节点实操入门。以一台 8× A100 80GB SXM4 + 6× NVSwitch 节点为例,建立从 GPU 封装、节点内拓扑到算力/PCIe/NVLink/HBM 分层测试的最小心智模型。AI Infra 的关键不是背某个跑分,而是先判断数据正在跨越哪条硬件边界。🤖 AI · source · 2026-07-13An Introduction to Flow Matching and Diffusion Models(MIT 6.S184)MIT 6.S184《Generative AI With Stochastic Differential Equations》(2026) 官方讲义,Peter Holderrieth & Ezra Erives 著,84 页。以微分方程为统一语言,从零推导流匹配(Flow Matching)与扩散模型(Diffusion Models):把"生成"形式化🤖 AI · concept · 2026-07-10生成式奖励模型(Generative Reward Model)用「生成推理文本再给分」替代「直接回归标量」的奖励模型——先产出思维链/评判理由,再输出可解释的评分。🤖 AI · source · 2026-07-10资料摘要:GSRM(生成式语音奖励模型)Meta Superintelligence Labs 等提出 GSRM(Generative Speech Reward Model)——一个面向语音自然度评测、以「推理为中心」的生成式奖励模型。针对现有自然度评测器「把原始音频直接回归成一个标量分数」导致不可解释、跨领域难泛化的痛点,GSRM 把评测拆成两阶段:先做可解释的声学特征提取(音高/强度/时长等🎃 外语 · topic · 2026-07-09外语外语领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。🎨 画画 · topic · 2026-07-09画画绘画领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。🎹 音乐 · topic · 2026-07-09音乐音乐领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。💻 CS · topic · 2026-07-09CS计算机科学领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。🔢 数学 · topic · 2026-07-09数学数学领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。🤖 AI · source · 2026-07-09资料摘要:SD3(MMDiT)Stability AI 的 Stable Diffusion 3 技术报告。两大贡献:① 系统化改进 Rectified Flow 训练的噪声采样(提出偏向感知相关尺度的 logit-normal / mode / CosMap 时间步采样器);② 提出 MM-DiT(多模态扩散 Transformer)——文本流与图像流各持一套权重、在注意力处联合,实现🤖 AI · source · 2026-07-09资料摘要:TangoFluxTango 系列的第三代,换掉扩散生成范式:改用 Rectified Flow(Flow Matching)+ MMDiT/DiT 主干,仅 515M 参数即可在 A40 上 3.7s 生成 30s/44.1kHz 音频。提出在线偏好优化 CRPO(CLAP-Ranked Preference Optimization),迭代生成偏好数据对齐 rectifi🛎️ 技能 · topic · 2026-07-09技能通用技能领域索引页(占位)。尚无资料摄取,首次 ingest 时在此汇总本领域的概念、资料摘要与领域详解页。🤖 AI · concept · 2026-07-08MMDiT(多模态扩散 Transformer)DiT 的多模态变体:文本流与图像流各持一套权重,仅在注意力处拼接做联合自注意力,实现两模态双向信息流动。出自 Stable Diffusion 3。🤖 AI · source · 2026-07-08资料摘要:Tango 2Tango 的直系升级:架构不变(仍是 Flan-T5 + LDM),在合成偏好数据集 Audio-alpaca 上用 DPO-diffusion 微调,让模型从"好/坏音频对比"中学习,显著提升与文本提示的语义对齐和多事件时序正确性。ACM MM 2024。🤖 AI · source · 2026-07-08资料摘要:Tango新加坡科技设计大学等提出的 TTA 模型,首次以指令微调 LLM(Flan-T5)作文本编码器,用 AudioLDM 63 分之 1 的数据量实现反超。🤖 AI · concept · 2026-07-07神经音频编解码(RVQ)用残差矢量量化(RVQ)把连续音频波形压成多层离散 token 的神经编解码器,是「音频语言模型」范式的前置组件——让 Transformer 能像处理文字一样自回归地生成声音。🤖 AI · concept · 2026-07-07CFG(无分类器引导)一种无需额外分类器的条件生成引导技术:同一模型联合学习条件与无条件两种预测,推理时把二者之差外推放大,用一个引导强度 $w$ 在「文本贴合度」与「多样性」之间换挡。🤖 AI · concept · 2026-07-07CLAP(对比语言-音频预训练)音频领域的 CLIP:联合训练文本编码器与音频编码器,用对比学习把配对的音频-文本拉近到同一潜空间。在本库中它身兼三职——生成空间、训练损失与评测指标。🤖 AI · concept · 2026-07-07LALM(大型音频语言模型)把音频(语音/声音/音乐)离散化或表示为 token 序列、用自回归语言模型统一建模理解与生成的大模型;将「文本 tokenizer + LLM」范式迁移到音频,使压缩、理解、生成、上下文学习在单一序列建模框架内涌现。🤖 AI · topic · 2026-07-07AI/音频生成通用音频生成领域 25 篇有影响力论文的汇总与导航,覆盖 2023–2026 奠基性工作到最新进展。🤖 AI · source · 2026-07-07资料摘要:Audio Flamingo 3NVIDIA + 马里兰大学的完全开源 SOTA 大型音频语言模型(LALM):统一语音/声音/音乐三模态的理解与推理。核心创新为 AF-Whisper 统一音频编码器、按需思考(on-demand thinking)、多轮多音频对话、长音频理解(≤10 分钟)与语音-语音交互。仅用开源音频数据即在 20+ 基准上超越 Qwen2.5-Omni、Gemini🤖 AI · source · 2026-07-07资料摘要:Qwen2.5-Omni阿里 Qwen 团队的端到端全模态模型(7B):单一模型同时感知文本/图像/音频/视频,并以流式方式同时生成文本与自然语音。核心创新为 Thinker-Talker 双脑架构 与 TMRoPE 时间对齐多模态位置编码,语音指令跟随能力逼近纯文本输入,2025.03。🤖 AI · source · 2026-07-07资料摘要:BagpiperCMU + LY Corporation + NVIDIA 提出 Bagpiper——一个 8B 音频基础模型,用丰富字幕(rich caption)作为「人类认知概念」的通用语义代理,通过 600B token 预训练在物理音频信号 ⇄ 丰富字幕之间建立稳健的双向映射;微调阶段采用 caption-then-process(先字幕后处理) 工作流,将开放式🤖 AI · source · 2026-07-07资料摘要:MusicGenMeta AI(FAIR)提出的单阶段 Transformer 语言模型音乐生成框架(NeurIPS 2023)。核心贡献是一套通用的 codebook 交错模式(interleaving patterns),把 EnCodec 产出的 $K4$ 路并行离散 token 用单个 Transformer 一次建模,彻底消除以往方法的多模型级联(分层 / 上采样🤖 AI · source · 2026-07-07资料摘要:Dasheng AudioGen小米 MiLM Plus + 上海交大 X-LANCE 提出的统一文本到音频框架,号称首个非自回归、专为「连贯混合音频场景」设计并评测的模型——能在同一段音频里同时生成可懂语音、音乐、音效与环境声。两大设计:① 结构化多视图字幕(把复杂声学场景拆成 6 个互补描述视图,各配专用特殊 token),提供细粒度分层监督;② 以 DashengTokenizer 🤖 AI · source · 2026-07-07资料摘要:DashengTokenizer小米 MiLM Plus 提出的统一连续音频 tokenizer,一套表示同时服务理解与生成。核心是范式反转:以往做法是训练声学 tokenizer 再蒸馏冻结的语义知识(把高维语义压进低维声学模型);本文反过来——冻结一个强语义编码器,往其高维语义特征里"注入"声学信息。方法极简:语义特征 zsem 由冻结的 MiDashengLM 编码器给出,声学特征 💰 金融投资 · source · 2026-07-03资料摘要:股票基础知识教程-001-K线的构成及市场意义B站 UP主「爱学习的小刚子」股票基础知识全 70 讲系列的第 1 讲:从 K 线的四个构成要素(开盘价/收盘价/最高价/最低价)出发,讲解阳线、阴线、特殊 K 线形态的结构,以及 K 线实体与影线反映的多空博弈市场含义。📙 人文社科 · concept · 2026-07-02古兰经伊斯兰教的圣书,据信是神(安拉)通过天使吉布利勒在 23 年间(610–632)向先知穆罕默德逐字启示的话语。全书 114 章,是伊斯兰教法、神学和社会规范的终极权威来源。📙 人文社科 · concept · 2026-07-02穆罕默德伊斯兰教的创始先知(570–632),被穆斯林尊为"封印的先知"(最后一位接受神启示的人)。从非宗教视角看,他也是七世纪阿拉伯半岛的一位社会改革家、思想家和战略家。📙 人文社科 · concept · 2026-07-02乌玛伊斯兰教构想中的超民族、超部落的穆斯林共同体——所有"顺从神的人"在信仰纽带下和谐共处的理想公社。古兰经 5:3:"今天我已为你们完美了你们的宗教……这个宗教就叫伊斯兰。"📙 人文社科 · concept · 2026-07-02希吉拉公元 622 年穆罕默德率信徒从麦加迁徙到麦地那的历史事件。被定为伊斯兰历元年(1 AH),标志着伊斯兰从地下精神运动转变为地上政权实体的转折点。📙 人文社科 · concept · 2026-07-02亚伯拉罕诸教以亚伯拉罕(易卜拉欣)为共同祖先的三大一神教:犹太教、基督教、伊斯兰教。📙 人文社科 · concept · 2026-07-02伊斯兰五功伊斯兰教的五大核心实践(正信、礼拜、斋戒、天课、朝觐),先知时代确立,所有穆斯林必须遵守。五功将部落血缘纽带替换为超越血缘的信仰纽带,是伊斯兰从部落社会走向统一社群的核心机制。📙 人文社科 · source · 2026-07-02资料摘要:伊斯兰简史(1)-伊斯兰的起源B 站 UP 主"青蛙刀圣1993"的 YouTube 视频,用"三本书"框架(犹太教/基督教/伊斯兰教)串联伊斯兰起源,分"穆斯林信仰视角"和"世俗历史视角"两种讲法,覆盖从亚伯拉罕到穆罕默德去世的完整脉络。🤖 AI · source · 2026-07-02资料摘要:VoxCPMVoxCPM 是清华大学 OpenBMB 推出的 Tokenizer-Free TTS 系统,通过端到端扩散自回归架构直接生成连续语音表示,绕过了离散 tokenization 的限制。VoxCPM-0.5B 发表于 ICLR 2026,后续 VoxCPM2 升级至 2B 参数、30 语言、48kHz 输出。🤖 AI · concept · 2026-07-01分布匹配蒸馏(DMD)用教师 score 与学生诱导分布 score 的差异来训练少步生成器,使学生分布直接匹配目标数据分布。🤖 AI · concept · 2026-07-01DDPM 前向与反向扩散公式推导前向加噪用重参数化一步直达,反向去噪用贝叶斯公式 + 神经网络近似——两者都是确定性推导,没有"玄学"。🤖 AI · concept · 2026-07-01GRPO(组相对策略优化)一种去掉 Critic(价值网络)的 PPO 变体:对同一提示采样一组输出,用组内奖励的相对分数(归一化)作为优势估计,省去与策略同等大小的价值模型,大幅降低 RL 对齐成本。🤖 AI · concept · 2026-07-01Knowledge Distillation(知识蒸馏)用一个更强的"教师模型"去训练一个较小/较弱的"学生模型",让学生模仿教师的行为——不仅是最终答案,更是教师对输出的概率判断。🤖 AI · concept · 2026-07-01On-Policy Distillation(在策略蒸馏)让学生模型自己采样轨迹,教师模型对每一步的每个 token 给出密集监督信号(reverse KL),结合了 on-policy 训练的相关性与蒸馏的密集梯度。🤖 AI · concept · 2026-07-01Policy Gradient(策略梯度)根据 reward / advantage,直接调整模型生成某个 token / action 的概率——如果好就提高概率,如果差就降低概率。🤖 AI · concept · 2026-07-01SFT(监督微调)在高质量人工标注的 prompt-回答对上进行标准的语言建模训练,使基座模型获得基础的指令遵循能力;是 RLHF 对齐流程的第一步。🤖 AI · concept · 2026-07-01verl字节跳动(Volcengine)开源的大模型 RL 后训练框架——不是模型,也不是单个算法,而是一套把大模型强化学习训练跑起来的工程基础设施。🤖 AI · source · 2026-07-01资料摘要:On-Policy DistillationThinking Machines Lab 提出 on-policy distillation:让学生模型自己采样轨迹,教师模型对每个 token 打分(dense reward),结合了 RL 的 on-policy 相关性与蒸馏的密集监督信号,在数学推理上达到 9–30× 成本降低,并可恢复领域微调后丢失的指令遵循能力。🤖 AI · concept · 2026-06-30音频生成利用深度学习模型从文本、图像、视频等条件输入自动合成音频内容(语音、音乐、音效、环境声等)的技术,2025-2026 年正从任务专用模型走向统一基础模型。🤖 AI · concept · 2026-06-30DiT(Diffusion Transformer)用 Transformer 架构替代传统 U-Net 作为扩散模型骨干的生成式架构,在图像和音频生成中展现出更强的可扩展性和多模态条件处理能力。🤖 AI · source · 2026-06-30资料摘要:ControlAudio清华+生数科技提出渐进扩散建模方法,首次在统一框架内实现文本引导 + 精确时间控制 + 可懂语音的音频生成,ACL 2026 Main。🤖 AI · concept · 2026-06-29条件流匹配(CFM)一种连续归一化流生成模型,通过匹配最优传输路径的向量场来学习从简单先验(高斯噪声)到数据分布(梅尔频谱)的连续变换,比扩散模型训练更快、生成步数更少。🤖 AI · concept · 2026-06-29Diffusion Autoregressive 架构Diffusion Autoregressive 架构是一种将自回归语言模型与扩散解码器结合的生成框架:自回归部分负责生成高层语义计划,扩散部分负责从语义计划恢复细粒度连续细节。🤖 AI · source · 2026-06-29资料摘要:DiTAR首个将扩散 Transformer 头附着在语言模型隐状态上做自回归语音生成的工作——LM 负责序列建模,每个位置用扩散去噪从隐状态恢复连续语音 patch。ICML 2025,字节跳动。🤖 AI · source · 2026-06-29资料摘要:GIVT首次将自回归 Transformer 的输出从离散 softmax 替换为高斯混合模型(GMM)参数,直接在连续潜空间预测像素值,无需向量量化。ECCV 2024,Google Research。🤖 AI · concept · 2026-06-15对抗后训练(Adversarial Post-Training)在已训练好的扩散/流匹配模型之上,用对抗损失在真实数据上微调,把多步迭代采样压缩到极少步(甚至单步)生成,同时恢复蒸馏会抹平的感知细节。🤖 AI · source · 2026-06-15资料摘要:AudioX-TurboHKUST + 清华 + Noiz AI 等提出的 efficient anything-to-audio 框架:在 统一多模态生成路线之上,引入 AudioX-Base 教师 → AudioX-Turbo 4-step 学生的少步蒸馏,核心是把 适配到 ,并叠加 diffusion-based discriminator。论文同时构建 IF-caps-Pr🤖 AI · source · 2026-06-15资料摘要:AudioX香港科技大学郭毅可团队提出的统一音频生成模型,单一 Diffusion Transformer 处理文本/视频/图像到音频等全部任务,ICLR 2026 接收。🤖 AI · concept · 2026-06-05多模态 LLM能够同时理解和生成多种模态(文本、图像、音频、视频)信息的大语言模型,从 2023 年的"视觉适配"演进到 2024 年的"原生全模态统一模型"。🤖 AI · source · 2026-06-05资料摘要:MCLP(角色扮演 TTS)ICML 2026(StepFun + 中科院自动化所)针对角色扮演 TTS(RP-TTS)的「风格一致性」这一缺乏客观度量的痛点,提出 MCLP(Mean Continuation Log-Probability,平均续接对数概率)——借助预训练 大型音频语言模型(LALM)的上下文学习能力,用「以生成语音为上下文、预测真值语音 token 的平均对数概率🤖 AI · source · 2026-06-05资料摘要:MOSS-Audio-Tokenizer复旦 OpenMOSS / MOSI.AI 提出的纯 Transformer、全端到端离散音频分词器,主张「音频 tokenizer 应像文本 tokenizer 一样,用同质可扩展架构从零端到端学习」。核心是 CAT(Causal Audio Tokenizer with Transformer)——CNN-free 的因果 Transformer 编码器🤖 AI · source · 2026-06-05资料摘要:MOSS-TTS复旦 OpenMOSS(SII-OpenMOSS)的语音生成基础模型,主张回归语音合成的核心配方:离散音频 token + 自回归建模 + 大规模预训练。构建在 (CAT,24kHz→12.5fps 变比特率 RVQ)之上,发布两个互补生成器:MOSS-TTS(Delay-Pattern 单骨干,结构简单、可扩展、长上下文/控制导向)与 MOSS-TTS-L🤖 AI · source · 2026-06-05资料摘要:Stable Audio 3Stability AI 的旗舰潜空间扩散音频生成模型家族(small / medium / large),面向乐器音乐与音效的变长生成与编辑。核心由三部分构成:一个 4096× 超高压缩比的语义-声学自编码器(SAME)、一个用 + 蒸馏 + 三阶段训练的 、以及推理端 8 步 Ping-Pong 采样(无需 CFG)。在 H200 上🤖 AI · source · 2026-06-04资料摘要:MOSS-SoundEffect v2复旦 OpenMOSS 团队(MOSI.AI)开源的文本到音效(TTA)模型,是 MOSS-TTS 家族的"声音设计层"。v2.0 用 DiT 扩散骨干 + Flow Matching 目标(搭配 DAC VAE 与 Qwen3 文本编码器)重构了 v1 的离散 token 自回归(MossTTSDelay)架构,面向更高保真和更自然的长音频环境声,支持中/🤖 AI · source · 2026-05-26资料摘要:GenAU卡内基梅隆大学等提出的环境声音生成全栈方案,从数据管道(AutoReCap-XL,4700 万片段)到自动标注模型(AutoCap,CIDEr 83.2)再到 FIT-based 生成架构(GenAu,1.25B 参数),系统性地解决了环境音频生成的数据稀缺、标注质量和模型缩放三大瓶颈,arXiv 2024.06(v4 更新至 2025.04)。🤖 AI · source · 2026-05-25资料摘要:AudioLDM萨里大学等提出的文本到音频(TTA)生成模型,基于 CLAP 潜空间 + 潜空间扩散模型,首次实现零样本音频操作,ICML 2023。🤖 AI · source · 2026-05-25资料摘要:DiffRhythm西北工业大学 & 港中深提出的首个潜空间扩散全曲生成模型,10秒内生成长达 4 分 45 秒的完整歌曲(人声+伴奏),彻底绕开级联架构。🤖 AI · source · 2026-05-25资料摘要:UniSonate首个统一语音(TTS)、音乐(TTM)、音效(TTA)三模态的 flow-matching 框架,提出 Instruction-Content Alignment 范式和 Dynamic Token Injection 机制,通过多阶段课程学习实现正迁移——联合训练反而让 WER 从 2.24% 降到 1.47%。论文来自天津大学 + 快手可灵团队 + 中科🤖 AI · concept · 2026-05-19Tokenizer-Free TTSTokenizer-Free TTS 是一种直接生成连续语音表示(而非离散 token 序列)的语音合成范式,通过可微分的端到端架构绕过传统语音 tokenizer 的语义-声学鸿沟。🤖 AI · entity · 2026-05-19VoxCPMVoxCPM 是清华大学 OpenBMB 和 THUHCSI 联合推出的 Tokenizer-Free TTS 系统,采用扩散自回归架构直接生成连续语音表示。最新版 VoxCPM2 拥有 2B 参数、支持 30 种语言、48kHz 音频输出和语音设计能力。🤖 AI · source · 2026-05-17资料摘要:LLM架构演进三年回顾B站视频:上帝视角拆解三年 LLM 架构演进(2019 GPT-2 → 2026 DeepSeek V4),梳理 67 个核心开源模型的架构变化,核心结论:Transformer 五大组件的架构创新空间已基本枯竭。🤖 AI · synthesis · 2026-05-17LLM架构演进:Transformer已死?基于 2019-2026 年 67 个核心开源模型的架构演进回顾,论证 Transformer Decoder-Only 架构五大组件的创新空间已基本枯竭。这里的"死"并非技术消失,而是创新的低垂果实被摘完,进入边际效益递减的微调阶段。🤖 AI · concept · 2026-05-09PPO(近端策略优化)OpenAI 提出的强化学习算法,通过裁剪目标函数约束策略更新幅度,避免策略崩溃;是 RLHF 第三步(PPO 优化阶段)的核心算法。🤖 AI · source · 2026-05-09资料摘要:DiTPeebles & Xie (UC Berkeley/NYU) 提出 Diffusion Transformer —— 用 ViT 架构替代 U-Net 作为扩散模型骨干,在 ImageNet 上实现 SOTA,并确立了 DiT 作为后续 Sora、SD3、FLUX 等工作的基石。ICCV 2023。🤖 AI · synthesis · 2026-05-09DiT 论文全景DiT(Diffusion Transformer)自 2022 年底提出以来,已从图像生成扩散至视频、音频、语音合成等领域,并在 2024-2026 年经历了效率优化(MoE/量化/动态计算)和架构进化(MMDiT/RAE/PixelDiT)两轮浪潮,正成为扩散/流匹配模型的主流骨干。🤖 AI · source · 2026-05-08资料摘要:连续值 Token 音频语言模型用连续值 token + 掩码下一 token 预测替代离散 RVQ 的量化损失,为音频语言模型提供新范式,ICML 2025。🤖 AI · source · 2026-05-08资料摘要:通用听觉智能综述综述 LLM 与音频融合的最新进展:理解、生成、口语对话和视听联合,提出"通用听觉智能"路线图,2025 年 11 月。🤖 AI · source · 2026-05-08资料摘要:DreamAudio定制化文本到音频生成(CTTA),从少量参考样本学习个性化音频概念,同时保持通用 T2A 性能,IEEE/ACM TASLP 2026 已接收。🤖 AI · source · 2026-05-08资料摘要:FugattoNVIDIA 的首个基础音频生成 Transformer 模型,支持自由文本指令和 ComposableART 组合控制,可合成前所未有的声音,ICLR 2025。🤖 AI · source · 2026-05-08资料摘要:Khala探索将声学 Token 语言模型扩展到高保真音乐生成的极限,使用 64 层 RVQ 和两阶段 coarse-to-fine 生成策略,2026 年 5 月。🤖 AI · source · 2026-05-08资料摘要:LongCat-AudioDiT非自回归扩散 TTS,直接在波形潜空间(Wav-VAE)上建模,绕过 mel-spectrogram 实现高保真零样本语音克隆,2026 年 3 月。🤖 AI · source · 2026-05-08资料摘要:Plan-Critic发现 AR 音频生成模型中前缀 token 隐式编码全局语义,用 GAE 训练的 Plan-Critic 在推理时引导并剪枝低质量轨迹,CLAP 分数提升最高 +10 分,EACL 2026。🤖 AI · source · 2026-05-08资料摘要:Score-Based 音频生成综述Ge Zhu 等人全面综述扩散/Score-Based 模型在音频生成中的应用,附带开源代码库 AudioDiffuser,本领域必读综述,2025 年发表在 Foundations and Trends in Signal Processing。🤖 AI · source · 2026-05-08资料摘要:SirenLM-based 文本到音频生成方法,通过反因果对齐和强化学习首次超越 Diffusion 模型,EMNLP 2025。🤖 AI · concept · 2026-05-04对齐税在对语言模型进行安全/有用性对齐训练时,模型在部分下游任务上的能力出现退化的现象。降低对齐税是对齐研究的核心工程目标之一。🤖 AI · concept · 2026-05-04Constitutional AIAnthropic 提出的对齐训练方法,基于显式书写的伦理原则宪章(Constitution)指导模型行为,通过 AI 自我批评和自我改进减少对人类标注的依赖。🤖 AI · concept · 2026-05-04RLHF(人类反馈强化学习)一种将人类偏好作为训练信号,通过强化学习使语言模型输出更符合人类意图的对齐方法。🤖 AI · source · 2026-05-04资料摘要:Claude 3Anthropic 推出的 Claude 3 模型家族(Opus/Sonnet/Haiku),通过 Constitutional AI 训练,Opus 在 GPQA/MMLU/MMMU 等基准上达到 SOTA,200K 上下文窗口(生产环境)。🤖 AI · source · 2026-05-04资料摘要:DeepSeek-V2DeepSeek 推出的 236B MoE 模型(激活 21B),引入 Multi-head Latent Attention (MLA) 和 DeepSeekMoE 两大架构创新,KV 缓存减少 93.3%,训练成本降低 42.5%,引发中国大模型价格战。🤖 AI · source · 2026-05-04资料摘要:DPOStanford 提出的 Direct Preference Optimization,将 RLHF 的复杂两步流程(训练 RM + PPO)简化为单一分类损失,仅需几行 PyTorch 代码即可实现对齐训练。🤖 AI · source · 2026-05-04资料摘要:GeminiGoogle DeepMind 推出的原生多模态模型家族(Ultra/Pro/Nano),联合训练于图像、音频、视频和文本数据。Ultra 是首个在 MMLU 上超越人类专家的模型(90.04%),在 32 项基准中的 30 项达到 SOTA。🤖 AI · source · 2026-05-04资料摘要:GPT-4 Technical ReportOpenAI 发布的 GPT-4 技术报告,展示了多模态 Transformer 在专业基准上的人类水平表现(律师考试前 10%)。以安全性为由有意省略架构细节和模型规模。🤖 AI · source · 2026-05-04资料摘要:GPT-4o System CardOpenAI 发布的 GPT-4o 安全系统卡,首个"全模态"模型(文本+视觉+音频统一网络),音频响应时间 320ms 接近人类对话速度。🤖 AI · source · 2026-05-04资料摘要:Llama 2Meta 推出的开源大模型系列(7B/13B/70B),首次对 RLHF 对齐方法论进行全面透明披露,对话模型在人类评估中与 ChatGPT 相近。🤖 AI · source · 2026-05-04资料摘要:Llama 3Meta 推出的 Llama 3.1 模型系列(8B/70B/405B),405B 旗舰首次实现开源模型与 GPT-4 水平相当的性能。92 页技术报告详尽记录训练基础设施、数据管线、缩放法则和后训练方法。🤖 AI · source · 2026-05-04资料摘要:LLaMAMeta AI 推出的开源基础语言模型系列(7B-65B),证明仅用公开数据就能训练出超越 GPT-3 175B 的模型,彻底改变了开源 LLM 生态。🤖 AI · source · 2026-05-04资料摘要:MixtralMistral AI 推出的稀疏混合专家 (SMoE) 模型,47B 总参数仅激活 13B/token,在多数基准上超越 Llama 2 70B,Instruct 版本在人类评估中优于 GPT-3.5、Gemini Pro 和 Claude 2.1。Apache 2.0 许可。🤖 AI · source · 2026-05-04资料摘要:Qwen2阿里通义千问团队推出的全面开源模型系列(0.5B-72B 密集模型 + 57B MoE),72B 在多项基准上超越 Llama-3-70B,72B-Instruct 在 MT-Bench 达 9.12、Arena-Hard 48.1。🤖 AI · concept · 2026-05-03S³ Tokenizer(监督语义语音分词器)通过在 ASR 模型的编码器中插入量化层,利用 ASR 损失显式监督学习离散语音 token,使 token 天然与文本语义对齐,区别于无监督 tokenizer(EnCodec、HuBERT 等)。🤖 AI · source · 2026-05-03资料摘要:CosyVoice 2在 CosyVoice 基础上引入有限标量量化(FSQ)替代 VQ、以预训练 LLM(Qwen2.5-0.5B)为骨干、设计分块感知因果流匹配统一流式/非流式合成,首次实现流式零样本 TTS 的人类水平自然度。🤖 AI · source · 2026-05-03资料摘要:CosyVoice 3CosyVoice 3 通过百万小时数据 + 1.5B 参数规模化、基于 MinMo 多任务监督的语音 tokenizer 和可微奖励优化(DiffRO)后训练,实现 9 语言 × 18 方言的野外零样本语音合成,内容一致性相对前代提升超 50%。🤖 AI · source · 2026-05-03资料摘要:CosyVoice首个将监督语义语音 token 引入 TTS 的工作,提出 LLM + 条件流匹配的两阶段零样本语音合成架构,在内容一致性和说话人相似度上超越无监督 token 方案。🤖 AI · comparison · 2026-05-03CosyVoice 系列对比梳理阿里通义语音团队 CosyVoice 三代演进:从零样本 TTS 基础架构到流式合成再到百万小时多语言野外场景。
没有匹配的页面,请调整筛选条件。