LLM Wiki
Search
搜索
探索
标签: 强化学习
此标签下有9条笔记。
2026年7月19日
DiffRO(可微奖励优化)
概念
语音合成
强化学习
后训练
2026年7月10日
生成式奖励模型(Generative Reward Model)
概念
强化学习
奖励模型
进阶
2026年7月10日
资料摘要:GSRM(生成式语音奖励模型)
语音合成
强化学习
奖励模型
大模型
深度
2026年7月01日
GRPO(组相对策略优化)
概念
进阶
强化学习
大模型
2026年7月01日
Policy Gradient(策略梯度)
概念
进阶
强化学习
后训练
2026年7月01日
verl
概念
工具
后训练
强化学习
开源
2026年6月05日
资料摘要:MCLP(角色扮演 TTS)
语音合成
强化学习
大模型
深度
2026年5月09日
PPO(近端策略优化)
概念
基础
长青
强化学习
对齐
RLHF
2026年5月08日
资料摘要:Plan-Critic
音频生成
语言模型
强化学习