LLM Wiki
Search
搜索
探索
标签: RLHF
此标签下有8条笔记。
2026年7月19日
DPO(直接偏好优化)
概念
基础
长青
对齐
RLHF
2026年7月19日
资料摘要:InstructGPT
深度
基础
长青
大模型
对齐
RLHF
2026年7月01日
SFT(监督微调)
概念
基础
长青
大模型
对齐
RLHF
2026年7月01日
资料摘要:On-Policy Distillation
蒸馏
后训练
深度
进阶
RLHF
对齐
2026年5月09日
PPO(近端策略优化)
概念
基础
长青
强化学习
对齐
RLHF
2026年5月04日
对齐税
概念
进阶
长青
对齐
RLHF
2026年5月04日
资料摘要:DPO
深度
基础
长青
大模型
对齐
RLHF
2026年5月04日
资料摘要:Llama 2
深度
基础
长青
大模型
开源
对齐
RLHF