← 返回全部标签

TAG

#LLM

26 篇文章。

🗒️TRL学习

我从学习者角度整理 Hugging Face TRL:把它理解成大模型后训练工具箱,并梳理 SFT、DPO、GRPO、Reward Modeling 和 PPO 的学习路线。