← 返回首页

CATEGORY

LLM

这个主题下共收录 14 篇文章。

🗒️TRL学习

我从学习者角度整理 Hugging Face TRL:把它理解成大模型后训练工具箱,并梳理 SFT、DPO、GRPO、Reward Modeling 和 PPO 的学习路线。

🗒️LLM-白泽🐲

用chatgpt生成多轮完整对话数据,而不是QA对,从而有更好的效果。同时使用chatgpt做了一个对齐方式代替人类的对齐方式(SDF,Self-Distillation with Feedback)