🗒️🗒️TRL学习LLM2025年6月12日我从学习者角度整理 Hugging Face TRL:把它理解成大模型后训练工具箱,并梳理 SFT、DPO、GRPO、Reward Modeling 和 PPO 的学习路线。#LLM#训练#PEFT阅读全文 ›
🗒️🗒️DeepSeek 模型复现:我会从哪里开始LLM2025年3月6日我用学习者视角拆解 DeepSeek 模型复现的路线:先明确目标,再从数据、训练方法、评估和成本边界逐步缩小范围。#LLM#训练#PEFT#DATA阅读全文 ›
🗒️🗒️LLM-白泽🐲LLM2023年6月30日用chatgpt生成多轮完整对话数据,而不是QA对,从而有更好的效果。同时使用chatgpt做了一个对齐方式代替人类的对齐方式(SDF,Self-Distillation with Feedback)#chatgpt#训练#PEFT阅读全文 ›