灾难性遗忘与微调版本管理 发表于 2026-06-30 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 微调后通用能力退化的成因与缓解(数据混合、KL、lr),及 checkpoint 选择、命名与回滚的版本管理实践。 阅读全文 »
训练加速:Unsloth 与 Liger Kernel 发表于 2026-06-30 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 Unsloth 与 TRL Liger Kernel 在 SFT 微调中的集成方式、适用硬件与相对标准 Trainer 的收益预期。 阅读全文 »
分布式微调:DDP、DeepSpeed 与 FSDP 发表于 2026-06-30 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 多卡 LLM 微调的策略选型:DDP 数据并行、DeepSpeed ZeRO、FSDP 全分片及与 LoRA SFT 的配置要点。 阅读全文 »
GRPOTrainer 详解:可验证奖励与组相对优化 发表于 2026-06-30 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 TRL GRPOTrainer 的 reward 函数设计、组内采样配置、与 SFT 衔接及代码/数学推理场景实践要点。 阅读全文 »
微调数据混合与课程学习 发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 多任务 SFT 数据混合比例、CPT 与 SFT 混训、防灾难性遗忘的通用数据掺入及简单课程学习策略。 阅读全文 »
微调前后基线评估 发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 微调前必须建立的基线评估流程:固定 test 集、prompt、decode 与 parse 规则,及与 AMD 实战同构的评估模式。 阅读全文 »
微调显存优化栈 发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 LLM 微调显存占用组成与优化手段:gradient checkpointing、累积、packing、ZeRO/FSDP、混合精度及调参顺序。 阅读全文 »
DPOTrainer 详解:TRL 直接偏好优化 发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 Hugging Face TRL DPOTrainer 的数据格式、DPOConfig 关键参数、ref model 配置及与 SFT LoRA 的衔接。 阅读全文 »
全参微调与 PEFT 选型 发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 全参数微调与 PEFT 的效果、显存、成本对比及选型决策树,帮助在资源约束下做训练方式选择。 阅读全文 »
监督微调 SFT 与指令微调 发表于 2026-06-29 | 更新于 2026-08-28 | 分类于 大模型 , 训练微调 SFT 与指令微调的概念边界、损失目标、loss 掩码原则,以及与 03 SFTTrainer 工具篇的分工。 阅读全文 »