Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

分布式微调:DDP、DeepSpeed 与 FSDP

发表于 2026-06-30 | 分类于 LLM , 开发
多卡 LLM 微调的策略选型:DDP 数据并行、DeepSpeed ZeRO、FSDP 全分片及与 LoRA SFT 的配置要点。
阅读全文 »

GRPOTrainer 详解:可验证奖励与组相对优化

发表于 2026-06-30 | 分类于 LLM , 开发
TRL GRPOTrainer 的 reward 函数设计、组内采样配置、与 SFT 衔接及代码/数学推理场景实践要点。
阅读全文 »

微调数据混合与课程学习

发表于 2026-06-29 | 分类于 LLM , 开发
多任务 SFT 数据混合比例、CPT 与 SFT 混训、防灾难性遗忘的通用数据掺入及简单课程学习策略。
阅读全文 »

微调前后基线评估

发表于 2026-06-29 | 分类于 LLM , 开发
微调前必须建立的基线评估流程:固定 test 集、prompt、decode 与 parse 规则,及与 AMD 实战同构的评估模式。
阅读全文 »

微调显存优化栈

发表于 2026-06-29 | 分类于 LLM , 开发
LLM 微调显存占用组成与优化手段:gradient checkpointing、累积、packing、ZeRO/FSDP、混合精度及调参顺序。
阅读全文 »

DPOTrainer 详解:TRL 直接偏好优化

发表于 2026-06-29 | 分类于 LLM , 开发
Hugging Face TRL DPOTrainer 的数据格式、DPOConfig 关键参数、ref model 配置及与 SFT LoRA 的衔接。
阅读全文 »

全参微调与 PEFT 选型

发表于 2026-06-29 | 分类于 LLM , 开发
全参数微调与 PEFT 的效果、显存、成本对比及选型决策树,帮助在资源约束下做训练方式选择。
阅读全文 »

监督微调 SFT 与指令微调

发表于 2026-06-29 | 分类于 LLM , 开发
SFT 与指令微调的概念边界、损失目标、loss 掩码原则,以及与 03 SFTTrainer 工具篇的分工。
阅读全文 »

继续预训练 CPT 与领域适配

发表于 2026-06-29 | 分类于 LLM , 开发
何时做继续预训练、CPT 与 SFT 的顺序、数据规模与 loss 监控,及领域模型(生物/酶等)实践要点。
阅读全文 »

Adapter 合并、多 LoRA 与续训

发表于 2026-06-29 | 分类于 LLM , 开发
LoRA adapter 的 merge_and_unload、多 adapter 切换、SFT 续训与 DPO 衔接、以及 Ollama/vLLM 部署前的导出要点。
阅读全文 »
‹1…101112…94›

939 日志
108 分类
794 标签
© 2026 Ben-air
已有人访问 | 总访问次