Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

PEFT 方法横向对比:LoRA、AdaLoRA、DoRA、IA³

发表于 2026-06-29 | 分类于 LLM , 开发
主流 PEFT 方法的机制差异、参数量、效果与工程选型建议,帮助在 LoRA 之外做有依据的替代选择。
阅读全文 »

QLoRA 与量化微调

发表于 2026-06-29 | 分类于 LLM , 开发
QLoRA 4bit 基座 + LoRA 的原理要点、BitsAndBytesConfig 配置、显存估算及 CUDA/ROCm 兼容注意。
阅读全文 »

偏好数据构造:chosen/rejected 与质量要点

发表于 2026-06-29 | 分类于 LLM , 开发
DPO/ORPO 所需的偏好对数据来源、构造方法、chosen-rejected 质量要求及 TRL 数据格式示例。
阅读全文 »

微调数据清洗与质量控制

发表于 2026-06-29 | 分类于 LLM , 开发
SFT 微调前的数据清洗流程:去重、长度过滤、格式合规、标签一致性、毒性/PII 处理及质量抽检清单。
阅读全文 »

微调数据格式与 Chat Template

发表于 2026-06-29 | 分类于 LLM , 开发
SFT 微调三种数据格式(text / messages / prompt-completion)、chat template 机制、completion_only_loss 与训练推理一致性的工程要点。
阅读全文 »

LoRA 原理与工程配置

发表于 2026-06-29 | 分类于 LLM , 开发
LoRA 低秩适配的直观原理、LoraConfig 关键参数、target_modules 选型、学习率与 rank 消融,及与 SFTTrainer 集成的常见踩坑。
阅读全文 »

偏好对齐路线选型:DPO、GRPO、RLHF 与一步对齐

发表于 2026-06-29 | 分类于 LLM , 开发
对比 DPO、ORPO、KTO、GRPO 与经典 RLHF 的数据要求、工程复杂度、适用场景与 TRL Trainer 映射,帮助 SFT 之后选对齐路线。
阅读全文 »

微调技术路线系列导读

发表于 2026-06-29 | 分类于 LLM , 开发
LLM 微调技术路线系列入口:后训练阶段划分、PEFT/对齐/数据/工程模块索引,以及与工具详解、评估指标、Math 理论系列的阅读分工。
阅读全文 »

Math-09.特征预处理与变换-20.领域特化预处理

发表于 2026-06-26 | 分类于 知识
视觉 ImageNet 归一化、NLP 分词与统计、表格/组学/蛋白等领域特化预处理要点。
阅读全文 »

Math-09.特征预处理与变换-10.Pipeline与泄漏防范

发表于 2026-06-26 | 分类于 知识
sklearn Pipeline、ColumnTransformer、CV 内 fit、预处理泄漏案例与工程最佳实践。
阅读全文 »
‹1…111213…94›

939 日志
108 分类
794 标签
© 2026 Ben-air
已有人访问 | 总访问次