Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

RL-03.算法分类与选型-16.模仿与逆强化学习

发表于 2026-05-29 | 分类于 开发 , 强化学习
模仿学习与逆强化学习:Behavior Cloning、DAgger、MaxEnt IRL、GAIL;专家演示、协变量偏移与奖励推断。
阅读全文 »

RL-03.算法分类与选型-15.多智能体RL

发表于 2026-05-29 | 分类于 开发 , 强化学习
多智能体强化学习 MARL:随机博弈、CTDE、MADDPG、QMIX、MAPPO/IPPO;协作与竞争及非平稳性挑战。
阅读全文 »

RL-07.应用实战-05.项目Checklist

发表于 2026-05-28 | 分类于 开发 , 强化学习
RL 项目立项到上线 Checklist;CartPole POC 走查 Notebook 与各案例交付物对照。
阅读全文 »

RL-07.应用实战-04.Sim2Real

发表于 2026-05-28 | 分类于 开发 , 强化学习
真实案例:单关节力矩控制 Sim2Real;域随机化 Notebook、难点与 IL+护栏方案对比。
阅读全文 »

RL-07.应用实战-03.调度仿真

发表于 2026-05-28 | 分类于 开发 , 强化学习
真实案例:生信 WGS/RNA-seq 集群作业调度;Q-Learning vs FIFO、难点与 bioinfo_cluster_scheduling.ipynb。
阅读全文 »

RL-07.应用实战-02.推荐与Bandit

发表于 2026-05-28 | 分类于 开发 , 强化学习
真实案例:App 信息流广告位推荐;MAB/UCB 落地、难点与 bandit_news_recommendation.ipynb。
阅读全文 »

siRNA-08.长度选型:19+2 与 21+2

发表于 2026-05-28 | 分类于 知识
以「配对区碱基数 + 3' 突出端 nt 数」的 19+2 与 21+2 两种主流写法为主线,说明各自结构、优劣、临床与研究使用场景及选型决策流程。
阅读全文 »

RL-07.应用实战-01.CartPole到MuJoCo

发表于 2026-05-28 | 分类于 开发 , 强化学习
真实案例:倒立摆/AGV 平衡控制;CartPole→LunarLander→MuJoCo 渐进路线、落地难点与 ipynb 实战。
阅读全文 »

RL-03.算法分类与选型-13.Dyna-Q

发表于 2026-05-28 | 分类于 开发 , 强化学习
Dyna-Q 架构:表格 Q-Learning + 环境模型 + 模拟规划;Dyna-Q+、与 Model-Free / 深度 Model-Based 的关系。
阅读全文 »

RL-06.评估环境与工具链-05.实验记录与复现

发表于 2026-05-28 | 分类于 开发 , 强化学习
随机种子、依赖版本锁定、config/checkpoint、W&B 与复现 checklist。
阅读全文 »
‹1…323334…94›

939 日志
108 分类
794 标签
© 2026 Ben-air
已有人访问 | 总访问次