Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

RL-03.算法分类与选型-12.DDPG-TD3-SAC

发表于 2026-05-26 | 分类于 开发 , 强化学习
连续控制 Off-Policy 算法:DDPG、TD3、SAC 的原理、双 Q、目标策略平滑与最大熵 RL。
阅读全文 »

RL-03.算法分类与选型-09.Actor-Critic

发表于 2026-05-26 | 分类于 开发 , 强化学习
Actor-Critic 架构:A2C/A3C、优势函数、Critic 估 V 或 Q、与纯 PG 和 DQN 的关系。
阅读全文 »

RL-03.算法分类与选型-11.PPO

发表于 2026-05-26 | 分类于 开发 , 强化学习
近端策略优化 PPO:裁剪 surrogate 目标、GAE 优势估计、Rollout 训练流程与超参数;离散/连续通用基线。
阅读全文 »

RL-03.算法分类与选型-08.Policy-Gradient

发表于 2026-05-26 | 分类于 开发 , 强化学习
策略梯度定理、REINFORCE 算法、基线 Baseline 减方差、与价值方法的对比及连续动作优势。
阅读全文 »

RL-03.算法分类与选型-07.DQN变体

发表于 2026-05-26 | 分类于 开发 , 强化学习
DQN 改进:Double DQN、Dueling、Prioritized Replay、Multi-step、Rainbow 组合与选型。
阅读全文 »

RL-03.算法分类与选型-06.DQN

发表于 2026-05-26 | 分类于 开发 , 强化学习
Deep Q-Network(DQN):函数逼近、经验回放、目标网络、损失函数与训练流程;Atari 离散控制入门。
阅读全文 »

RL-03.算法分类与选型-04.蒙特卡洛

发表于 2026-05-26 | 分类于 开发 , 强化学习
蒙特卡洛 MC 方法:首次/每次访问、MC 控制、与 TD 的偏差–方差对比;时序差分详见专篇。
阅读全文 »

RL-03.算法分类与选型-03.SARSA

发表于 2026-05-26 | 分类于 开发 , 强化学习
SARSA 算法:On-Policy 时序差分、State-Action-Reward-State-Action 更新、与 Q-Learning 对比及悬崖行走经典例。
阅读全文 »

RL-03.算法分类与选型-02.Q-Learning

发表于 2026-05-26 | 分类于 开发 , 强化学习
Q-Learning 算法:Off-Policy 时序差分、Q 表更新公式、ε-greedy 探索、收敛条件与 NumPy 伪代码。
阅读全文 »

RL-07.应用实战

发表于 2026-05-25 | 分类于 开发 , 强化学习
强化学习应用实战:博弈、机器人、推荐、调度、自动驾驶等场景的问题建模、算法选型、工程链路与落地挑战。
阅读全文 »
‹1…363738…94›

939 日志
108 分类
794 标签
© 2026 Ben-air
已有人访问 | 总访问次