RL-06.评估环境与工具链-04.Stable-Baselines3与生态 发表于 2026-05-28 | 分类于 开发 , 强化学习 SB3 快速上手、算法-环境对照、CleanRL/RLlib 对比与 baseline 用法。 阅读全文 »
RL-03.算法分类与选型-05.时序差分 发表于 2026-05-28 | 分类于 开发 , 强化学习 时序差分 TD:TD(0)、n-step TD、TD(λ)、Sarsa/Q-Learning 统一视角与 Bootstrap 偏差–方差权衡。 阅读全文 »
RL-06.评估环境与工具链-03.评估指标 发表于 2026-05-28 | 分类于 开发 , 强化学习 Episode return、成功率、样本效率、学习曲线绘制与多 seed 统计报告规范。 阅读全文 »
RL-06.评估环境与工具链-02.经典基准环境 发表于 2026-05-28 | 分类于 开发 , 强化学习 CartPole、MountainCar、LunarLander、Atari、MuJoCo 环境特点与算法选型对照。 阅读全文 »
RL-03.算法分类与选型-01.动态规划 发表于 2026-05-28 | 分类于 开发 , 强化学习 动态规划 DP:策略评估、策略迭代、价值迭代;已知模型 P/R 下的表格求解与收敛性。 阅读全文 »
RL-06.评估环境与工具链-01.Gymnasium与环境接口 发表于 2026-05-28 | 分类于 开发 , 强化学习 Gymnasium 安装、Space、Wrapper、RecordVideo、自定义环境与 RL-04 训练循环对接。 阅读全文 »
RL-05.专属数据结构-07.策略输出 发表于 2026-05-28 | 分类于 开发 , 强化学习 离散 logits 与连续高斯策略的网络输出、log_prob、tanh squash 与 PPO/SAC 存储字段。 阅读全文 »
RL-05.专属数据结构-05.Rollout-Buffer 发表于 2026-05-28 | 分类于 开发 , 强化学习 PPO/A2C Rollout 缓冲:轨迹字段、GAE 扫描、On-Policy 清空策略与向量化收集。 阅读全文 »
RL-05.专属数据结构-04.Prioritized-Replay 发表于 2026-05-28 | 分类于 开发 , 强化学习 优先经验回放 PER:TD 误差优先级、SumTree 采样、重要性权重修正。 阅读全文 »