Ben-air


  • 首页

  • 分类

  • 归档

  • 标签

  • 关于

  • 搜索

RL-05.专属数据结构-03.Replay-Buffer

发表于 2026-05-28 | 分类于 开发 , 强化学习
经验回放环形队列:FIFO、预分配 numpy、随机采样与 DQN 对接。
阅读全文 »

RL-05.专属数据结构-02.Q-Table

发表于 2026-05-28 | 分类于 开发 , 强化学习
Q 表内存布局、稀疏存储、乐观初始化与可视化;对应 Q-Learning/SARSA 实现。
阅读全文 »

siRNA-07.免疫刺激性基序与敲低干扰

发表于 2026-05-28 | 分类于 知识
从 TLR7/8、TLR3、PKR 等识别原理出发,梳理 siRNA 中常见免疫刺激性基序、代表性文献与体内外表征方案,并说明炎症应答如何干扰敲低效率与表型解释。
阅读全文 »

RL-03.算法分类与选型-10.TRPO

发表于 2026-05-28 | 分类于 开发 , 强化学习
信任域策略优化 TRPO:KL 约束、替代目标、自然策略梯度与共轭梯度求解;与 PPO 的关系及工程取舍。
阅读全文 »

RL-05.专属数据结构-01.Transition元组

发表于 2026-05-28 | 分类于 开发 , 强化学习
RL transition 字段标准 (s,a,r,s',done)、扩展字段、namedtuple 与 numpy 批量存储约定。
阅读全文 »

RL-04.实现框架与实践-06.超参与调优

发表于 2026-05-28 | 分类于 开发 , 强化学习
RL 超参数分类、DQN/PPO/SAC 起步表、调参顺序、学习率与奖励尺度、实验对照原则。
阅读全文 »

RL-04.实现框架与实践-05.PPO实现

发表于 2026-05-28 | 分类于 开发 , 强化学习
CartPole 上 PPO 实现:Actor-Critic 网络、Rollout 收集、GAE 优势与 Clip 损失。
阅读全文 »

RL-04.实现框架与实践-04.DQN实现

发表于 2026-05-28 | 分类于 开发 , 强化学习
CartPole 上完整 DQN:ReplayBuffer、Q 网络、目标网络、ε 衰减与训练脚本结构。
阅读全文 »

RL-04.实现框架与实践-03.表格型算法实现

发表于 2026-05-28 | 分类于 开发 , 强化学习
NumPy 完整实现 Q-Learning 与 SARSA,含 FrozenLake 可运行示例与 Q 表可视化。
阅读全文 »

RL-04.实现框架与实践-02.PyTorch实现要点

发表于 2026-05-28 | 分类于 开发 , 强化学习
RL 中 PyTorch 模块划分、设备与张量、Bootstrap 目标、目标网络同步、梯度与日志惯例。
阅读全文 »
‹1…343536…94›

939 日志
108 分类
794 标签
© 2026 Ben-air
已有人访问 | 总访问次