Jun 25
学习笔记
PPO 算法学习文档
基于 pendulum-PPO 项目的代码精读与原理讲解——Actor-Critic 结构、RolloutBuffer、GAE、PPO-Clip 损失、完整训练循环,以及与 DQN 的对比。
21 min read robotic 强化学习 read
基于 pendulum-PPO 项目的代码精读与原理讲解——Actor-Critic 结构、RolloutBuffer、GAE、PPO-Clip 损失、完整训练循环,以及与 DQN 的对比。
基于 TOPPRA 源码的完整解析——B 样条插值、路径加密、自适应网格生成、时间参数化的向后/向前传播,及 Seidel/qpOASES 求解器策略。
动捕数据向轮式底盘人形机器人 retarget 时,底盘轨迹与上身 IK 耦合导致的失真问题,及三步解耦流水线、yaw 估计与滑窗边界处理的算法设计。
MINCO(ZJU FAST Lab,TRO 2022)核心思想解析——用解析映射直接从路点和时间分配求出最优多项式轨迹,双层优化结构、拉格朗日解系数与虚拟时间参数化。
以 Flappy Bird 为例梳理强化学习基本框架、Reward 设计、Q 值与 Bellman 方程,以及 DQN 的两个稳定性技巧(Experience Replay、Target Network)。
Hello world