转行具身智能RL
机器人本硕楼主分享年底转行具身智能RL的五步规划。
关键信息
- 楼主背景与目标:楼主拥有机器人(Robotic)本硕背景,目前从事制造业(Manufacturing)相关非软硬件工作。因看好具身智能前景,计划在年底前通过面试,成功转行至人形机器人相关的强化学习(RL)领域(#1)。
- 五步转行实战规划(Claude制定)(#1):
- M1(手写PPO):不依赖RL库手写单文件约400行PPO算法(支持连续动作空间、高斯策略、GAE等),解决Pendulum-v1并在HalfCheetah达到2500+分,需掌握白板推导策略梯度并无表解释clip机制。
- M2(Isaac Lab基线复现):在Isaac Lab中复现Unitree Go2或ANYmal-C的平地速度跟踪,使用
rsl_rl的PPO,要求在5080显卡上20分钟内收敛。 - M3(崎岖地形与课程学习):实现地形课程(斜坡→楼梯→障碍)及针对摩擦力、质量、延迟的领域随机化(DR)和推力扰动,使策略在未见地形上存活。
- M4(消融实验与技术博客)(预计10月底):系统消融奖励项与DR范围,撰写带详实数据的技术博客,作为证明工程能力的核心作品。
- M5(人形机器人与推力恢复)(预计12月):在Isaac Lab中训练H1或G1人形机器人步行及推力恢复,并将学习策略与经典控制算法(LQR/Capture-point)进行量化对比。