泥潭日报 uscardforum · 内容汇总

转行具身智能RL

内容摘要

机器人本硕楼主分享年底转行具身智能RL的五步规划。

关键信息

  • 楼主背景与目标:楼主拥有机器人(Robotic)本硕背景,目前从事制造业(Manufacturing)相关非软硬件工作。因看好具身智能前景,计划在年底前通过面试,成功转行至人形机器人相关的强化学习(RL)领域(#1)。
  • 五步转行实战规划(Claude制定)#1):
  • M1(手写PPO):不依赖RL库手写单文件约400行PPO算法(支持连续动作空间、高斯策略、GAE等),解决Pendulum-v1并在HalfCheetah达到2500+分,需掌握白板推导策略梯度并无表解释clip机制。
  • M2(Isaac Lab基线复现):在Isaac Lab中复现Unitree Go2或ANYmal-C的平地速度跟踪,使用rsl_rl的PPO,要求在5080显卡上20分钟内收敛。
  • M3(崎岖地形与课程学习):实现地形课程(斜坡→楼梯→障碍)及针对摩擦力、质量、延迟的领域随机化(DR)和推力扰动,使策略在未见地形上存活。
  • M4(消融实验与技术博客)(预计10月底):系统消融奖励项与DR范围,撰写带详实数据的技术博客,作为证明工程能力的核心作品。
  • M5(人形机器人与推力恢复)(预计12月):在Isaac Lab中训练H1或G1人形机器人步行及推力恢复,并将学习策略与经典控制算法(LQR/Capture-point)进行量化对比。

闲聊脉络

  • 坛友围绕行业前景调侃,询问该领域是否有发财机会(#2)或被裁风险(#3)。楼主幽默回应以身入局或许也算是一种发财机会(#4)。
具身智能强化学习Isaac LabPPO人形机器人