H Humanoid World
← Wiki

Reinforcement Learning (RL)

Aprendizaje por ensayo, error y recompensa — el estándar para la locomoción de robots.

En el Reinforcement Learning, un agente aprende probando: las acciones que conducen a una recompensa (p. ej., «mantenerse erguido», «avanzar») se vuelven más probables. Para los humanoides, el RL es el enfoque dominante para entrenar una marcha robusta, la incorporación y movimientos dinámicos — casi siempre primero en simulación (Sim2Real).

El RL muestra sus límites en tareas de manipulación largas y orientadas a objetivos; ahí dominan el Imitation Learning y los modelos VLA, a menudo combinados con ajuste fino mediante RL.

Stand: 10/6/2026