H Humanoid World
← Wiki

Reinforcement Learning (RL)

Lernen durch Versuch, Irrtum und Belohnung — Standard für Roboter-Lokomotion.

Beim Reinforcement Learning lernt ein Agent durch Ausprobieren: Aktionen, die zu einer Belohnung führen (z. B. „aufrecht bleiben”, „vorwärts kommen”), werden wahrscheinlicher. Für Humanoide ist RL der dominierende Ansatz, um robustes Gehen, Aufstehen und dynamische Bewegungen zu trainieren — fast immer zuerst in Simulation (Sim2Real).

Grenzen zeigt RL bei langen, zielgerichteten Manipulationsaufgaben; dort dominieren Imitation Learning und VLA-Modelle, oft kombiniert mit RL-Feintuning.

Verwandte Themen

Hierher verlinkt

Stand: 10.6.2026