H Humanoid World
← News
9/7/2026 · Europa

ThorArena: benchmark de la TUM revela una brecha de seguridad en los modelos VLA durante el contacto físico con personas

Investigadores de la Universidad Técnica de Múnich han presentado con ThorArena (arXiv 2607.06052) un nuevo benchmark que demuestra que ningún modelo de Vision-Language-Action líder alcanza la fiabilidad humana cuando una persona guía físicamente el brazo de un robot como demostrador. El trabajo pone de manifiesto una brecha estructural en la certificación de seguridad de los humanoides.

Investigadores de la Universidad Técnica de Múnich (TUM) han publicado con ThorArena un benchmark que cuantifica una brecha de seguridad apenas documentada hasta ahora en los modelos de Vision-Language-Action (VLA) actuales: ningún modelo VLA líder evaluado alcanza la fiabilidad humana cuando una persona guía físicamente el brazo del robot —es decir, la demostración cinestésica clásica—.

Problema: el contacto físico con personas como punto ciego

Muchas evaluaciones de VLA someten a los robots a entornos aislados y predecibles. ThorArena captura en cambio el perfil completo de fuerza y movimiento de demostradores humanos al guiar un brazo robótico. El benchmark mide si el modelo puede traducir de forma segura y consistente estos movimientos guiados en acciones posteriores —un escenario de seguridad fundamental para el funcionamiento conjunto de robots y personas en entornos industriales—.

El resultado: todos los modelos VLA evaluados se quedan significativamente por debajo de la referencia humana cuando entran en juego fuerzas de interacción inesperadas.

Relevancia para los despliegues industriales

Los hallazgos son especialmente relevantes para los debates actuales sobre despliegue: fabricantes como Figure AI, Agility Robotics y Apptronik apuestan cada vez más por la operación conjunta de humanoides y personas en el mismo suelo de fábrica. ThorArena demuestra que las certificaciones de seguridad necesarias para ello deben basarse en una base de datos que incluya explícitamente el contacto físico —un benchmark que hasta ahora no existía—.

El autor principal es Chenhao Yu (TUM); el co-supervisor es el profesor de la TUM Alois Knoll (Cátedra de Robótica y Sistemas Embebidos). El artículo fue publicado el 8/9 de julio de 2026 en arXiv (cs.RO, arXiv:2607.06052).

⚠️ El artículo de arXiv (2607.06052) aún no ha sido revisado por pares. La afirmación central sobre la brecha de seguridad está confirmada de forma secundaria por el informe de TechTimes del 9 de julio de 2026; no se dispone aún de una replicación académica independiente.

Distinción: ThorArena ≠ TUM RoboGym

ThorArena es el nombre del framework de benchmark (software), no de una instalación física. El TUM RoboGym —el mayor centro de entrenamiento de Physical AI de Europa (17 millones de euros, ~2.300 m², en colaboración con NEURA Robotics)— fue anunciado de forma independiente en marzo de 2026 y es una instalación autónoma.

Quellen

  1. Humanoid Robots Can't Handle Human Touch: New Benchmark Exposes VLA Safety Gap (TechTimes, 09.07.2026)
  2. ThorArena VLA Safety Benchmark Paper (arXiv 2607.06052)