Robots de Figure entraron a 30 casas desconocidas para tender camas, doblar toallas y ordenar salas mientras Helix 2.5 elevó de 9% a 56% su tasa de éxito sin entrenarse en cada hogar
La compañía puso a prueba su nueva red neuronal en hogares que el sistema no había visto y reportó que la tasa de éxito completo pasó de 9% a 56%; el experimento busca medir si un humanoide puede trasladar lo aprendido a espacios nuevos sin recopilar datos en cada domicilio.

Figure alquiló 30 viviendas en el Área de la Bahía de San Francisco para someter a Helix 2.5 a una prueba concreta: entrar a hogares que el sistema no había visto y realizar tareas domésticas sin recopilar nuevos datos, modificar sus parámetros ni recibir entrenamiento adicional en esas propiedades. La empresa informó el 17 de septiembre de 2026 que su tasa de éxito completo en estas evaluaciones pasó de 9% a 56% cuando utilizó preentrenamiento con Index, su conjunto de datos basado en experiencias humanas. Los resultados fueron publicados por la propia compañía y describen una evaluación interna; Figure no presentó en ese reporte una validación independiente de terceros.
Brett Adcock, fundador y director ejecutivo de Figure, explicó que la compañía había alquilado las 30 viviendas para comprobar si un robot podía comenzar a trabajar en un lugar desconocido sin volver a entrenarse allí. La prueba se concentró en ordenar una sala, hacer una cama y doblar toallas, actividades que obligan al sistema a combinar percepción, desplazamiento, uso de ambas manos, manipulación de objetos y control de todo el cuerpo.
¿Qué hizo Figure dentro de las 30 viviendas?
Figure llevó su sistema a 30 hogares que no habían formado parte de los datos utilizados para preparar las tareas de evaluación. La intención era comprobar si un comportamiento aprendido previamente podía trasladarse directamente a habitaciones con distribuciones, muebles y objetos diferentes.
Las tres pruebas fueron:
- Ordenar una sala: recoger entre 13 y 15 juguetes dispersos y colocarlos dentro de una cesta.
- Doblar toallas: manipularlas, completar el doblez y depositarlas en una cesta.
- Tender una cama: acomodar almohadas y extender la colcha hasta cumplir con los criterios establecidos por Figure.
Watch 4 straight hours of Helix 2.5 at work in 30 homes, with no additional training. pic.twitter.com/0bwzIwmGHz
— Figure (@Figure_robot) September 18, 2026
Las tareas exigían movimientos que no podían resolverse únicamente con los brazos. El robot necesitaba caminar, buscar objetos, modificar la posición de su cuerpo, acercarse a muebles y manipular elementos rígidos y deformables.
Para Figure, este punto es relevante porque una vivienda no está diseñada alrededor de las necesidades de un robot. A diferencia de un brazo industrial instalado frente a una mesa o de una máquina con ruedas que necesita espacio para girar, un humanoide debe adaptar sus movimientos a pasillos, muebles, camas y objetos colocados de distintas maneras.
¿Helix 2.5 realmente hizo las tareas sin entrenamiento previo?
No exactamente. El concepto “zero-shot” utilizado por Figure se refiere a las viviendas y objetos de la evaluación, no a que el sistema desconociera por completo las tareas.
Figure explica que ordenar habitaciones, doblar toallas y hacer camas fueron comportamientos previamente definidos mediante datos de entrenamiento recopilados en otros lugares. Lo que no hizo la empresa fue entrenar nuevamente al modelo dentro de cada una de las 30 casas antes de evaluarlo.
La compañía señala que no recopiló datos en las viviendas utilizadas para la evaluación, los juguetes, toallas y ropa de cama empleados no aparecían en los datos específicos con los que se habían preparado esas tareas y el mismo modelo fue utilizado en los distintos hogares sin modificar sus pesos para cada propiedad.
Esta diferencia es importante para entender el experimento. Helix 2.5 no llegó a las casas sin conocimiento previo sobre cómo doblar una toalla o tender una cama. La prueba buscaba saber si podía aplicar ese conocimiento ante objetos y espacios distintos de aquellos utilizados durante su preparación.
¿Cómo pasó la tasa de éxito de 9% a 56%?
Figure realizó una comparación controlada para medir qué efecto tenía Index, su sistema de preentrenamiento basado en experiencias humanas.
Los dos modelos comparados utilizaron los mismos datos específicos de las tareas, así como la misma arquitectura, optimización, parámetros de entrenamiento y método de evaluación. La diferencia era que uno comenzó con pesos aleatorios, mientras que Helix 2.5 había sido preentrenado previamente con Index.
Según los resultados reportados por la empresa, el modelo sin preentrenamiento logró completar 9% de las pruebas, mientras que la versión preentrenada con Index alcanzó 56%, más de seis veces el resultado inicial.
Figure considera que esta comparación permite atribuir buena parte de la diferencia al preentrenamiento con experiencias humanas.
Sin embargo, el 56% también permite poner el resultado en perspectiva: Helix 2.5 todavía no completa de manera consistente todas las tareas que enfrenta en hogares desconocidos. La propia compañía reconoce que sus resultados no significan que el problema de construir robots humanoides de propósito general esté resuelto.
¿Qué tenía que hacer el robot para que una prueba contara como exitosa?
Figure aplicó criterios definidos antes de realizar las evaluaciones y exigió completar las tareas de principio a fin.
En la prueba de la sala, por ejemplo, debían guardarse todos los juguetes, no solamente una parte. Para doblar toallas, el proceso tenía que terminar con las piezas dobladas y colocadas en la cesta. Al hacer la cama, las almohadas y la colcha tenían que quedar dentro de las posiciones establecidas por el protocolo.
Today we’re releasing Helix 2.5
— Figure (@Figure_robot) September 17, 2026
We rented 30 homes in the Bay Area. The robots arrived with no additional training and started doing useful work pic.twitter.com/VzrXGYOCKt
La empresa señala que no otorgó crédito parcial para calcular la tasa general de éxito.
También estableció que una intervención humana necesaria por razones de seguridad provocaba que esa ejecución fuera clasificada como fallida. Cada comportamiento utilizó un modelo fijo entre las distintas viviendas, sin elegir posteriormente una versión diferente basándose en los resultados obtenidos en esas casas.
Te puede interesar: “Defiendan los puestos de trabajo”: Usan a robots humanoides en Polonia para exigir reglas más claras para la Inteligencia Artificial
¿Por qué Figure está usando experiencias humanas para entrenar robots?
El proyecto parte de un problema que enfrenta la robótica: no existe en internet una cantidad de datos físicos comparable con el volumen de texto, fotografías o videos disponible para entrenar otros sistemas de inteligencia artificial.
Para intentar ampliar esa base, Figure creó Index, una plataforma que recopila videos de personas realizando actividades en entornos reales. El objetivo es que Helix aprenda patrones relacionados con movimiento, manipulación de objetos y comportamiento físico antes de que un robot sea enviado a un nuevo lugar.
Figure informó en agosto que Index había superado 264 mil descargas en más de 100 países, con más de 44 mil usuarios activos por semana y más de 16 millones de videos enviados a la plataforma. En septiembre, la compañía aseguró que el sistema ya estaba generando alrededor de 35 minutos de nueva experiencia humana por segundo.
La lógica es similar a la utilizada en otros campos de la inteligencia artificial: primero se entrena un modelo con una base amplia de información y después se adapta para tareas determinadas.
¿Helix 2.5 necesitó menos datos para aprender las tareas?
Figure también comparó Helix 2.5 con una estrategia anterior utilizada con Helix 02.
Según la empresa, Helix 2.5 consiguió una tasa de éxito comparable utilizando la mitad de los datos específicos de adaptación, pero con una diferencia: el comportamiento después pudo evaluarse en 30 viviendas desconocidas, mientras que la estrategia anterior se había preparado con datos recopilados directamente en el entorno donde posteriormente operaba.
La compañía resume ese resultado como una reducción de dos veces en los datos necesarios para especificar un comportamiento y una ampliación de 30 veces en el número de entornos donde pudo probarse sin una nueva adaptación.
No significa que desaparezca la necesidad de entrenar al robot. El cambio que Figure intenta demostrar es que una misma preparación podría aprovecharse en muchos lugares diferentes, en vez de repetir desde cero el ciclo de recopilar información, entrenar y desplegar el sistema cada vez que cambia de vivienda.
¿Puede Helix 2.5 corregirse cuando comete un error?
Figure reportó además comportamientos de autocorrección durante las tareas prolongadas.
En los ejemplos publicados por la compañía, el sistema puede retroceder para modificar su posición, cambiar la postura del cuerpo o desplazarse alrededor de una cama para intentar continuar una acción cuando el primer movimiento no funciona como esperaba.
Esta capacidad tiene importancia en tareas domésticas porque una acción de varios minutos depende de muchas decisiones consecutivas. Un error al sujetar, alcanzar o colocar un objeto no necesariamente puede provocar que todo el proceso termine.
Figure vincula esa capacidad de recuperación con el preentrenamiento obtenido a partir de Index, aunque se trata de una interpretación de sus propios resultados experimentales.
¿Qué significa la llamada “ley de escalamiento” de humano a robot?
Figure realizó otro experimento para saber qué ocurre cuando aumenta progresivamente la cantidad de experiencias humanas utilizadas durante el preentrenamiento.
La empresa entrenó cuatro modelos con diferentes cantidades de datos de Index hasta cubrir una variación de ocho veces en el volumen de información, mientras mantuvo sin cambios el tamaño del modelo y el entrenamiento posterior.
Según la compañía, al duplicar progresivamente los datos mejoraba de forma relativamente predecible la capacidad del sistema para anticipar la siguiente acción del robot. Figure asegura que pudo estimar el resultado de su entrenamiento de mayor escala hasta cuatro decimales antes de ejecutarlo y reportó un error equivalente al 0.54% del rango de variación observado.
El experimento mide únicamente el efecto de aumentar los datos bajo esas condiciones. No demuestra por sí solo que aumentar el tamaño del modelo produzca automáticamente robots más capaces, porque ese factor se mantuvo fijo durante las pruebas.
¿Qué busca Figure con estas pruebas dentro de hogares?
El objetivo va más allá de enseñar a un robot a doblar toallas.
Figure intenta modificar el proceso mediante el cual un humanoide aprende a trabajar en lugares nuevos. En un esquema tradicional, el robot puede necesitar recopilar información dentro del espacio donde operará, entrenarse con esos datos y regresar posteriormente a realizar la tarea.
Si cada vivienda requiere ese proceso, desplegar robots en miles de hogares implica preparar sistemas para miles de entornos diferentes.
Helix 2.5 explora una alternativa: aprender primero de un conjunto amplio de experiencias humanas y trasladar después ese conocimiento a lugares que el sistema nunca había visto.
La empresa lleva al menos desde 2025 desarrollando esta estrategia. Ese año anunció una alianza con Brookfield para ampliar la recopilación de comportamiento humano en propiedades residenciales y otros espacios físicos, mientras que en agosto de 2026 presentó públicamente Index como su infraestructura para aumentar esa recopilación a escala internacional.
Sigue nuestro canal de WhatsApp
Recibe las noticias más importantes del día. Da click aquí





Grupo Healy © Copyright Impresora y Editorial S.A. de C.V. Todos los derechos reservados