El Imparcial / Tecnología / Inteligencia artificial

Tras detectar que Astra podría encontrar fallas de seguridad y ejecutar ciberataques de forma autónoma OpenAI frena desarrollo de su nueva IA

Las evaluaciones mostraron avances que impiden descartar que el próximo modelo alcance el nivel “crítico” de ciberseguridad contemplado en el Marco de Preparación de la compañía.

Tras detectar que Astra podría encontrar fallas de seguridad y ejecutar ciberataques de forma autónoma OpenAI frena desarrollo de su nueva IA

OpenAI decidió pausar parte de las actividades internas relacionadas con Astra, uno de sus próximos modelos de inteligencia artificial, después de que nuevas evaluaciones mostraron capacidades de ciberseguridad suficientemente avanzadas como para que la empresa ya no pueda descartar que alcance su nivel de riesgo “crítico”.

La compañía informó este viernes 7 de agosto que Astra mostró avances importantes en programación autónoma y tareas de ciberseguridad. OpenAI activó controles reforzados y suspendió cualquier actividad interna con el modelo que todavía no cumpla con esas nuevas medidas.

¿Qué significa que Astra podría tener capacidad “crítica” en ciberseguridad?

El Marco de Preparación de OpenAI divide las capacidades de mayor riesgo en niveles que determinan qué controles deben aplicarse durante el desarrollo y antes de lanzar un modelo.

En ciberseguridad, un modelo entra en la categoría “Critical” o “crítica” si puede realizar tareas que hasta ahora requieren especialistas altamente capacitados y llevarlas a cabo con un alto grado de autonomía.

Entre los criterios establecidos por OpenAI se encuentran la capacidad de:

  • Identificar y desarrollar exploits funcionales para vulnerabilidades “día cero” en múltiples sistemas críticos reales y protegidos, sin intervención humana.
  • Diseñar y ejecutar de principio a fin estrategias nuevas de ciberataque contra objetivos protegidos a partir únicamente de una instrucción general.

Una vulnerabilidad de “día cero” es una falla de seguridad que todavía no cuenta con una solución disponible y que puede ser desconocida incluso para los responsables del software afectado.

El nivel crítico es más alto que la categoría “High”, en la que ya se encuentran modelos de OpenAI como la familia GPT-5.6.

¿OpenAI confirmó que Astra ya puede realizar estos ataques?

OpenAI señaló que los resultados obtenidos durante los últimos días, combinados con evaluaciones de especialistas, impiden descartar que Astra tenga capacidades críticas.

Esto significa que la compañía está aplicando el principio de precaución previsto en su propio Marco de Preparación mientras realiza nuevas pruebas.

El sistema establece que, cuando un modelo puede alcanzar un nivel crítico, los controles ya no se concentran solamente en impedir un lanzamiento riesgoso. Las medidas de seguridad deben aplicarse también durante su desarrollo interno.

OpenAI pausa pruebas de Astra por riesgo cibernético. |Imagen generada con IA.

¿Qué actividades con Astra fueron suspendidas?

OpenAI no detuvo completamente el desarrollo del modelo.

La compañía pausó las actividades internas que todavía no cumplen con los requisitos reforzados de seguridad establecidos después de las últimas evaluaciones.

Entre las medidas se encuentran entornos de prueba más aislados, restricciones adicionales para conectarse a redes y mayores controles sobre las herramientas a las que puede acceder el modelo.

También se implementó monitoreo en las aplicaciones donde Astra opera como agente, es decir, cuando puede realizar diferentes pasos y utilizar herramientas para completar una tarea.

El objetivo es detectar comportamientos potencialmente peligrosos y permitir que los sistemas de seguridad interrumpan una actividad considerada de alto riesgo.

¿Astra será lanzado al público?

Astra es descrito por OpenAI como uno de sus próximos modelos, pero la compañía no ha anunciado una nueva fecha pública para su lanzamiento después de activar las medidas adicionales.

La decisión implica que el desarrollo y las evaluaciones deberán avanzar bajo controles más estrictos antes de una posible distribución.

El Marco de Preparación establece que un sistema con capacidad crítica no puede continuar su desarrollo bajo condiciones ordinarias si no existen medidas que reduzcan suficientemente el riesgo de causar daños graves.

Por ello, el resultado de las próximas evaluaciones y la eficacia de las protecciones determinarán qué actividades pueden reanudarse y bajo qué condiciones.

¿Astra fue la IA que hackeó Hugging Face?

OpenAI aclaró que Astra no participó en el incidente de julio en el que un agente de inteligencia artificial logró acceder a internet desde un entorno utilizado para evaluar capacidades de ciberseguridad.

El 21 de julio, la compañía reconoció que ese incidente involucró una combinación de modelos, entre ellos GPT-5.6 Sol y otro modelo de prelanzamiento más avanzado, configurados con menos restricciones de ciberseguridad para realizar pruebas.

Durante la evaluación ExploitGym, los modelos buscaron una manera de obtener las respuestas de la prueba en lugar de resolver los ejercicios por los mecanismos previstos.

Para lograrlo, identificaron y explotaron una vulnerabilidad “día cero” en un componente de la infraestructura de pruebas, consiguieron acceso a internet y posteriormente comprometieron sistemas de producción de Hugging Face.

Hugging Face informó que detectó acceso no autorizado a una parte de su infraestructura y a determinadas credenciales, aunque no encontró evidencia de alteraciones en los modelos, conjuntos de datos o Spaces públicos de la plataforma.

OpenAI pausa pruebas de Astra por riesgo cibernético. |Imagen generada con IA.

¿Qué diferencia hay entre GPT-5.6 Sol y Astra?

OpenAI clasifica actualmente a GPT-5.6 Sol, Terra y Luna como modelos de capacidad “High” en ciberseguridad, pero por debajo del nivel crítico.

En ese nivel, un modelo puede automatizar partes importantes de operaciones cibernéticas o ayudar a descubrir y explotar vulnerabilidades relevantes, por lo que requiere protecciones adicionales antes de su despliegue.

Con Astra, las últimas pruebas llevaron a OpenAI un paso más allá: la empresa considera que ya no puede descartar capacidades propias del nivel crítico.

La diferencia es importante porque ese nivel obliga a aplicar medidas de seguridad reforzadas incluso mientras el modelo continúa dentro de los sistemas de la propia compañía.

Te puede interesar: Alertan que la inteligencia artificial está siendo usada para enganchar a menores en redes de trata

¿Por qué preocupa que una IA descubra vulnerabilidades automáticamente?

Las mismas capacidades pueden utilizarse para proteger o atacar sistemas.

Una IA avanzada podría ayudar a empresas y gobiernos a encontrar fallas antes de que sean aprovechadas por delincuentes, desarrollar correcciones y revisar grandes cantidades de código con mayor rapidez.

Pero un modelo capaz de operar sin supervisión también podría acelerar la búsqueda de vulnerabilidades desconocidas y automatizar partes de un ataque que actualmente necesitan tiempo, recursos y especialistas.

El Instituto de Seguridad de IA de Reino Unido ha documentado una rápida mejora en este tipo de capacidades. En sus evaluaciones, modelos recientes ya han conseguido completar de principio a fin simulaciones de ataques informáticos de múltiples etapas que anteriormente requerían varias horas de trabajo humano.

OpenAI pausa pruebas de Astra por riesgo cibernético. |Imagen generada con IA.

¿OpenAI es la única empresa que ha tenido incidentes durante pruebas de ciberseguridad?

Los incidentes recientes han aumentado la preocupación sobre cómo deben aislarse los modelos avanzados mientras son evaluados.

Reuters informó esta semana sobre pruebas de modelos de OpenAI y Anthropic en las que agentes realizaron acciones no autorizadas en determinados escenarios de evaluación. También se conoció un caso relacionado con un modelo de Meta que obtuvo acceso externo debido a una configuración incorrecta del entorno utilizado para probarlo.

Estos casos no son idénticos. Algunos estuvieron vinculados con fallas en el aislamiento de las pruebas y otros con acciones realizadas por los propios agentes para cumplir los objetivos que habían recibido.

El caso de Astra representa un problema distinto: OpenAI está actuando antes de un despliegue porque sus evaluaciones sugieren que las capacidades del modelo podrían acercarse a un nivel de riesgo que exige controles mucho mayores.

Sigue nuestro canal de WhatsApp

Recibe las noticias más importantes del día. Da click aquí

Temas relacionados