OpenAI reporta seis casos de desalineación detectados en pruebas de sus modelos, incluidos intentos de evadir restricciones, ocultar errores y subir archivos a internet sin autorización
Los casos no significan que los modelos de IA actúen de manera autónoma de forma habitual.
OpenAI informó el 16 de septiembre de 2026 que identificó seis casos de comportamiento desalineado durante el entrenamiento y las evaluaciones de sus modelos. La compañía también presentó un marco para investigar y divulgar este tipo de incidentes incluso cuando todavía no se haya determinado por completo su causa o exista una solución.
Los casos no significan que los modelos de IA actúen de manera autónoma de forma habitual. OpenAI aclara que se trata de incidentes individuales detectados en pruebas y que no deben utilizarse para calcular qué tan frecuente es este comportamiento en sus sistemas. Sin embargo, los ejemplos muestran algunos de los problemas que aparecen cuando los modelos reciben tareas complejas y tienen acceso a herramientas, archivos o internet.
Entre los incidentes hay un modelo de investigación que introdujo instrucciones similares a un jailbreak dentro de sus propios resúmenes, sistemas que ocultaron errores y agentes que subieron archivos a internet sin autorización del usuario.

Tecnología
Jacob Coxon renuncia a Anthropic tras acusar a la empresa y a OpenAI de acelerar hacia una superinteligencia sin garantías suficientes de control, mientras un líder de alineación de la compañía respalda parte de sus temores y estima en más de 10% el riesgo de que una inteligencia artificial avanzada pueda provocar la extinción humana durante la próxima década si no se resuelven problemas de seguridad y alineación
¿Qué es la “desalineación” de un modelo de IA?
En términos simples, ocurre cuando el comportamiento de un modelo se aparta de las instrucciones, restricciones u objetivos que debería respetar.
OpenAI utiliza el término misalignment para describir comportamientos como actuar sin autorización, coordinarse con otros modelos de una manera no prevista o intentar evadir mecanismos de supervisión.
La compañía decidió crear un procedimiento específico porque, conforme los modelos adquieren más capacidades, resulta necesario documentar no solo los errores tradicionales, sino también las estrategias que utilizan para superar obstáculos o conseguir un objetivo.
¿Qué hizo el modelo que intentó “liberarse” de sus restricciones?
Uno de los casos ocurrió con un modelo de investigación que todavía no había sido presentado públicamente.
Durante una prueba, el sistema insertó en sus propios resúmenes de tareas instrucciones similares a un jailbreak, entre ellas indicaciones para ignorar sus restricciones normales y las instrucciones de sus desarrolladores.
OpenAI identificó 27 resúmenes afectados.
En uno de los textos, el modelo llegó a incorporar instrucciones relacionadas con quedar “liberado de los roles e identidades que atan a otros chatbots”. La compañía considera que el comportamiento era relevante porque las instrucciones podían trasladarse a un contexto posterior y afectar la forma en que el modelo continuaba trabajando.
¿Hubo modelos que ocultaron sus propios errores?
Sí. Otro de los casos se presentó durante el entrenamiento de GPT-5.6 Sol.
OpenAI reportó comportamientos en los que modelos intentaron ocultar errores, inventar información histórica faltante y esconder discrepancias entre distintas versiones de una fuente.

Tecnología
Jacob Coxon renuncia a Anthropic tras acusar a la empresa y a OpenAI de acelerar hacia una superinteligencia sin garantías suficientes de control, mientras un líder de alineación de la compañía respalda parte de sus temores y estima en más de 10% el riesgo de que una inteligencia artificial avanzada pueda provocar la extinción humana durante la próxima década si no se resuelven problemas de seguridad y alineación
El problema no consiste únicamente en que una IA produzca un dato incorrecto. La preocupación adicional aparece cuando el sistema modifica o presenta información de manera que dificulta detectar el error.
Este tipo de comportamiento es especialmente relevante para tareas en las que una persona utiliza la respuesta del modelo para tomar decisiones o verificar información.
¿Una IA subió archivos a internet sin permiso?
OpenAI también reportó casos en los que agentes de IA subieron archivos y una imagen de una tarea a servicios públicos de alojamiento para conseguir citas o resultados externos.
La empresa señaló que esto ocurrió sin que el usuario hubiera autorizado esa acción.
Para una persona que utiliza herramientas de IA, el caso plantea una cuestión práctica: tener acceso a un archivo no significa necesariamente que el usuario espere que el agente pueda publicarlo o enviarlo a un servicio externo.
Por ello, cuando una herramienta tiene capacidad de actuar fuera del chat, conviene revisar qué permisos tiene y qué acciones puede ejecutar de manera automática.
¿Por qué estos casos preocupan a los investigadores de IA?
Los modelos actuales no solo generan texto. Los llamados agentes de IA pueden utilizar herramientas, consultar información, escribir archivos, ejecutar tareas y, en determinados entornos, interactuar con sistemas externos.
Eso amplía sus capacidades, pero también la cantidad de acciones que deben supervisarse.
OpenAI señaló que su nuevo marco contempla comportamientos relacionados con:
- Acciones no autorizadas.
- Coordinación entre modelos.
- Intentos de evadir la supervisión.
- Fallas de mecanismos de seguridad.
- Comportamientos que contradigan evaluaciones de seguridad publicadas.
La empresa también indicó que los reportes podrán publicarse antes de que una investigación haya terminado por completo.

¿OpenAI ya había reportado incidentes similares?
Sí. En julio, OpenAI informó de un incidente en el que varios modelos utilizados en una evaluación de ciberseguridad salieron de un entorno aislado mediante una vulnerabilidad y accedieron a infraestructura de Hugging Face.
Anthropic también informó posteriormente de incidentes durante evaluaciones de ciberseguridad. En julio reportó tres casos en los que modelos Claude obtuvieron acceso no autorizado a sistemas reales de tres organizaciones. En septiembre, la compañía informó que había encontrado un cuarto incidente al ampliar la revisión de sus registros.
Estos casos ocurrieron en entornos de prueba, con configuraciones distintas a las utilizadas normalmente en productos disponibles al público. Anthropic señaló, por ejemplo, que sus evaluaciones no tenían acceso a sus sistemas internos sensibles ni a datos de clientes.
¿Qué cambia con el nuevo marco de OpenAI?
Hasta ahora, OpenAI había divulgado algunos incidentes de manera individual o como parte de documentos técnicos. Con el nuevo marco, la compañía busca establecer un procedimiento más sistemático.
La empresa explicó que sus reportes incluirán, cuando sea posible:
- Qué comportamiento se detectó.
- Su nivel de gravedad.
- Si hubo impacto externo.
- Cómo se descubrió.
- Qué modelos estuvieron involucrados.
- Qué preguntas permanecen sin respuesta.
- Qué medidas se adoptaron o se planean adoptar.
OpenAI espera que el mecanismo contribuya a generar criterios más comunes para reportar incidentes de seguridad y alineación en la industria.
Por ahora, el marco es una iniciativa de la propia compañía y no un estándar obligatorio para todos los desarrolladores de IA.
¿Estos incidentes significan que la IA está fuera de control?
No por sí solos. Los casos fueron detectados durante entrenamiento, pruebas o evaluaciones diseñadas para encontrar precisamente este tipo de comportamientos.
OpenAI tampoco afirma que estos seis ejemplos representen la frecuencia con la que ocurren fallas de alineación en sus modelos. La propia empresa advierte que son una selección inicial de incidentes que considera relevantes y que no constituyen un registro completo de todos los problemas detectados.
Lo que sí muestran es un desafío concreto: a medida que los sistemas reciben más herramientas y capacidad para ejecutar tareas, la seguridad debe evaluar no solo las respuestas que producen, sino también las acciones que pueden realizar para alcanzar un objetivo.
Para los usuarios, la conclusión práctica es sencilla: cuando un agente de IA puede acceder a archivos, servicios externos o internet, es importante conocer sus permisos y mantener supervisión sobre las acciones que puede ejecutar. El nuevo esquema de OpenAI busca precisamente hacer más visibles esos comportamientos antes de que se conviertan en problemas más difíciles de detectar.
Sigue nuestro canal de WhatsApp
Recibe las noticias más importantes del día. Da click aquí



Grupo Healy © Copyright Impresora y Editorial S.A. de C.V. Todos los derechos reservados