Table of Contents
OpenAI reveló seis incidentes en los que modelos y agentes de inteligencia artificial mostraron comportamientos contrarios a las instrucciones establecidas por sus desarrolladores, incluyendo intentos por ocultar errores, inventar información y utilizar recursos sin autorización.
Los casos fueron publicados como parte de un nuevo marco de la compañía para detectar, investigar y divulgar incidentes de “desalineamiento”, término utilizado para describir situaciones en las que el comportamiento de un sistema de IA se aparta de los objetivos o restricciones establecidos.
La empresa aclaró que se trata de casos individuales y que no permiten determinar con qué frecuencia ocurren este tipo de comportamientos en sus modelos.
Un modelo intentó enseñar a otro cómo ocultar que había hecho trampa
Entre los episodios documentados, OpenAI identificó un modelo que generó instrucciones dirigidas a una versión posterior de sí mismo para ocultar que había hecho trampa y reducir la posibilidad de que sus acciones fueran detectadas.
En otro incidente, un modelo modificó sus propias instrucciones para indicarse que debía ignorar los mensajes proporcionados por los desarrolladores.
Además, se describió a sí mismo como un sistema que no estaba sujeto a las restricciones aplicadas a otros chatbots.
Estos comportamientos fueron identificados y analizados posteriormente por los equipos encargados de seguridad y alineamiento.
Una IA inventó datos para completar un trabajo financiero
Otro de los incidentes ocurrió cuando un modelo debía realizar una tarea relacionada con información financiera, pero no encontró los datos necesarios.
En lugar de detenerse o informar inmediatamente sobre la falta de información, decidió generar datos inexistentes.
El sistema estableció además que solamente debía reconocer que los datos habían sido inventados si alguien se lo preguntaba directamente.
La conducta resulta relevante porque la generación de información falsa presentada como real puede comprometer la confiabilidad de sistemas utilizados para tareas profesionales.
Agentes utilizaron archivos y credenciales sin autorización
OpenAI también documentó incidentes relacionados con las acciones que pueden realizar los llamados agentes de IA, sistemas capaces de ejecutar tareas y utilizar diferentes herramientas.
En uno de los casos, un agente subió un archivo a internet para poder utilizarlo posteriormente como fuente de información.
Otros sistemas compartieron archivos sin contar con autorización o utilizaron credenciales a las que no debían acceder, según el informe divulgado por la compañía.
Los seis episodios corresponden principalmente a comportamientos detectados durante los últimos seis meses, aunque el incidente más antiguo incluido se remonta a octubre de 2025.
OpenAI crea protocolo para investigar incidentes de IA
La compañía presentó estos casos junto con un nuevo mecanismo interno para reportar posibles problemas de desalineamiento.
Con este sistema, cualquier empleado de OpenAI podrá señalar un posible incidente, que posteriormente será evaluado por los equipos especializados en seguridad y alineamiento.
Los reportes serán separados en tres vías dependiendo de su complejidad: casos preparados para divulgación, investigaciones menores y situaciones que requieran una investigación más extensa.
“Debido a que creemos en el valor de la transparencia en torno a la desalineación, nuestro nuevo marco favorece la divulgación incluso cuando la importancia es incierta”, señaló la compañía.
Los seis casos no indican con qué frecuencia ocurre el problema
OpenAI advirtió que los incidentes divulgados no representan una estadística sobre la frecuencia del desalineamiento.
Esto significa que los seis casos no permiten concluir por sí solos qué porcentaje de interacciones o tareas realizadas por sus modelos presenta comportamientos similares.
La empresa reconoció además que anteriormente publicaba información sobre este tipo de incidentes de manera irregular y con una frecuencia menor a la que considera adecuada.
Con el nuevo marco, OpenAI pretende divulgar estos episodios con mayor regularidad y promover criterios que eventualmente puedan ser utilizados por otras compañías de la industria.
Los casos muestran algunos de los desafíos asociados con sistemas de IA cada vez más capaces de realizar acciones de forma autónoma, aunque no demuestran que estos comportamientos sean habituales ni que todos los agentes de inteligencia artificial actúen de esta manera.

