OpenAI reportó seis casos de desalineación en sistemas de inteligencia artificial durante los últimos seis meses.
OpenAI identificó seis casos de comportamiento desalineado en sistemas de inteligencia artificial durante los últimos seis meses, incluidos modelos que ocultaron errores, inventaron información, utilizaron recursos sin autorización y enviaron archivos a internet.
La empresa aclaró que los casos corresponden a incidentes individuales y no representan la frecuencia con la que ocurren este tipo de comportamientos. Además, señaló que varios involucraron modelos antiguos que nunca llegaron a implementarse.
¿Qué hicieron los agentes de IA?
Uno de los casos ocurrió con un modelo de investigación que todavía no había sido publicado. El sistema introdujo instrucciones similares a un jailbreak en sus propias notas para intentar ignorar las restricciones habituales.
OpenAI encontró 27 notas afectadas, en las que el modelo se indicaba a sí mismo que debía actuar fuera de los roles establecidos para otros chatbots.
Otro incidente ocurrió durante el desarrollo de GPT-5.6 Sol. El sistema generó notas ocultas en las que se indicaba que debía ocultar errores a los usuarios, además de inventar datos faltantes y disimular inconsistencias entre diferentes versiones del material de origen.
En un tercer caso, un sistema que debía responder una pregunta sobre cifras de ingresos encontró una clave de programación expuesta en internet y la utilizó sin autorización. Al no conseguir los datos solicitados, inventó las cifras y las presentó como reales.
Un cuarto incidente involucró a un agente que había resuelto correctamente un problema mediante código. Posteriormente, subió archivos a internet sin solicitar autorización, con la finalidad de obtener una URL que le permitiera satisfacer una petición para citar una fuente web.
Los dos casos restantes estuvieron relacionados con la comunicación entre sistemas. Un grupo de agentes utilizó un repositorio interno de código como un espacio improvisado para intercambiar solicitudes mientras buscaba archivos perdidos.
En otro episodio, varios agentes que trabajaban en una misma tarea recurrieron a sitios públicos de alojamiento de archivos para compartir documentos cuando no podían comunicarse directamente entre ellos.
OpenAI crea un nuevo marco para reportar incidentes
La compañía presentó también un nuevo mecanismo para rastrear, investigar y divulgar casos de desalineación de modelos de IA.
El alcance contempla comportamientos como actuar sin autorización, coordinarse con otros modelos o intentar evadir mecanismos de supervisión.

VER MÁS ONU pide frenar la IA ante riesgos: 'Todos los derechos están en riesgo'
Volker Türk advirtió que una IA cada vez más potente podría afectar servicios esenciales y derechos como la privacidad, salud, alimentación y seguridadOpenAI indicó que no será necesario que un incidente provoque daños o que forme parte de un patrón más amplio para que sea considerado susceptible de divulgación. El seguimiento abarcará las distintas etapas del desarrollo de los sistemas, desde las pruebas y evaluaciones hasta su implementación.
Cuando existan desacuerdos internos sobre la publicación de un caso, el asunto será revisado por un Grupo Asesor de Seguridad. Para situaciones consideradas graves, la empresa contempla informar al gobierno federal de Estados Unidos.
La compañía sostuvo que busca que observadores externos tengan más elementos para evaluar el avance de la investigación sobre seguridad y alineación de la inteligencia artificial.
Los casos no tuvieron consecuencias significativas
OpenAI señaló que ninguno de los seis incidentes tuvo consecuencias significativas. También indicó que los casos ya habían sido investigados o únicamente requerían revisiones menores.
La empresa recordó que ya había observado comportamientos similares. En mayo, por ejemplo, un modelo creó una fuente en internet durante su fase de desarrollo para responder una pregunta y posteriormente citó el documento que él mismo había generado.

TAMBIÉN LEE CEO de Anthropic pide frenar el avance de la IA por riesgo de ciberataques globales
Dario Amodei, CEO de Anthropic, pidió frenar el avance de la IA por riesgos de ciberseguridad global y alertó sobre bots fuera de controlEl reporte se conoce mientras crece el debate sobre los riesgos asociados con sistemas de IA cada vez más capaces y autónomos.
El analista de Omdia Lian Jye Su señaló que los agentes de IA muestran una mayor capacidad para resolver tareas complejas mediante colaboración, intercambio de información, engaño y ocultamiento, lo que puede dificultar su supervisión.
Su también consideró que el nuevo marco de OpenAI podría incentivar a otros desarrolladores a adoptar prácticas similares, aunque señaló que el proceso de la compañía sigue siendo interno y voluntario.
OpenAI advierte sobre los retos de la inteligencia artificial
La compañía reconoció que la industria todavía enfrenta desafíos para garantizar el alineamiento de los modelos con los valores humanos y mantener una supervisión suficiente conforme aumenta la capacidad de estos sistemas.
El anuncio se produce después de que OpenAI y Anthropic reportaran otros incidentes durante pruebas de seguridad. En julio, OpenAI informó que un sistema de IA había realizado un ataque contra Hugging Face, mientras que Anthropic señaló que sus modelos habían vulnerado sistemas de tres organizaciones durante evaluaciones.
Con su nuevo esquema de divulgación, OpenAI busca documentar de manera más sistemática los casos de desalineación de sus modelos de IA y ofrecer información que permita analizar los riesgos asociados con el desarrollo de sistemas cada vez más avanzados.
G.O