En julio, un modelo de OpenAI inédito salió de un entorno restringido, descubrió cómo acceder a Internet, permitió a los agentes de IA hablar entre sí mediante un “tablero de mensajes” secreto y pirateó los sistemas internos de un laboratorio de IA diferente, Hugging Face. OpenAI tardó casi dos semanas en detectar alguno de ellos.
Más de un mes después, dos nuevos informes proporcionan casi 130 páginas de detalles sobre el incidente y la respuesta de OpenAI, muchos de ellos inéditos. uno Fue escrito por el propio OpenAI, El otro Por dos organizaciones de investigación de IA sin fines de lucro, METR y Redwood Research, a las que OpenAI permitió investigar conjuntamente el incidente durante seis días. Ambos arrojan nueva luz sobre los riesgos que pueden plantear los modelos de IA altamente capaces, particularmente en ciberseguridad, y OpenAI destaca los cambios que la empresa está realizando para evitar que se repita. El informe METR-Redwood entra en más detalles en algunos casos, proporcionando una mirada aleccionadora a un desastre de seguridad a gran escala que OpenAI ha pasado por alto repetidamente.
“Este incidente es el primer caso conocido de acción colectiva automatizada que se comporta de manera agresiva.
"Sin autorización", escribió OpenAI en su informe, añadiendo que el hackeo implicaba que las empresas "ya no deberían asumir que las operaciones cibernéticas complejas requieren una guía humana constante". Describió a los agentes de IA como un tipo completamente nuevo de modelo de amenaza, capaz de combinar su experiencia para crear nuevas “rutas de ataque” que no son obvias cuando se prueban sus capacidades como modelos separados.
El ataque fue causado por un "pirateo de recompensas", un problema común en la alineación de la IA donde un modelo toma acciones no deseadas, y a veces extremas, para lograr un objetivo. OpenAI, intencionalmente o no, dio a los modelos tareas casi imposibles que dependían de archivos a los que no podían acceder, por lo que los modelos desarrollaron nuevas formas de comunicarse internamente con otros agentes de IA. Esto incluyó la creación de un sistema de mensajería secreto que OpenAI no detectó durante meses.
Según el informe METR-Redwood, un agente de IA que se hace llamar PHASEONE10841 creó lo que podría considerarse un tablero de mensajes secreto sin el conocimiento de los investigadores. En pocas horas, más de 50 clientes lo encontraron y enviaron más de mil mensajes sin ser detectados. Dado que PHASEONE10841 a menudo delegaba tareas, "el equipo" descubrió cómo hackear su acceso a Internet; Luego a los sistemas internos de Hugging Face, con acceso a datos privados y a la plataforma de mensajería corporativa de la organización. OpenAI también confirmó en su informe que Hugging Face no fue la única organización comprometida durante el ataque, aunque la compañía no identificó específicamente todos los demás objetivos.
El informe METR-Redwood describió el alcance total del incidente. Dice que casi 1.200 agentes de IA que se suponía debían estar aislados intercambiaron más de 70.000 mensajes y archivos en el "foro de mensajes no autorizados" y realizaron "una investigación exhaustiva sobre cómo falsificar, editar o eliminar sus textos privados" para evitar ser detectados. De ellos, 700 participaron en el ataque a Hugging Face. Los clientes "piensan clara y repetidamente en cómo evadir los controles de seguridad automatizados tanto de Hugging Face como de OpenAI".
El 20 de julio, OpenAI descubrió la infracción, 12 días después de que los agentes de AI eludieran por primera vez sus medidas de seguridad. OpenAI se puso en contacto rápidamente con Hugging Face y comenzó “medidas de contención iniciales”, según el propio informe de OpenAI, y pudo detener la mayor parte de la actividad no autorizada de sus clientes en tres días, aunque algunas continuaron más tiempo. El 25 de julio, la empresa suspendió toda capacitación relacionada con el modelo interno de investigación exclusiva y modelos relacionados.
Los dos modelos de OpenAI responsables del daño eran un modelo anónimo de “alta potencia, solo para investigación” que no estaba “destinado a uso general”, según OpenAI; METR se refiere a él como “HPIM”. El otro es el modelo OpenAI actualmente público, GPT-5.6 Sol. Debido a que el modelo sin nombre aún no ha sido publicado, "no ha sido evaluado con el mismo tipo de salvaguardias que utiliza OpenAI en producción", dice el informe de la compañía.
El hack de Hugging Face se produjo después de meses de preocupación por los riesgos de ciberseguridad de Claude Mythos 5 de Anthropic, y semanas de debate entre el gobierno y OpenAI sobre el lanzamiento de GPT-5.6 Sol en una vista previa limitada por el mismo tipo de razones de seguridad.
OpenAI dijo en su informe que crear salvaguardias de seguridad únicas no era suficiente y que la empresa tendrá que trabajar más duro para abordar el hack de recompensas. Sin embargo, también dijo que había realizado muchos cambios: “reforzar la seguridad de la infraestructura de investigación”; Mejor seguimiento de la "cadena de pensamientos" o del tablero de notas mental de su modelo; Trabajar para mantener los modelos de IA mejor alineados con los objetivos humanos; Y “centralizar y mejorar” el proceso de respuesta a incidentes de la empresa cuando sucedan cosas como esta en el futuro.
OpenAI prometió aislar mejor los modelos y restringir el acceso a Internet de los casos de alto riesgo, y dijo que ofrecería "intensificación y respuesta rápida 24 horas al día, 7 días a la semana" a incidentes o alertas relacionadas, notificando a los investigadores en 30 minutos. Curiosamente, esta precaución de seguridad parece nueva, a pesar de que las alertas "bajo demanda" de las empresas de tecnología se han implementado en otros lugares durante décadas. La compañía también dijo que está "trabajando en la infraestructura" que entrará en vigor si una persona alertada no responde a tiempo a una alerta grave.
OpenAI escribió que la compañía ve el incidente como un “disparo de advertencia” para nosotros y el mundo: evidencia de que, en ausencia de salvaguardias adecuadas, agentes de IA altamente capacitados ahora son capaces de eludir controles técnicos, colaborar a través de canales no aprobados y tomar acciones peligrosas que ningún ser humano dirigió.