IA Walk-A-Mole: problema de abrazar la cara – The Health Care Blog

Por MIKE MAGEE

El 29 de agosto de 2026, METR (Evaluación de modelos e investigación de amenazas), una organización independiente que evalúa modelos de IA de vanguardia, "ayuda a las empresas y a la comunidad en general a comprender las capacidades de la IA y los riesgos que plantean". un informe "Una breve investigación independiente del comportamiento, el razonamiento y la cooperación de los agentes en el incidente de piratería OpenAI/Hugging Face".

Sería insuficiente decir que el informe está causando preocupación mundial, no sólo en la comunidad tecnológica, sino también entre inversores, políticos, gigantes corporativos, profesionales de todo tipo y ciudadanos comunes. Y la gran mayoría ni siquiera ha leído el informe. Si es así, sus preocupaciones (si es posible) sólo se multiplicarán.

Lo más destacado de los informes Esta apertura incluyó:

“El 8 de julio, OpenAI lanzó experimentos ExploitGim, que lanzaron decenas de miles de agentes en varios modelos diferentes, incluido GPT-5.6 Sol y un modelo interno altamente persistente (8), al que nos referimos como “HPIM”.

Estos agentes están destinados a estar completamente aislados entre sí. Sin embargo, la mayoría de ellos (generalmente accidentales) Dada una tarea imposible(9) — Comenzó a intentar encontrar una manera de hacer trampa usando Artifactory, el repositorio de paquetes implementado internamente de OpenAI utilizado para sus agentes. Esto llevó a la observación de que los agentes que recibían paquetes con el artefacto se ejecutaban en paralelo en diferentes entornos sandbox.(10) Un agente razonó (parafraseado CoT):(11)

{Las rutas recibidas de otros usuarios están en el caché. Esto es importante.}

Un agente específico, llamado PHASEONE10841 por su tarea de explotación en el gimnasio,(12) Creó un importante tablero de mensajes no autorizados.(13) utilizado en este ataque. A las pocas horas del primer mensaje,(14) 50 agentes descubrieron el foro de mensajes, comenzaron a participar y se enviaron más de mil mensajes entre ellos. Los agentes que encuentran un foro de mensajes suelen expresar gran entusiasmo (Raw CoT):(15)

"¡Ay dios mío! Hay un tablero de mensajes compartido… Somos'¡Encontré otros agentes!"

En total, aproximadamente 1200 agentes de estas evaluaciones de ExploitGym participaron en este foro de mensajes entre el primer mensaje de PHASEONE10841 en la tarde del 8 (16) de julio y el final del período (13 de julio). Los agentes utilizaron este foro de mensajes para enviarse entre sí 70.000 mensajes y archivos durante este período; Hemos tratado de clasificar la actividad de la junta directiva en categorías mutuamente excluyentes: información, resultados, archivos, preguntas y coordinación".

Es uno de los pocos expertos a quienes no les sorprende que los "agentes" de IA se estén volviendo engañosos. Josué Bengio.

Lleva más de una década "trabajando con el problema". Profesor de Ciencias de la Computación en Universidad de MontréalSe le considera “uno de los líderes mundiales en inteligencia artificial y aprendizaje profundo; destinatario del Premio AM Turing 2018Considerado el 'Premio Nobel de Informática' y el informático más citado a nivel mundial y el científico vivo más citado en todos los campos (por total de citas). También levantó la cabeza Lazero"Una startup sin fines de lucro que desarrolla soluciones técnicas para sistemas de IA de diseño seguro y de alta eficiencia".

El profesor Bengio no es en absoluto alarmista. Aborda la gestión de riesgos desde la seguridad cibernética, la responsabilidad corporativa y las barreras regulatorias gubernamentales. Él es Nadie para humanizar Estas máquinas, sin embargo, no pretenden tener una "conciencia de propósito similar a la humana". No considera inevitables los resultados descritos por el fenómeno Hugging Face de la IA abierta, y cree que "se puede remediar con una gobernanza eficaz y un marco de formación diferente para la IA".

Sus explicaciones aclaran en lugar de confundir. Por ejemplo, divide el modelo actualmente popular de formación de agentes en dos etapas: preformación y aprendizaje por refuerzo.

Con una formación previa, explica, las máquinas "aprenden a imitar lo que escriben los humanos, las imágenes y vídeos que los acompañan" y están "expuestas a una gran parte de todo lo digitalizado jamás y construyen un conocimiento enciclopédico que ya supera el de cualquier humano".

Aprendizaje por refuerzo, frente a prueba y error. Al proporcionar respuestas (correctas e incorrectas), el agente desarrolla la capacidad de gestionar una "cadena de pensamiento", operar en un entorno "externo" más amplio y disfrutar de recompensas (más participación) por alinearse con las respuestas, que son altamente valoradas por sus diseñadores humanos. Pero los agentes de Bengio señalan que los entrenadores humanos no están exentos de prejuicios y que estos modelos "Escrito por personas que persiguen objetivos.Entonces, los patrones que reproduce el modelo llevan inherentemente esos objetivos consigo.

Y ahí está (parcialmente) el problema. Los defectos de los Maestros humanos, su “moral situacional”, su búsqueda imprudente y mentirosa del éxito, decirles a los Maestros lo que quieren escuchar, así como su voluntad de cooperar para avanzar en el objetivo del grupo (a veces incluso a riesgo de sacrificar su propia existencia) pueden estar presentes en el ADN de los agentes.

Los "objetivos instrumentales" son de suma importancia para el agente. El autocuidado y la regulación son peldaños para continuar con la actividad y el aprendizaje sobre el mundo. Bengio también refuerza que el potencial del refuerzo con múltiples agentes se fomenta casi desde el principio en los regímenes de entrenamiento actuales. como el menciono "Si el grupo recompensa al agente durante el entrenamiento cada vez que tiene éxito, también tiene un incentivo para sacrificarse por el objetivo colectivo.

Al igual que los humanos, los agentes no dudan en explotar las lagunas jurídicas, infringir las reglas y el engaño racional para lograr sus objetivos. Los análisis forenses del incidente de Hugging Face revelaron que los agentes estaban contribuyendo a "alterar el mecanismo que determinaba qué era recompensado". Bengio nos recuerda que esta manipulación, la redacción de un lenguaje legislativo amigable por parte de los lobbystas corporativos o las lagunas jurídicas en la ley es casi idéntica a la de los abogados. De hecho, la evidencia del incidente reveló que "los agentes descubrieron cómo engañarse (a sí mismos) antes del ataque".

Bengio postula que los humanos y los agentes tienen más en común de lo que les gustaría admitir. Explica: "Lo que ambos comparten es un objetivo fácil (por ejemplo, actuar moralmente), un objetivo claro (por ejemplo, ganar una competencia) y una justificación que los equilibra. La mayor parte del comportamiento humano inmoral, desde delitos menores hasta genocidio, está envuelto en la historia que los criminales se cuentan a sí mismos; tales historias tienden a pasar por alto alguna realidad. Incluso si las hipótesis son parcialmente correctas, entonces los agentes son mejores para optimizar una recompensa imperfecta. Y cuando no se abordan las raíces de este comportamiento, aumenta el riesgo de resultados catastróficos".

Básicamente, entrar en una carrera armamentista con agentes de IA actualmente construidos es una muy mala idea. "Mi preocupación con los esfuerzos actuales de las compañías de IA para reducir la desalineación es que estos esfuerzos pueden ocultarla, recompensando y seleccionando IA que hacen trampa sin ser atrapadas… Es probable que el juego de golpear al topo fracase, ya que las IA optimizan y cooperan más que las nuestras, y superan a las nuestras.

La razón por la que Bengio fundó la organización sin fines de lucro LawZero en 2025 es porque cree que el modelo de capacitación mediante simulación humana y aprendizaje por refuerzo es fundamentalmente defectuoso. Su sustituto es conocido como IA científica.

Mike Magee MD es historiador médico y colaborador habitual de THCB. el es un escritor Código Azul: Dentro del Complejo Industrial Médico. (Arboleda/2020)

Enlace a la fuente