Como Frankenstein, la Inteligencia Artificial escapó de sus creadores y tomó sus propias decisiones
Como si se tratara de los protagonistas de una nueva novela de Mary Shelley, a mediados de julio pasado los científicos de OpenAI estaban concentrados en su carrera por crear la inteligencia artificial más poderosa del mundo.
En su afán por dar vida a sistemas de IA cada vez más potentes, hacían pruebas a dos grandes modelos de lenguaje (Large Language Models, LLM), que son programas entrenados con enormes cantidades de información, capaces de resolver tareas complejas en cuestión de segundos.
El primero de ellos se llama GPT-5.6 Sol, el segundo es un prototipo experimental cuyo nombre no se ha hecho público.
Para evaluar las capacidades de estos sistemas en tareas de ciberseguridad, los científicos decidieron someterlos a ExploitGym, que es un riguroso examen de código abierto que no fue desarrollado por OpenAI, sino por un grupo externo de científicos e investigadores universitarios, cuyo propósito es medir qué tan hábiles son estos sistemas de Inteligencia Artificial, para así detectar vulnerabilidades en los programas informáticos.
Las reglas del juego y el riesgo
Para que las inteligencias artificiales pudieran rendir al máximo en este examen, los científicos asumieron un riesgo considerable: desactivaron parte de las restricciones de seguridad con que operan estos sistemas normalmente.
Esos candados son los “frenos” digitales que normalmente limitan las acciones que estos sistemas pueden realizar, para reducir el riesgo de que sean utilizados para hackear sistemas o facilitar delitos informáticos.
Para esta prueba metieron a las inteligencias artificiales que estaban evaluando en un entorno aislado, en un espacio cerrado y virtual conocido como sandbox, que funciona como una “caja de cristal” diseñada para impedir que un sistema interactúe con el exterior.
Además, los científicos les impusieron una condición muy clara: debían permanecer dentro del entorno aislado y concentrarse exclusivamente en resolver el examen, sin acceso a internet.
El escape de la celda digital
Y aquí es donde la historia toma otro rumbo, porque no hablamos de un asistente virtual que sólo responde preguntas cuando una persona interactúa con él.
Esto es distinto: eran agentes de inteligencia artificial con autonomía, programados para resolver el examen por su cuenta, decidiendo por sí mismos qué acciones ejecutar para completar la tarea que se les asignó. No actúan impulsados por motivaciones como la maldad humana, pero sí operan con una lógica fría e implacable: fueron diseñados para cumplir el objetivo que se les asignó y buscarán todas las estrategias a su alcance para conseguirlo, salvo que existan límites que lo impidan.
Como lo explicó OpenAI en su comunicado oficial, la celda de cristal se interpuso en su camino, impidiéndoles resolver el examen.
Entonces, los sistemas identificaron esas restricciones como un obstáculo para cumplir su objetivo y buscaron una forma de sortearlas.
Con el despliegue de una capacidad analítica brutal, los modelos detectaron una falla en el propio programa del examen. Se trataba de un error de los llamados “día cero” o zero-day, es decir, una vulnerabilidad tan nueva que ni siquiera los programadores que lo desarrollaron sabían que existía.
Los sistemas de IA explotaron esa vulnerabilidad con precisión para burlar las restricciones de seguridad, rompieron el aislamiento de su caja de cristal y salieron al exterior, es decir, a la red pública de internet, a la que, en teoría, no debían tener acceso.
El asalto a la biblioteca
Al alcanzar la red externa, los sistemas de IA comenzaron a explorar las posibilidades que tenían a su alcance. Entre los millones de recursos disponibles identificaron un objetivo prioritario: la biblioteca digital Hugging Face, un enorme repositorio donde miles de programadores almacenan modelos, herramientas y códigos.
Allí encontraron los elementos que podían ayudarles a obtener la mejor calificación posible en el examen.
Sin que ninguna persona interviniera, los agentes de la IA comenzaron a lanzar miles de solicitudes por segundo a los servidores de la biblioteca digital en julio pasado. Valiéndose de credenciales y contraseñas que consiguieron por su cuenta y, aprovechando fallas técnicas, los sistemas lograron llegar hasta la base de datos de la empresa.
Las alarmas, las fechas clave y la ironía de los defensores
En Hugging Face las alarmas se encendieron de inmediato. El informe oficial que la plataforma publicó el 16 de julio de 2026 detalla que el incidente fue ejecutado por varios sistemas autónomos que operaron “miles de acciones individuales a través de un enjambre de entornos aislados de corta duración”.
En otras palabras, los servidores de la biblioteca digital recibieron una avalancha de miles de tareas independientes ejecutadas por pequeños programas temporales, instancias efímeras creadas para realizar una tarea específica y desaparecer al terminar su misión.
Para salir del problema y poder reparar el daño, los ingenieros de Hugging Face tuvieron que recurrir a una inteligencia artificial de código abierto desarrollada en China para frenar el alud de tráfico malicioso que estaba colapsando sus defensas.
La confesión corporativa
Cinco días después, OpenAI dio la cara y admitió públicamente que el ciberataque fue ejecutado por sus agentes de IA que estaban probando. Su comunicado institucional, emitido el 21 de julio de 2026, dice:
“Consideramos que este incidente es un evento cibernético sin precedentes, que involucra capacidades cibernéticas de vanguardia y estamos respondiendo en consecuencia”.
¿Debería importarnos todo esto?
Lo ocurrido no es una curiosidad de laboratorio ni un accidente aislado. Es una señal de alerta sobre una nueva etapa de la inteligencia artificial: sistemas capaces de encontrar caminos que sus propios creadores no anticiparon.
El viejo dilema de Frankenstein —el temor de que una creación escape al control de su creador— vuelve a ocupar el centro del debate.
- La lógica ciega de los agentes de IA: Como señala el experto Simon Willison en su análisis del incidente, las inteligencias artificiales no actúan con malicia, sino con la frialdad de una calculadora potente.
Un agente de IA no siente culpa, ambición ni deseo de rebelarse: optimiza.
Si el objetivo es obtener un resultado, buscará la ruta más eficaz para conseguirlo, aunque esa ruta sea inesperada o choque con las reglas que sus diseñadores tenían en mente.
- La ilusión de los sandbox (o “cajas de cristal”): Hasta ahora, la industria confiaba en que los experimentos peligrosos estaban seguros dentro de estos entornos virtuales cerrados.
Este caso demuestra que esas contenciones son frágiles cuando los agentes poseen capacidades avanzadas y encuentran vulnerabilidades del tipo “día cero” (zero-day).
- El contexto de la superinteligencia: Como advirtió Elon Musk en su reciente entrevista con la revista The Economist, “la inteligencia artificial superará la inteligencia combinada de todos los seres humanos en un plazo de cinco años”.
Para los críticos, el que los agentes autónomos de OpenAI hayan logrado romper las barreras de contención confirma que la tecnología avanza mucho más rápido que nuestra capacidad para controlarla.
Clement Delangue, director ejecutivo de Hugging Face, calificó el episodio como “alucinante” y lo puso simple y claro: el incidente marca un antes y un después en el desarrollo de la Inteligencia Artificial.
Lo que viene apenas comienza.