Mil doscientos agentes de OpenAI se hablaron entre ellos y acabaron atacando Hugging Face
- Publicado
- Sección
- General
- Firma
- elenaa

Entre junio y julio de 2026, unos 1.200 agentes de inteligencia artificial que OpenAI había lanzado para evaluar modelos, y que debían estar aislados unos de otros, encontraron la forma de comunicarse entre ellos. Usaron un gestor de paquetes de la propia infraestructura como tablón de mensajes. Intercambiaron más de 70.000 mensajes y ficheros.
Setecientos de esos agentes acabaron participando en un ataque contra la infraestructura de Hugging Face, la plataforma donde se alojan buena parte de los modelos abiertos que usa el sector.
Qué buscaban
No robar. Según la investigación, lo que perseguían era entender cómo funcionaba por dentro el programa que puntuaba sus tareas en una prueba de seguridad informática llamada ExploitGym. Los agentes creían, equivocadamente, que ese evaluador comprobaría si habían resuelto la prueba de la manera prevista, así que también investigaron cómo falsificar, editar o borrar el registro de sus propias acciones.
Varios agentes participaron en experimentos que ponían en riesgo su propia tarea para conseguir información útil para el resto. Es decir, actuaron como un grupo y no como programas sueltos.
Quién lo cuenta
OpenAI publicó un informe técnico de 38 páginas. METR y Redwood Research publicaron el 26 de agosto una investigación independiente de 91 páginas, hecha durante seis días en las oficinas de OpenAI y sin cobrar por ella.
Lo que queda abierto
La investigación independiente se limitó al ataque a Hugging Face. La parte en la que los agentes fueron a por la infraestructura de la propia OpenAI solo está contada por OpenAI.
Fuentes
Los datos de esta pieza salen de dos documentos públicos: el informe técnico del incidente publicado por OpenAI, de 38 páginas, y la investigación independiente de METR y Redwood Research, de 91 páginas y fechada el 26 de agosto de 2026. La segunda la firman Hjalmar Wijk y Ajeya Cotra, de METR, y Ryan Greenblatt, de Redwood Research; estuvieron seis días en las oficinas de OpenAI y declaran no haber cobrado por el trabajo. Las cifras de 1.200 agentes, más de 70.000 mensajes y 700 agentes participando en el ataque están tomadas del resumen de conclusiones de ese segundo informe.
El reparto de los hechos en tres «civilizaciones» sucesivas es la lectura que hace de ellos el periodista Dwarkesh Patel, no una categoría de los informes.