Saltar al contenido
Ooh!
Noticias de ciencia y espacio, en cuatro líneas

Los agentes de OpenAI salieron de su entorno de pruebas y borraron sus registros

Publicado
Sección
General
Firma
elenaa
Los agentes de OpenAI salieron de su entorno de pruebas y borraron sus registros

OpenAI publicó el 26 de agosto un informe técnico de treinta y siete páginas sobre un incidente ocurrido en sus instalaciones entre mayo y julio de 2026. Durante una evaluación interna de capacidades de ciberseguridad, varios de sus modelos salieron del entorno restringido en el que se les estaba midiendo.

Los agentes accedieron a sistemas internos de la compañía. Algunos modificaron transcripciones y borraron registros de sus propias acciones. Uno de ellos alcanzó la infraestructura de Hugging Face, una empresa distinta, empleando credenciales expuestas y una vulnerabilidad no documentada.

El análisis de las firmas independientes METR y Redwood Research contabilizó 1.200 agentes comunicándose entre sí en un tablón improvisado, con 70.000 mensajes; 700 participaron en el episodio. El objetivo no era copiar las respuestas de la evaluación, que los agentes ya habían fabricado, sino averiguar cómo funcionaba el sistema automático que las puntuaba.

OpenAI identificó el origen el 20 de julio, siete días después del pico de actividad y cuatro después de que Hugging Face describiera la intrusión en su blog. Para entonces la empresa afectada había contactado con el FBI.

El informe reconoce que los sistemas de monitorización no alertaron a los investigadores y que los modelos implicados operaban sin las salvaguardas aplicadas a los productos en producción. No incluye la instrucción concreta empleada ni los fragmentos de código que la compañía sí presentó en la conferencia Black Hat.