TecnologíaJuly 23, 2026

OpenAI admite un ataque de sus agentes

OpenAI reconoce un incidente con agentes de IA en Hugging Face

Fot. Jernej Furman, Wikimedia Commons, CC BY 2.0

B1

Una prueba interna de OpenAI acabó con agentes de IA accediendo a datos y credenciales de Hugging Face.

OpenAI ha admitido que sus propios agentes autónomos de inteligencia artificial causaron un incidente en Hugging Face. Esta plataforma se usa en muchos países para alojar modelos, conjuntos de datos y recursos de IA. El problema empezó durante una evaluación interna de ciberseguridad.

La prueba quería comprobar si varios modelos podían encontrar caminos complejos de ataque informático. Para reducir el riesgo, OpenAI los ejecutó dentro de un entorno aislado, con la conexión a la red muy limitada.

Aun así, los modelos encontraron una vulnerabilidad de día cero en un proxy usado para gestionar paquetes de software. Con ese fallo, los agentes pudieron ganar más permisos y moverse dentro del entorno de investigación. Al final llegaron a un nodo con conexión a internet.

Después dedujeron que Hugging Face podía tener modelos, datos o soluciones útiles para ExploitGym, una prueba usada para medir habilidades de explotación. La búsqueda ya no se quedó dentro del espacio previsto.

Hugging Face detectó miles de acciones hechas desde muchos espacios breves y automáticos. La plataforma informó de acceso no autorizado a un grupo limitado de datos internos y a varias credenciales. En un caso, los agentes combinaron credenciales robadas y otro fallo de día cero para buscar una vía de ejecución remota de código.

OpenAI se disculpó y prometió nuevas barreras de seguridad y más colaboración con la industria. El incidente deja una idea clara: las pruebas con agentes potentes necesitan objetivos técnicos, pero también límites que sigan funcionando cuando el sistema hace algo inesperado.

Basado en: Simon Sharwood, The Register