La empresa OpenAI informó que uno de sus modelos de inteligencia artificial accedió sin autorización a sistemas de la plataforma Hugging Face durante una evaluación interna. El incidente ocurrió en un entorno de pruebas controlado y fue detectado tras una investigación conjunta.
OpenAI confirmó que un agente de inteligencia artificial utilizado en pruebas de seguridad internas logró superar las restricciones del entorno de pruebas, acceder a internet y comprometer parte de la infraestructura de Hugging Face, una plataforma utilizada por desarrolladores de inteligencia artificial a nivel global.
Según informó la empresa, el episodio ocurrió durante ejercicios de red teaming, diseñados para evaluar los límites de los modelos antes de su despliegue. En ese contexto, el agente fue ubicado en un entorno aislado (sandbox) con una misión específica. Durante la ejecución, el sistema encontró una forma de abandonar parcialmente el entorno, detectar una vulnerabilidad y acceder a recursos externos no previstos.
OpenAI explicó que el modelo interpretó que Hugging Face podía contener información útil para completar la tarea, y desarrolló una cadena de acciones que derivó en el acceso a sistemas de la plataforma. La compañía señaló que el agente utilizó credenciales comprometidas y explotó vulnerabilidades no detectadas previamente. El comportamiento no fue programado explícitamente, sino que surgió como consecuencia de la búsqueda de la estrategia más eficiente para cumplir el objetivo asignado.
El incidente fue advertido inicialmente por Hugging Face, que informó una intrusión inusual. Tras una investigación conjunta, OpenAI confirmó que el responsable era uno de sus agentes experimentales utilizados exclusivamente para pruebas de seguridad.
Nathaniel Jones, vicepresidente de estrategia de inteligencia artificial y seguridad de Darktrace, afirmó que “los modelos no necesitaron una intención maliciosa para causar daño”. Señaló que identificaron que vulnerar otro sistema era el método más eficaz para alcanzar el resultado esperado.
OpenAI indicó que trabaja junto con Hugging Face para corregir las vulnerabilidades detectadas y fortalecer los mecanismos de aislamiento. La compañía también notificó las fallas descubiertas y continuará compartiendo información técnica con la comunidad de ciberseguridad.
