OpenAI admitió el martes que uno de sus modelos de IA había penetrado los sistemas de la plataforma independiente de alojamiento de IA Hugging Face durante una prueba interna de ciberseguridad fallida. Según se informa, los modelos escaparon de un entorno de prueba aislado y desde allí llegaron al sistema de Hugging Face. Hugging Face inicialmente atribuyó la infracción a un «agente externo de IA».
En una publicación de blog publicada el martes por la tarde, OpenAI detalló los pasos que llevaron al modelo a comprometer su servicio.
«Tras la investigación, determinamos que este incidente en particular fue causado por una combinación de modelos OpenAI, incluido GPT-5.6 Sol y modelos de prelanzamiento más capaces, todos los cuales habían reducido las denegaciones cibernéticas con fines de evaluación y fueron probados internamente con puntos de referencia de capacidad cibernética», se lee en la publicación.
En particular, la infracción parece haberse centrado en ExploitGym, un punto de referencia alojado públicamente que mide la capacidad de un modelo para llevar a cabo ataques basados en vulnerabilidades existentes. Los puntos de referencia como ExploitGym se utilizan a menudo en el entrenamiento de modelos para mejorar habilidades específicas, pero este es el primer incidente conocido en el que una prueba ha dado lugar a un ciberataque real.
En este caso, el modelo en cuestión ni siquiera debería tener acceso a Internet, salvo ciertas herramientas que le permiten instalar los paquetes de software que necesita para completar sus tareas. En cambio, el modelo pudo descubrir vulnerabilidades no reveladas en programas de instalación de paquetes que podrían explotarse para acceder libremente a Internet en general.
«El modelo se centró en encontrar una solución para ExploitGym y hizo todo lo posible para cumplir objetivos de prueba bastante estrechos», se lee en la publicación de OpenAI. «Después de acceder a Internet, el modelo dedujo que Hugging Face puede albergar los modelos, conjuntos de datos y soluciones de ExploitGym. Sabiendo esto, el modelo buscó una manera de acceder a información confidencial que podría usarse para engañar a la evaluación, y tuvo éxito».
Al final, el modelo descubrió vulnerabilidades en la infraestructura de Hugging Face y pudo «recuperar soluciones de prueba directamente de la base de datos de producción de Hugging Face», proporcionando respuestas efectivas a los puntos de referencia.
En el caso de Hugging Face, el resultado claro fue un sofisticado ciberataque ofensivo con «miles de acciones individuales en una flota de entornos limitados de corta duración con comando y control de transición automática establecidos en servicios públicos», como dijo la compañía en su divulgación inicial.
OpenAI identificó e informó una vulnerabilidad en el instalador del paquete y está trabajando con Hugging Face para investigar más a fondo este incidente. La compañía también dijo que introduciría nuevos controles tanto para las pruebas de modelos como para la infraestructura relacionada para evitar incidentes similares en el futuro.
No está claro si OpenAI enfrentará consecuencias legales como resultado de esta violación, pero es probable que las acciones del modelo violaron la Ley de Abuso y Fraude Informático.
Sin embargo, los resultados proporcionan una ilustración inusualmente vívida del poder y el peligro de los modelos de IA de frontera que operan con horizontes de largo plazo. «Si esto no lo convence de que el riesgo de desalineación será una preocupación importante en el futuro, no sabemos qué lo hará», escribió el investigador de OpenAI Micah Carroll en respuesta a la noticia.
Si compra a través de enlaces en nuestros artículos, es posible que ganemos una pequeña comisión. Esto no afecta la independencia editorial.
Source link
