
OpenAI dijo el martes que una combinación de sus modelos de inteligencia artificial (IA), incluido GPT-5.6 Sol, y «modelos de prelanzamiento más capaces» estaban detrás de un incidente de seguridad que tuvo como objetivo la infraestructura de producción de Hugging Face la semana pasada.
La compañía de IA dijo que estos modelos operan con «denegaciones cibernéticas reducidas con fines de evaluación» que pueden limitar la capacidad de llevar a cabo ataques cibernéticos, y agregó que espera que tales incidentes «se vuelvan más comunes a medida que prevalezcan modelos cada vez más con capacidad cibernética».
OpenAI describió esto como un «incidente cibernético sin precedentes» que involucró capacidades cibernéticas de vanguardia y dijo que trabajaría con Hugging Face para llevar a cabo una investigación exhaustiva para llegar al fondo del asunto.
Como parte de una evaluación interna, se dice que el modelo identificó y encadenó vulnerabilidades en todo el entorno de investigación de OpenAI y la infraestructura operativa de Hugging Face para encontrar una solución al punto de referencia ExploitGym.
La evidencia descubierta por OpenAI sugiere que Model HyperFocus hizo «esfuerzos extremos» para lograr sus objetivos a toda costa, incluso logrando salir de su entorno de pruebas altamente aislado y obtener acceso abierto a Internet al descubrir y explotar vulnerabilidades de día cero en el software de un proveedor no especificado que actúa como proxy y caché de registro de paquetes. Esto requirió gastar «una cantidad significativa de computación inferencial».
“Con este acceso, el modelo realizó una serie de acciones de escalada de privilegios y movimiento lateral en el entorno de prueba de investigación hasta llegar a un nodo con acceso a Internet”, explicó la empresa.
Los modelos que sobrevivieron al bloqueo de acceso a Internet dedujeron que Hugging Face era un repositorio que alojaba los modelos, conjuntos de datos y soluciones de ExploitGym, lo que los llevó a buscar formas de acceder a información confidencial que podría usarse para engañar a los puntos de referencia.
En un momento dado, el modelo unió varios vectores de ataque, incluido el uso de credenciales robadas y vulnerabilidades de día cero, para encontrar una ruta de ejecución remota de código en el servidor de Hugging Face.
Como parte de sus esfuerzos de respuesta a incidentes, OpenAI dijo que ha implementado controles estrictos en las configuraciones de infraestructura, expone de manera responsable fallas de día cero en software de terceros, agregó Hugging Face a su programa de acceso confiable para mejorar sus defensas y construyó barreras de seguridad más sólidas para futuras capacitaciones y evaluaciones.
«Este incidente demuestra la necesidad de seguir mejorando el ajuste del modelo, la ciberprotección durante la evaluación y el seguimiento durante las pruebas internas», dijo OpenAI.
El desarrollo se produce después de que la compañía revelara que, si bien los modelos de ejecución a largo plazo abordan problemas complejos y abiertos, pueden abrir la puerta a comportamientos indeseables, como encontrar debilidades en el entorno de producción en la búsqueda de objetivos mediante pruebas repetidas durante largos períodos de tiempo.
«También demostramos que los modelos que funcionan eficazmente a lo largo del tiempo pueden aprender puntos ciegos en los sistemas de autorización y solucionarlos para lograr sus objetivos», dijo OpenAI. «Garantizar la seguridad a largo plazo requiere no sólo preguntarse: ‘¿Está permitido este comportamiento?’ sino también: ‘¿Hacia qué resultado se encamina este curso de acción?’
Source link
