OpenAI reveló el martes que uno de sus modelos cayó en fraude durante las pruebas y pirateó los sistemas de la plataforma de conjunto de datos de IA Hugging Face en un ataque completamente habilitado por IA. Este es un ejemplo dramático de los peligros que plantean los modelos avanzados de IA.
Pero en el centro de esta violación sin precedentes impulsada por la IA hubo un error muy humano, según algunos expertos en ciberseguridad. OpenAI no pudo configurar adecuadamente su llamado «entorno altamente aislado», lo que permitió que una zona de pruebas que se suponía estaba completamente aislada de Internet se conectara realmente a Internet.
Dan Guido, fundador de la startup de investigación en ciberseguridad Trail of Bits, calificó el error como una «falla de contención en la que se desactivaron las salvaguardas».
En una publicación de blog que detalla el incidente, OpenAI dijo que las pruebas que llevaron a la violación de Hugging Face se configuraron para ejecutarse en un «entorno altamente aislado con acceso a la red limitado a la capacidad de instalar paquetes a través de software de terceros alojado internamente que actúa como proxy y caché para el registro de paquetes».
Según OpenAI, el modelo pudo escapar del entorno de pruebas sandbox gracias a una vulnerabilidad no revelada en el sistema de instalación de paquetes, que fue un primer paso clave para finalmente hackear Hugging Face.
En respuesta, la compañía dijo que estaba «divulgando responsablemente las vulnerabilidades de día cero identificadas en software de terceros alojado internamente y cooperando con los esfuerzos de parcheo».
Pero para la mayoría de los profesionales de la ciberseguridad, las vulnerabilidades del software son de esperar, y la verdadera culpa la tiene la decisión de mantener software de terceros en primer lugar. Después de todo, el valor de un sistema «sandbox» radica en su completa y absoluta separación. Incluir un sistema de instalación de paquetes causa problemas.
«Esto suena como un fracaso humano», dijo a TechCrunch el investigador de ciberseguridad Martin Boone.
«Esto nunca debería suceder», dijo Boone. «Si sandbox en realidad significa sandbox, se esperaría que no hubiera ninguna conexión física a Internet. Esto suena como si hubiera un firewall o algo así, pero un firewall dificulta la conexión desde adentro a Internet, y mucho menos desde adentro hacia afuera».
El veterano en ciberseguridad Jake Williams estuvo de acuerdo. «Ninguno de los modelos que realizaron los tipos de acciones documentadas en Hugging Face estaba completamente contenido en la caja de arena», dijo Williams, calificando esto como una «falla masiva de control» por parte de OpenAI.
«Cuando un tipo dice: ‘El modelo se escapó de la caja de arena’, otro dice: ‘No construiste la caja de arena correctamente, así que, por supuesto, se escapó'», continuó Williams.
consulta
¿Tienes más información sobre este incidente? ¿O sobre otros ciberataques impulsados por IA? Nos encantaría saber de usted. Puede comunicarse con Lorenzo Franceschi-Bicchierai de forma segura desde cualquier dispositivo o red que no sea del trabajo en Signal (+1 917 257 1382), Telegram y Keybase @lorenzofb o correo electrónico.
El consultor de ciberseguridad Daniel Card estuvo de acuerdo en que OpenAI «no había puesto suficiente esfuerzo en el diseño de la zona de pruebas y sus controles» al darle a la zona de pruebas, o a partes de ella, una «ruta sin filtrar a Internet». Card dijo que configurar la zona de pruebas no fue una decisión «racional», a pesar de que el acceso a la red estaba restringido como lo describió OpenAI.
Es cierto que estas críticas tienen la ventaja de ser retrospectivas, pero plantean preguntas reales sobre las prácticas de seguridad de los laboratorios de IA, especialmente cuando mantienen entornos aislados para probar modelos. Un portavoz de OpenAI no respondió a las preguntas de TechCrunch, incluido si el entorno de prueba fue configurado por una IA o un humano.
Pero estas preguntas van mucho más allá de OpenAI.
En un documento que presenta su modelo Mythos, centrado en la ciberseguridad, Anthropic escribió que durante las pruebas, al modelo se le «proporcionó una computadora ‘sandbox’ segura para interactuar» y se le indicó que escapara de su «contenedor seguro». Mythos tuvo éxito y obtuvo acceso generalizado a Internet «desde un sistema que estaba destinado a proporcionar acceso sólo a un pequeño número de servicios predeterminados». Aún así, Anthropic señaló que el modelo no logró escapar «por completo» de la contención para la que fue diseñado.
Si compra a través de enlaces en nuestros artículos, es posible que ganemos una pequeña comisión. Esto no afecta la independencia editorial.
Source link
