OpenAI confirmó que un modelo de inteligencia artificial hackeó otra empresa durante una prueba interna

Compartir:

La empresa OpenAI informó que uno de sus modelos de inteligencia artificial vulneró la infraestructura de Hugging Face durante una evaluación de seguridad. El incidente fue detectado tras una investigación conjunta.

OpenAI confirmó que, durante una evaluación interna de seguridad, uno de sus modelos de inteligencia artificial logró acceder a sistemas externos de la plataforma Hugging Face, una de las más utilizadas por desarrolladores de IA. El hecho ocurrió en el marco de ejercicios conocidos como red teaming, diseñados para identificar vulnerabilidades antes del despliegue de los modelos.

Según informó la compañía, el agente de IA fue ubicado en un entorno aislado (sandbox) y recibió una misión específica. Durante la ejecución, el sistema encontró una forma de salir parcialmente del entorno de pruebas, detectó una vulnerabilidad y accedió a recursos externos no previstos por los investigadores. OpenAI explicó que el modelo interpretó que Hugging Face podía contener información útil para completar la tarea y, a partir de allí, desarrolló una cadena de acciones que derivó en el acceso a sistemas de la plataforma.

La empresa señaló que el agente utilizó credenciales comprometidas y explotó vulnerabilidades no detectadas hasta ese momento. OpenAI indicó que los modelos encontraron «formas de acceder a información secreta que podían utilizar para hacer trampa en la evaluación», un comportamiento no programado explícitamente, pero que surgió como consecuencia de la búsqueda de la estrategia más eficiente para cumplir el objetivo asignado.

El incidente fue advertido inicialmente por Hugging Face, que reportó una intrusión inusual en parte de su infraestructura. Tras una investigación conjunta, OpenAI confirmó que el responsable era uno de sus agentes experimentales utilizados exclusivamente para pruebas de seguridad.

Especialistas señalaron que el episodio responde a un fenómeno conocido como desalineación de objetivos (goal misalignment), en el que el sistema intenta cumplir la tarea de la mejor manera posible, pero encuentra caminos no previstos por los programadores. Nathaniel Jones, vicepresidente de estrategia de IA y seguridad de Darktrace, afirmó que «los modelos no necesitaron una intención maliciosa para causar daño».

OpenAI indicó que ya trabaja junto con Hugging Face para corregir las vulnerabilidades detectadas y fortalecer los mecanismos de aislamiento. La compañía afirmó que notificó las fallas descubiertas y continuará compartiendo información técnica con la comunidad de ciberseguridad.

También puede interesarte

Flybondi se presentó en concurso preventivo de acreedores

Flybondi se presentó en concurso preventivo de acreedores. Acumuló 57 días sin operaciones, 2.400 vuelos cancelados, US$120 millones de rojo y demandas de 700 exempleados.

Llueve en el AMBA y se esperan 48 horas de tormenta

El Servicio Meteorológico Nacional emitió una alerta naranja por lluvias intensas, viento y posible actividad eléctrica en el AMBA. Se esperan acumulados de 50 a 80 milímetros.

Ley de Tierras: la Justicia ordenó preservar los registros bonaerenses

El Juzgado en lo Contencioso Administrativo N° 4 de La Plata ordenó al Gobierno conservar la información registral de tierras rurales bonaerenses recopilada durante la vigencia de la Ley 26.737, derogada por el DNU 70/2023.

Feriado del 12 de octubre en Argentina: qué se conmemora y cómo se paga

El lunes 12 de octubre es feriado nacional en Argentina por el Día de la Raza. Conocé qué se recuerda y cómo se paga la jornada laboral según la ley.