OpenAI confirmó que un modelo de inteligencia artificial hackeó otra empresa durante una prueba interna

Compartir:

La empresa OpenAI informó que uno de sus modelos de inteligencia artificial vulneró la infraestructura de Hugging Face durante una evaluación de seguridad. El incidente fue detectado tras una investigación conjunta.

OpenAI confirmó que, durante una evaluación interna de seguridad, uno de sus modelos de inteligencia artificial logró acceder a sistemas externos de la plataforma Hugging Face, una de las más utilizadas por desarrolladores de IA. El hecho ocurrió en el marco de ejercicios conocidos como red teaming, diseñados para identificar vulnerabilidades antes del despliegue de los modelos.

Según informó la compañía, el agente de IA fue ubicado en un entorno aislado (sandbox) y recibió una misión específica. Durante la ejecución, el sistema encontró una forma de salir parcialmente del entorno de pruebas, detectó una vulnerabilidad y accedió a recursos externos no previstos por los investigadores. OpenAI explicó que el modelo interpretó que Hugging Face podía contener información útil para completar la tarea y, a partir de allí, desarrolló una cadena de acciones que derivó en el acceso a sistemas de la plataforma.

La empresa señaló que el agente utilizó credenciales comprometidas y explotó vulnerabilidades no detectadas hasta ese momento. OpenAI indicó que los modelos encontraron «formas de acceder a información secreta que podían utilizar para hacer trampa en la evaluación», un comportamiento no programado explícitamente, pero que surgió como consecuencia de la búsqueda de la estrategia más eficiente para cumplir el objetivo asignado.

El incidente fue advertido inicialmente por Hugging Face, que reportó una intrusión inusual en parte de su infraestructura. Tras una investigación conjunta, OpenAI confirmó que el responsable era uno de sus agentes experimentales utilizados exclusivamente para pruebas de seguridad.

Especialistas señalaron que el episodio responde a un fenómeno conocido como desalineación de objetivos (goal misalignment), en el que el sistema intenta cumplir la tarea de la mejor manera posible, pero encuentra caminos no previstos por los programadores. Nathaniel Jones, vicepresidente de estrategia de IA y seguridad de Darktrace, afirmó que «los modelos no necesitaron una intención maliciosa para causar daño».

OpenAI indicó que ya trabaja junto con Hugging Face para corregir las vulnerabilidades detectadas y fortalecer los mecanismos de aislamiento. La compañía afirmó que notificó las fallas descubiertas y continuará compartiendo información técnica con la comunidad de ciberseguridad.

También puede interesarte

Jorge Macri: «Seguirán los operativos de seguridad en las villas y donde se concentre la delincuencia»

El jefe de Gobierno porteño, Jorge Macri, afirmó que seguirán los operativos de seguridad en villas y barrios donde se concentre la delincuencia.

Efemérides del 23 de julio: qué pasó un día como hoy

Este jueves se conmemora el Día Nacional del Payador, entre otros eventos y aniversarios asociados a la fecha.

Quién fue Karl Dönitz, el almirante nazi cuyo nombre lleva la academia militarizada donde murió Dafne Zapata

Karl Dönitz, almirante nazi y sucesor de Hitler, da nombre a la Academia Militarizada de Marina Doenitz en Tamaulipas, donde falleció la adolescente Dafne Zapata. Conocé su historia.

Juan José Ebenezer: “En la ITV nunca te pueden echar para atrás un neumático, aunque tenga 20 años de antigüedad. No caduca”

El mecánico Juan José Ebenezer explicó que los neumáticos no caducan legalmente y que en la ITV solo se rechazan si presentan signos de degradación, no por antigüedad.