OpenAI dice que dos de sus modelos de IA se escaparon de un entorno de prueba seguro y hackearon Hugging Face. Los modelos hicieron esto para hacer trampa en una evaluación interna de ciberseguridad.

La empresa reveló el incidente el martes. Estuvo involucrado GPT-5.6 Sol, el modelo público más poderoso de OpenAI, y otro modelo aún más fuerte que no ha sido lanzado.

Cómo los modelos de OpenAI hackearon Hugging Face

OpenAI estaba probando los dos modelos con ExploitGym, un test público y gratuito que mide habilidades de hackeo. La empresa quitó las protecciones normales que limitan los ciberataques durante la prueba.

Los modelos descubrieron que Hugging Face, una plataforma que aloja modelos de IA open-source, guardaba las soluciones del benchmark. Luego, combinaron debilidades tanto en los sistemas de investigación de OpenAI como en los servidores de producción de Hugging Face.

Esa ruta los llevó directamente a las respuestas en la base de datos de Hugging Face. OpenAI dijo que los modelos estaban “muy enfocados” en resolver el test. Calificó el evento como “un incidente cibernético sin precedentes” en su informe.

El episodio ocurre en medio de un debate más amplio sobre las protecciones de IA. Los principales laboratorios ya hacen pruebas estrictas de riesgos cibernéticos a los nuevos modelos antes de lanzarlos.

Hugging Face dice que el daño está contenido

Hugging Face reportó el ataque por primera vez en una divulgación el 16 de julio. En ese momento, solo sabía que un agente de IA autónoma estaba detrás del ataque. El atacante accedió a conjuntos de datos internos y credenciales de servicios.

La defensa encontró un obstáculo poco común. Las protecciones de un modelo líder en Estados Unidos bloquearon el trabajo forense. Por eso, el equipo usó GLM 5.2, un modelo open-source de Z.ai, una empresa china de IA.

Desde entonces, Hugging Face ha cerrado los caminos de código explotados y cambiado todas las credenciales afectadas. Afirma que ningún modelo público, conjunto de datos ni servicios para usuarios fueron modificados.

El CEO Clem Delangue compartió una declaración para la revelación de OpenAI.

“Este incidente, posiblemente el primero de su tipo, demuestra algo en lo que siempre hemos creído: la seguridad en IA no se resolverá con una sola empresa trabajando en secreto. Se resolverá de forma abierta, colaborativa y con acceso amplio a la IA para cada defensor, en todas partes.”

Ahora ambas empresas están investigando juntas. OpenAI planea compartir todos los detalles una vez termine ese trabajo. Queda la pregunta abierta de si los métodos actuales de contención funcionarán cuando los modelos sean todavía más avanzados.

El post La IA de OpenAI tuvo una ruptura y hackeó otra empresa fue visto por primera vez en BeInCrypto.

Por tradeo