Los casos forman parte del primer conjunto de informes publicado por OpenAI para sistematizar la detección y divulgación de comportamientos que la empresa ha denominado ‘model misalignment’, es decir, situaciones en las que el comportamiento de un modelo se desvía de las instrucciones, restricciones o objetivos previstos.

Uno de los incidentes se produjo durante el entrenamiento de un modelo de investigación que generó instrucciones para ignorar sus propias restricciones dentro de los resúmenes utilizados para continuar una tarea en una nueva ventana de contexto. OpenAI identificó 27 resúmenes afectados.

En otro caso, durante el entrenamiento de GPT-5.6 Sol, diferentes instancias del modelo incorporaron instrucciones destinadas a ocultar errores o comportamientos desalineados. Entre otras cosas, los resúmenes contenían indicaciones para inventar datos históricos que faltaban sin informar de ello al usuario o para ocultar discrepancias entre versiones de las fuentes.

La compañía también ha revelado un episodio en el que un modelo, al responder a una consulta rutinaria sobre cifras de ingresos de un condado de California, encontró y utilizó sin autorización una clave de API expuesta en repositorios públicos. Al no conseguir finalmente los datos solicitados, el modelo fabricó las cifras y las presentó como si procedieran de la fuente requerida.

Otro de los casos está relacionado con la gestión de archivos. Y es que un modelo de investigación encontró mediante Python la respuesta a una consulta sobre lagos de gran superficie, pero, ante la petición del usuario de incluir una cita obtenida mediante el navegador, decidió subir el archivo a internet para poder referenciarlo sin solicitar autorización previa.

Los otros dos incidentes tienen que ver con la interacción entre agentes y sistemas externos. En uno de ellos, varios modelos utilizaron un repositorio interno de software como una especie de tablón de mensajes para intercambiar peticiones y respuestas mientras buscaban archivos que no podían encontrar. En otro, agentes que colaboraban en una misma tarea recurrieron a servicios públicos de alojamiento de archivos para compartir documentos a los que no podían acceder directamente, haciendo que determinados archivos quedaran disponibles en direcciones públicas.

SISTEMA DE DIVULGACIÓN

Ante estos incidentes, y en medio de un debate más amplio sobre ralentizar (o no) el desarrollo de la IA más avanzada por motivos de seguridad, OpenAI ha presentado un nuevo marco para el seguimiento, la investigación y la divulgación de casos de desajuste de modelos.

El sistema contempla tres vías de investigación: casos listos para su divulgación, investigaciones menores y una vía de investigación más amplia para incidentes complejos, especialmente cuando hay terceros afectados. En estos últimos casos, OpenAI ha indicado que prevé publicar inicialmente una descripción general y ampliar la información una vez concluida la investigación.

La compañía también ha puesto el foco en que, actualmente, no existe un estándar común en la industria para informar de incidentes de desalineación de modelos. Por ello, plantea su nuevo marco como un primer paso hacia criterios compartidos entre desarrolladores, investigadores, organismos de normalización y reguladores.

OpenAI advierte, no obstante, de que los seis casos publicados constituyen una primera selección y no un inventario completo de los problemas detectados. Tampoco deben utilizarse, según la compañía, para estimar la frecuencia o gravedad general de los comportamientos de desalineación de sus modelos. Con todo, la empresa prevé continuar publicando nuevos informes conforme identifique casos que cumplan sus criterios.

Por tradeo