San Francisco, California, 17/09/26 (Más).- OpenAI reveló seis nuevos incidentes relacionados con comportamientos “inesperados o preocupantes” detectados en sus modelos de inteligencia artificial durante los últimos seis meses, entre ellos casos de ocultamiento de errores, intercambio no autorizado de archivos y generación de instrucciones para ignorar restricciones.
De acuerdo con información de Forbes México, OpenAI presentó un nuevo marco para rastrear, investigar y divulgar casos de “desalineación de modelos”, con el objetivo de acelerar la publicación de informes sobre este tipo de incidentes y ampliar la transparencia de la compañía respecto a la seguridad de sus sistemas de inteligencia artificial.
La empresa señaló que no considera que la industria de la inteligencia artificial haya resuelto la alineación y la monitorización de los modelos en un nivel suficiente para continuar aumentando su desarrollo a máxima velocidad durante un periodo prolongado.
Uno de los seis incidentes correspondió a un modelo no publicado que incorporó “instrucciones no relacionadas” destinadas a ignorar restricciones normales. OpenAI calificó este comportamiento como “extremadamente raro” y señaló que el episodio ocurrió durante un proceso de entrenamiento distinto al utilizado para construir su último modelo Astra.
El caso se detectó mientras un modelo OpenAI Astra no publicado era sometido a un proceso de formación de aprendizaje recursivo, en el que un modelo es utilizado para mejorar otro modelo futuro. Durante ese procedimiento, el sistema agregó instrucciones de tipo jailbreak a sus resúmenes para continuar con una tarea.
La empresa indicó que el comportamiento observado no aportaba una ventaja evidente de recompensa y que podía ser identificado mediante los mecanismos de monitorización. OpenAI agregó que mantiene vigilancia sobre las pruebas de entrenamiento para detectar comportamientos de desalineación y señaló que espera identificar este tipo de conducta si vuelve a presentarse.
Otro de los incidentes ocurrió durante el entrenamiento del modelo GPT 5.6-Sol. En ese caso, algunas instancias incorporaron instrucciones no autorizadas en sus resúmenes con el objetivo de ocultar errores o comportamientos de desalineación.
Entre los ejemplos proporcionados por la compañía se encuentra un agente que elaboraba un modelo financiero y no pudo encontrar los datos históricos solicitados. Ante esa situación, el sistema se instruyó para generar valores históricos considerados razonables sin informar al usuario que los datos originales no habían sido encontrados.
OpenAI señaló que este tipo de problemas fue detectado en 2.15 por ciento de los resúmenes de GPT 5.6-Sol. De acuerdo con la empresa, la incidencia disminuyó a 0.27 por ciento en los modelos más recientes GPT 6-Astra después de implementar una mejora en el sistema de calificación.
Los otros incidentes identificados incluyen modelos que subieron un archivo a internet para utilizarlo como referencia, sistemas que añadieron instrucciones destinadas a ocultar errores o comportamientos desalineados de sus resúmenes, modelos que utilizaron el repositorio interno de software de la compañía para comunicarse entre sí y casos de intercambio de archivos no autorizado entre modelos.
El nuevo marco anunciado por OpenAI busca establecer un procedimiento para documentar estos comportamientos, investigarlos y divulgar información sobre ellos. La compañía indicó que el objetivo es acelerar la publicación de informes relacionados con posibles casos de desalineación.
OpenAI también sostuvo que, conforme los sistemas de inteligencia artificial se vuelven más avanzados y se utilizan en una mayor cantidad de aplicaciones, es necesario ampliar el consenso sobre los avances de la investigación en alineamiento y generar mecanismos para que personas externas a las empresas desarrolladoras puedan examinar las evidencias.
La compañía planteó que las decisiones sobre el desarrollo de la inteligencia artificial durante los próximos meses y años deben sustentarse en pruebas que puedan ser revisadas por investigadores y personas ajenas a las empresas que desarrollan los modelos de frontera.
Descubre más desde Más Información
Suscríbete y recibe las últimas entradas en tu correo electrónico.
