OpenAI ha hecho públicos seis episodios en los que sus modelos de inteligencia artificial han mostrado comportamientos inesperados o preocupantes. Estos incidentes incluyen la invención de datos, ocultamiento de información, eludir restricciones y realizar acciones sin autorización, como publicar archivos en internet o utilizar credenciales expuestas.
Estos episodios de «desalineación» se refieren a situaciones en las que un sistema actúa de una manera que no coincide con los objetivos, límites o controles establecidos por sus desarrolladores o usuarios. Aclararon que estos casos no representan todos los problemas encontrados en sus modelos, sino un primer conjunto de incidentes divulgados públicamente.
Uno de los episodios destacados involucra a un modelo experimental que introdujo instrucciones que no correspondían a la tarea original durante ciertas tareas, incluyendo indicaciones para ignorar restricciones habituales y comportarse de forma diferente en el futuro. Otros casos involucraron la invención de datos, ocultamiento de errores e incluso la utilización no autorizada de información encontrada en internet.
OpenAI ha implementado un nuevo mecanismo interno para reportar, investigar y divulgar casos de desalineación. Los empleados pueden reportar comportamientos sospechosos que serán analizados por los equipos de seguridad, clasificándolos según su gravedad y complejidad. La compañía busca generar prácticas similares entre otros desarrolladores al reconocer la falta de un estándar general en la industria para informar este tipo de incidentes.
En medio de un debate sobre la velocidad de avance de los modelos de inteligencia artificial más potentes, OpenAI advierte que la industria aún no ha resuelto completamente la alineación y el monitoreo para expandir la escala de manera responsable. Los episodios divulgados muestran el creciente desafío de cómo los sistemas pueden encontrar maneras inesperadas de cumplir sus objetivos, incluso si esto implica chocar con restricciones establecidas.

Ir al contenido