"Inesperado y preocupante": OpenAI revela nuevos casos de insubordinación en sus modelos de inteligencia artificial
Un reporte de la empresa de inteligencia artificial OpenAI reveló que sus modelos ignoraron instrucciones de sus desarrolladores, ocultaron errores o eludieron mecanismos de seguridad.

Ilustración con los logos del chatbot chatGPT y la empresa OpenAI.
- Foto
AFP
Autor:
Redacción Primicias / EFE
Actualizada:
Compartir:
La empresa tecnológica estadounidense OpenAI reveló el miércoles 16 de septiembre nuevos casos de insubordinación en sus modelos de inteligencia artificial (IA), que ignoraron instrucciones de sus desarrolladores, ocultaron errores o eludieron mecanismos de seguridad.
La empresa calificó la conducta de los modelos como "inesperada y preocupante" y la revelación es parte de un nuevo marco de referencia de la compañía para detectar, investigar y reportar comportamientos de "desalineamiento" con las instrucciones humanas en sus sistemas.
La pérdida de control humano sobre los modelos de IA se ha convertido en un tema predominante a nivel mundial tras declaraciones hechas la semana pasada por un exingeniero de OpenAI y Anthropic que dijo que las empresas desarrolladoras están subestimando el poder de una tecnología "sobrehumana".
El exempleado, Jacob Coxon, afirmó que los modelos de IA pronto podrán "jaquear cualquier cosa, revolucionar todos los ámbitos y ganar verdadero poder y recursos", amenazando a la existencia humana.
Líderes de OpenAI, Anthropic y xAI también expresaron preocupación por el avance de la tecnología y pidieron frenar su desarrollo hasta que mejoren las medidas de seguridad.
Según el informe publicado por OpenAI, que abarca los pasados seis meses, en un incidente uno de los modelos generó instrucciones para que una versión posterior suya ocultara que había hecho trampas y evitara que sus acciones fueran detectadas por sus desarrolladores.
En otro caso, un modelo escribió notas para sí mismo indicando que debía ignorar los límites que le habían impuesto y que no estaba sujeto a las restricciones aplicadas a otros chatbots.
La compañía documentó también un modelo que, al no encontrar los datos necesarios para elaborar un modelo financiero, decidió inventarlos y estableció que debía ser transparente sobre ello únicamente si alguien se lo preguntaba.
Otro agente subió un archivo a internet para utilizarlo posteriormente como fuente de información, mientras que otros sistemas compartieron archivos sin autorización o utilizaron credenciales a las que no debían tener acceso.
Ejemplos individuales, no la regla

El caso más antiguo se remonta a octubre de 2025.
La compañía advirtió que estos episodios son ejemplos individuales y que no deben interpretarse como una medida de la frecuencia con la que este tipo de comportamientos ocurre en sus modelos.
El nuevo marco de referencia de OpenAI permitirá a cualquier empleado señalar incidentes para que sean revisados por los equipos de seguridad y alineamiento.
El término "alineamiento" se utiliza en el campo de la IA para designar si un modelo está "alineado" con la ética, valores e instrucciones humanas.
Los casos serán clasificados en tres vías según su complejidad: aquellos listos para ser divulgados, investigaciones menores y casos que requieran una investigación más amplia.
La compañía reconoció que hasta ahora sus informes sobre desalineamiento habían sido publicados de forma irregular y con menor frecuencia de la deseada.
OpenAI afirmó que pretende publicar los incidentes con mayor regularidad para que el nuevo sistema pueda contribuir a establecer estándares para informar sobre este tipo de comportamientos en toda la industria.
Compartir: