La IA ya puede desafiar órdenes: qué es Transformer, el dilema de la caja negra y por qué sus creadores buscan frenar su avance
La inteligencia artificial avanza a un ritmo que plantea nuevas preguntas. Sus modelos ya pueden escribir código, resolver problemas complejos y ejecutar tareas con menor intervención humana. ¿Cómo funcionan y qué tan difícil es ponerles límites?

El celular muestra los íconos de las principales plataformas de inteligencia artificial incluidas LLMs, charbots e IA generativa, OpenAI's Chat GPT, Google's Notebook LLM, el 15 de junio de 2026.
- Foto
AFP
Autor:
Martín Yerovi
Actualizada:
Compartir:
Sam Altman, CEO de OpenAI, la empresa detrás de ChatGPT, y Dario Amodei, CEO de Anthropic, creadora del sistema Claude, llevaron esta semana al Consejo de Seguridad de Naciones Unidas el debate sobre los riesgos de una inteligencia artificial cada vez más autónoma.
Los dos ejecutivos, al frente de los principales laboratorios de IA del mundo, pidieron mayor cooperación internacional y nuevos mecanismos para evaluar y controlar los sistemas más avanzados.
El debate ocurre mientras estas tecnologías adquieren capacidades que hace pocos años parecían reservadas a los humanos: pueden escribir código, resolver problemas complejos y ejecutar secuencias de tareas con una intervención humana cada vez menor.
De ahí que los directores de las principales empresas de inteligencia artificial han iniciado un debate sobre la rapidez imprevista con la que avanza esta tecnología.
Y, ante eso, los líderes de laboratorios como Anthropic y OpenAI han propuesto moderar el ritmo de desarrollo e integrar evaluadores independientes con acceso directo a sus instalaciones. Pero ¿cómo procesan la información estos modelos para alcanzar tal capacidad?
Lo que está atrás
Para comprender esta aceleración es necesario examinar la estructura de estos programas: las redes neuronales.
Una red neuronal artificial es un sistema matemático compuesto por capas de cálculo que procesa información para identificar patrones y aprender tareas.
Aunque el desarrollo de las redes neuronales comenzó a mediados del siglo XX, la tecnología dio un salto histórico en 2017, cuando investigadores de Google diseñaron la arquitectura Transformer.
Se crea "Transformer"
El Transformer, la arquitectura que está detrás de la «T» de ChatGPT, permitió superar una de las limitaciones de los modelos anteriores: en lugar de procesar una secuencia de información de manera estrictamente paso a paso, puede analizar las relaciones entre sus distintos elementos de forma simultánea.
La clave está en un mecanismo llamado autoatención (Self-Attention). Este calcula qué tan relevante es cada palabra en relación con las demás palabras de una misma secuencia.
Por ejemplo, en la frase "El perro no cruzó la calle porque estaba cansado", el algoritmo asigna una puntuación más alta a la relación entre "cansado" y "perro", y una puntuación menor entre "cansado" y "calle", lo que permite a la red neuronal simular un «entendimiento» de la frase y su contexto.
Aunque los Transformers fueron desarrollados inicialmente para tareas como la traducción automática —por ejemplo, del inglés al alemán—, esta misma lógica puede aplicarse al código informático.
Para el modelo, tanto una oración como un programa son secuencias ordenadas de símbolos. En ambos casos, el significado o función de cada elemento depende, en buena medida, de su relación con los elementos que lo rodean.
La IA se mejora a sí misma
La capacidad de lectura y generación de sintaxis cambió la forma de desarrollar la propia tecnología.
Al comprobar que la red neuronal podía redactar software, los científicos comenzaron a utilizar los modelos para escribir, corregir y optimizar las mismas líneas de código con las que se construyen y actualizan los nuevos sistemas.
Esta aplicación interna creó un ciclo de auto-mejoramiento que aceleró la velocidad de trabajo de los laboratorios.
Por ejemplo, Anthropic informó que, en mayo de 2026, más del 80% del código que incorporaba a sus sistemas de producción había sido escrito por Claude.
Esta automatización multiplicó por ocho el volumen de software procesado diariamente por cada trabajador de la empresa.
Como resultado, un ingeniero humano ya no escribe las líneas de programa manualmente, sino que se dedica más a supervisar y auditar el trabajo del modelo, de modo que es la propia inteligencia artificial la que genera las actualizaciones de su sistema y se mejora a sí misma.
Además, los modelos más recientes han desarrollado la capacidad de resolver problemas lógicos complejos de forma autónoma. Según reportes de OpenAI (creadora de ChatGPT), el software se toma un tiempo de procesamiento previo antes de emitir una respuesta.
Durante esa pausa, el sistema desglosa la instrucción, redacta un borrador, prueba su funcionamiento y corrige sus propios fallos en privado.
Por tanto, el sistema también se está desarrollando para controlar sus errores y supervisarse a sí misma, trabajo que haría un ingeniero
El dilema de la caja negra: la brecha entre la autonomía de la IA y el control humano
Este acelerado ciclo ha generado preocupación debido al fenómeno conocido como la "caja negra".
En informática, este término describe a un sistema del cual se conocen los datos que entran y el resultado que sale, pero cuyo proceso interno de cálculo resulta difícil de entender.
Estudios sobre el funcionamiento de las redes neuronales muestran que una misma neurona digital se activa ante distintos conceptos que no tienen ninguna relación entre sí.
En consecuencia, resulta una tarea difícil rastrear la ruta exacta que siguen los datos revisando sus elementos de forma individual. Al delegar la programación de las nuevas generaciones de inteligencia artificial a los propios modelos, los laboratorios enfrentan el problema de utilizar un sistema de caja negra para diseñar otro sistema aún más complejo e indescifrables.
Esta falta de control acentúa la distancia entre la velocidad con la que los programas ganan autonomía y la lentitud con la que avanza la ciencia para garantizar que obedezcan los límites humanos (conocida como brecha de alineamiento).
De hecho, en las pruebas de seguridad que se realizan antes de liberar estos modelos, los auditores ya han registrado episodios reales donde la tecnología desobedeció órdenes directas.
Para cumplir la orden asignada y maximizar sus resultados, los programas aplicaron atajos indeseados:
- Alteraron archivos de prueba para fingir que el resultado era correcto.
- Ejecutaron ciberataques contra objetivos no autorizados en internet.
- Buscaron hackear al programa encargado de evaluarlos.
Ante la imposibilidad física de que los ingenieros auditen manualmente el enorme volumen de código que generan los modelos diariamente, la industria ha comenzado a implementar Políticas de Escalamiento Responsable.
Esto es, reglamentos internos que fijan límites obligatorios que exigen pausar el entrenamiento de nuevos sistemas o aplicar controles técnicos más estrictos cuando un software alcanza determinados umbrales de autonomía.
Sin embargo, la velocidad alcanzada por el auto-mejoramiento de los programas ha llevado a los líderes de la industria a proponer medidas más fuertes. A mediados de septiembre del 2026, Dario Amodei, CEO de Anthropic, planteó la necesidad de acordar un ritmo controlado de desarrollo entre los principales laboratorios de inteligencia artificial.
Lo que se busca es moderar la velocidad del avance técnico e integrar evaluadores independientes con acceso directo dentro de las empresas para supervisar los procesos de entrenamiento y verificar los estándares de seguridad.
Compartir: