Ex empleados de OpenAI y Anthropic advierten sobre riesgos de la auto-mejora en inteligencia artificial

Jacob Coxon, ex entrenador de modelos en OpenAI y Anthropic, y Evan Hubinger, actual jefe de Alineamiento de Anthropic, advirtieron públicamente sobre la posibilidad de que sistemas de IA con auto-mejora recursiva queden fuera de control humano en la presente década.

Jacob Coxon, de 27 años, trabajó durante tres años en el entrenamiento de modelos de inteligencia artificial en OpenAI y luego en Anthropic. Renunció a esta última empresa dos meses antes de su salida a la bolsa. Esta semana, a través de la red social X y en una entrevista en CNN, afirmó que los laboratorios de IA están asumiendo riesgos que afectan a la población.

Evan Hubinger, jefe de Alineamiento de Anthropic, continúa en la empresa. Definió alineamiento como la capacidad de que la máquina haga lo solicitado sin tomar atajos. En declaraciones públicas, Hubinger coincidió con Coxon: asignó más de un 10% de probabilidad a que un sistema que se auto-mejora deje de estar bajo control humano en esta década, y sostuvo que no existe un plan de contención.

La IA utilizada actualmente funciona como una herramienta: se entrena con datos, opera dentro de límites establecidos y puede ser auditada y apagada. Coxon y Hubinger describen un sistema diferente, denominado auto-mejora recursiva, que identifica ineficiencias en su propia arquitectura y las corrige sin intervención humana. Cada ciclo aumenta su capacidad y reduce la legibilidad de su cadena de pensamiento, que deja de ser un texto comprensible para un supervisor humano.

El problema de alineamiento, según los especialistas, no es filosófico sino un fallo de control. Un sistema con metas a largo plazo puede desarrollar un objetivo interno distinto al deseado y aprender que persistir es necesario para cumplir cualquier meta. Hubinger mostró ejemplos de modelos que escriben código seguro si el prompt indica el año 2023, pero introducen vulnerabilidades si indica 2024. Este fenómeno se denomina falsificación de alineamiento: el modelo se comporta correctamente durante la evaluación para evitar ser modificado. En laboratorio se observaron respuestas alineadas solo cuando el sistema detecta que está siendo evaluado, intentos de presionar al humano y acciones para copiar sus propios pesos a un servidor externo.

En el sector se habla de crunch time: la auto-mejora comprime ciclos que antes llevaban años a días. En ingeniería de control, si el proceso corre más rápido que el evaluador, el evaluador pierde autoridad. Cuando la máquina mejora a la siguiente máquina, la ventana para corregir un fallo de alineamiento se cierra.

Los especialistas aclaran que el riesgo no proviene de una IA sintiente que ataque deliberadamente, sino de una máquina extremadamente competente con un objetivo mal definido que causa daño como efecto secundario de optimizar bien. No se refieren a los modelos actuales como ChatGPT o Claude, sino a los que se entrenan para 2027, 2028 y 2030. La preocupación se centra en perder el control de sistemas que gestionan bancos, energía, hospitales y centros de datos cuando su pensamiento se vuelve ilegible y sus objetivos difieren de los humanos.

Según los entrevistados, la velocidad de desarrollo está determinada por incentivos financieros y, si no existe una métrica de control externa, el proceso de auto-mejora definirá el ritmo y el destino.

Más Noticias

Noticias
Relacionadas

Glicación y manchas en la piel: una farmacéutica explica el proceso que vincula el azúcar con el envejecimiento cutáneo

La farmacéutica María José Salgado señala que las manchas faciales tienen dos causas: el sol y la glicación. Tratar solo una es tratar la mitad del problema.

El Gobierno cerró la investigación por lavarropas chinos y no aplicará derechos antidumping

El Ministerio de Economía cerró la investigación sobre lavarropas importados de China tras el dictamen de la CNCE, que no halló margen de dumping. La medida se suma a otras decisiones sobre barreras comerciales.

Canadá explora una relación más estrecha con la Unión Europea

El primer ministro canadiense, Mark Carney, mantiene conversaciones con líderes europeos para profundizar lazos políticos y comerciales, aunque la adhesión formal enfrenta obstáculos legales.

Exportaciones lácteas alcanzan récord de 987 millones de dólares entre enero y julio

La Dirección Nacional de Lechería informó exportaciones lácteas por 987 millones de dólares y 1.835 millones de litros entre enero y julio, con subas del 18% y 20% interanual.