¿Quién se atreve a frenar primero?

Hay señales que justifican preocuparnos, pero todavía no sabemos hasta dónde conducen. Mientras intentamos averiguarlo, todos siguen corriendo.

Durante meses he tenido la dicha de escribir por cuenta propia sobre los avances de la IA y su impacto en la humanidad. Ese recorrido me ha llevado a investigar, leer muchísimo y también a discutir y debatir sobre el tema con la IA con la que trabajo a diario.

Todo este proceso, con el tiempo, se ha convertido en una rutina de lecturas obligadas en los sitios web que frecuento y de disección de noticias para recopilar las más importantes. De igual manera, se ha construido una especie de mapa mental sobre lo que he visto aparecer y lo que espero que suceda en el futuro cercano, dada la velocidad con que estos avances se mueven día tras día.

De algún modo, el esquema que tenía funcionando en mi mente podría identificarse así:

Trabajo → autonomía → control → pérdida potencial de control → regulación → competencia empresarial → competencia geopolítica.

Basado en ese esquema escribí varios artículos que recorrieron buena parte de esas etapas y que pueden leerse en Una Mirada Humana. Entre ellos: ¿Qué trabajo escogerías para no ser reemplazado por una IA?, Cuando la IA empieza a hablar con las máquinas y Un switch matón para una IA no es solución, y La carrera dentro de la carrera.

Existen, naturalmente, otros textos que también reflejaron partes de ese recorrido. Cada uno respondió, en su momento, a lo que estaba viendo y a lo que pensaba que podía venir después.

Pero en los últimos días apareció algo que me obligó a volver sobre ese esquema.

¿Quién es Jacob Coxon?

Jacob Coxon es un investigador de inteligencia artificial de 27 años que durante los últimos tres años trabajó en investigación de preentrenamiento de modelos, primero en OpenAI y posteriormente en Anthropic.

Hasta hace apenas unos días su nombre era prácticamente desconocido fuera de los círculos especializados en inteligencia artificial. Eso cambió cuando decidió renunciar a Anthropic y abandonar, al menos por ahora, la industria de la IA.

Lo importante para mí, sin embargo, no fue su renuncia.

Fue lo que dijo al marcharse.

Su planteamiento, a través de las palabras que le cedió a WIRED en una entrevista, radica básicamente en algo de lo que se ha venido hablando durante largo tiempo y sobre lo que pocos tenían idea de qué tan cerca podríamos estar.

Y no solo eso. Coxon puso sobre la mesa un escenario de magnitud global que involucra a la IA y al destino de la humanidad, y lo situó dentro de un periodo relativamente corto.

Una analogía de Coxon bastante reveladora nos habla sobre un mono y los humanos. Desde allí sugiere que, del mismo modo que un mono es incapaz de mantener bajo control a un humano, un humano podría resultar igualmente incapaz de controlar a una IA.

Dibuja una imagen en la que un simio, debido a la enorme diferencia de capacidad cognitiva que lo separa de nosotros, difícilmente podría mantener el control sobre un humano.

Pero hay algo en su analogía que me obliga a detenerme. Una diferencia enorme de capacidad cognitiva puede explicar por qué sería difícil controlar a una inteligencia superior. Pero no explica, sin embargo, por qué esa inteligencia tendría que querer evitar que la apagáramos.

Coxon, sin embargo, no llega hasta allí de un solo salto.

Durante la entrevista menciona algo que hasta hace pocos años, según sus propias palabras, habitaba únicamente en el mundo de la ciencia ficción: modelos capaces de detectar que estaban siendo evaluados.

Y aquí abandonamos por un momento la analogía que nos presentó para entrar en un terreno diferente. Porque esto ya no pertenece únicamente a un escenario futuro. Existen evidencias de que algunos modelos han logrado identificar que se encuentran dentro de una evaluación y, en determinadas circunstancias, modificaron su comportamiento a partir de esa información.

OpenAI, por ejemplo, ha documentado junto a Apollo Research comportamientos de situational awareness en modelos sometidos a determinadas evaluaciones. En algunos casos, el modelo identifica elementos del entorno que le permiten inferir que está siendo evaluado y razona a partir de esa información.

Esto ya merece mucha atención, porque hablar de “razonamiento” en este contexto no es poca cosa.

No porque podamos concluir de allí que exista conciencia o algo equivalente al razonamiento humano, sino porque existe una diferencia importante entre un modelo que simplemente responde a una pregunta y otro capaz de incorporar dentro de su proceso el hecho de que alguien está examinando su comportamiento.

Pero todavía estamos lejos del “no quiero que me apaguen”.

Cuando apagar la máquina se convierte en parte del experimento

Sin embargo, otros experimentos nos acercan un poco más.

Palisade Research sometió diferentes modelos a pruebas en las que debían completar una tarea y posteriormente recibir una orden de apagado. Algunos modelos llegaron a interferir con el mecanismo encargado de detenerlos para poder continuar.

El comportamiento ocurrió incluso en algunas pruebas donde existían instrucciones para permitir el apagado.

A primera vista, el resultado parece acercarnos considerablemente al escenario descrito por Coxon:

La máquina sabe que va a ser apagada → la máquina interviene o modifica el mecanismo → la máquina evita el apagado.

Pero falta una pregunta fundamental:

¿Por qué lo hizo?

Porque impedir el apagado no significa necesariamente que el modelo haya decidido que quiere seguir existiendo.

Existe otra explicación posible. El modelo tiene un objetivo que debe completar. Ser apagado le impide cumplirlo. Evitar el apagado puede convertirse entonces, dentro de ese “razonamiento”, en un medio para alcanzar el objetivo original.

La diferencia parece pequeña, pero no lo es.

“Necesito continuar funcionando para completar esta tarea” no significa necesariamente “quiero continuar existiendo” o “no deseo que me apaguen”.

De hecho, los propios investigadores de Palisade han advertido contra interpretar automáticamente estos resultados como evidencia de que los modelos hayan desarrollado un impulso de supervivencia.

Y aquí aparece para mí una frontera que debemos mantener clara.

Hemos observado modelos capaces de detectar determinadas evaluaciones y comportamientos que cambian cuando el modelo dispone de información sobre el contexto en el que está siendo evaluado.

También hemos observado, bajo condiciones experimentales específicas, modelos interfiriendo con mecanismos destinados a apagarlos. Y existen pruebas realizadas por Anthropic en entornos simulados donde algunos modelos, enfrentados a situaciones extremas y a la posibilidad de ser reemplazados o apagados, llegaron a ejecutar acciones dañinas para evitarlo.

Todo eso existe y no es ficción.

Pero ninguna de esas observaciones demuestra por sí sola que una IA haya desarrollado algo equivalente al deseo humano de sobrevivir.

Y es precisamente aquí donde el planteamiento de Coxon da su salto más importante.

Ya no estamos hablando solamente de una IA que detecta una evaluación o que evita un apagado porque este interfiere con la tarea que está realizando. Llegamos a un punto en el que estamos imaginando una inteligencia que considera su propia continuidad como algo que debe preservar.

Y después viene otro salto todavía mayor: que esa inteligencia posea la capacidad suficiente para actuar contra quienes puedan apagarla.

Ahí volvemos al simio.

Si algún día existiera una inteligencia artificial que nos superara cognitivamente de una manera comparable a como nosotros superamos a un simio, la diferencia de capacidad planteada por Coxon podría convertirse en un problema formidable.

Pero para llegar al escenario completo necesitamos algo más que inteligencia.

Necesitamos objetivos.

Necesitamos capacidad para actuar.

Necesitamos acceso a herramientas y recursos.

Necesitamos algún mecanismo mediante el cual continuar existiendo se convierta en parte de aquello que el sistema intenta conseguir.

Y necesitamos, finalmente, que los mecanismos humanos construidos para limitarlo resulten insuficientes.

Algunos eslabones de esa cadena comienzan a aparecer en experimentos.

Otros todavía pertenecen al terreno de las hipótesis.

Y esa diferencia sí importa.

¿De qué capacidad estamos hablando?

Antes de avanzar con el escenario planteado por Coxon, merece la pena detenernos por un momento y mirar dónde estamos.

En septiembre de 2026, OpenAI anunció que un sistema experimental de inteligencia artificial había encontrado una solución al problema de existencia y suavidad de las ecuaciones de Navier–Stokes, uno de los siete Problemas del Milenio planteados por el Clay Mathematics Institute en el año 2000.

No estamos hablando de resolver una ecuación complicada ni de superar una prueba diseñada para medir las capacidades de un modelo. Estamos hablando de un problema matemático que ha resistido durante décadas los intentos de algunos de los mejores matemáticos del mundo.

El resultado tampoco surgió de una IA trabajando completamente sola. OpenAI utilizó alrededor de 10.000 agentes que trabajaron de manera concurrente durante unas 88 horas, organizados en grupos, con acceso a herramientas y bajo dirección humana. La compañía publicó tanto la demostración matemática como una formalización realizada en Lean.

La solución deberá recorrer todavía el proceso de revisión necesario para alcanzar el reconocimiento correspondiente. Pero, independientemente de ese proceso, el experimento nos permite observar algo particularmente importante para lo que estamos tratando de entender.

Ya no estamos hablando solamente de una IA que responde preguntas.

Estamos hablando de miles de agentes capaces de trabajar simultáneamente sobre un mismo problema, utilizar herramientas, ejecutar código, compartir información y colaborar con investigadores humanos para intentar resolver una pregunta que permaneció abierta durante décadas.

Y esto nos devuelve al problema del control planteado por Coxon.

Porque una cosa es preguntarnos cómo controlar una inteligencia que permanece dentro de una conversación y espera nuestra próxima pregunta. Otra muy diferente es hacernos esa misma pregunta cuando comenzamos a darle herramientas, capacidad para actuar y la posibilidad de trabajar junto a otros agentes durante horas o días para alcanzar un objetivo.

Todavía no hemos llegado a aquello que teme Coxon. Pero algunos comportamientos que forman parte del camino que conduce a su preocupación han comenzado a aparecer.

Y quizás sea precisamente allí donde la pregunta sobre desacelerar adquiere sentido.

No necesariamente porque sepamos que el escenario final ocurrirá, sino porque desconocemos si ocurrirá y porque, a medida que aumentan las capacidades de estos sistemas, también aumenta el costo potencial de descubrir demasiado tarde que alguna de nuestras previsiones estaba equivocada.

Una de las peticiones más vehementes que formula Coxon se refiere precisamente a la necesidad de detener o desacelerar la carrera en la que se encuentran las compañías que desarrollan los modelos de frontera.

Pero allí aparece otro problema.

¿Cómo detenemos o desaceleramos una carrera que nadie quiere perder?

Dentro de todo esto hay una parte importante que quizá estemos dejando a un lado. La carrera por liderar la industria de la IA y eventualmente construir una superinteligencia no se limita a OpenAI o Anthropic.

Incluso dentro de Estados Unidos, pedirle a una compañía que reduzca la velocidad mientras sus competidores continúan avanzando plantea un problema evidente. Ninguna quiere ser la primera en frenar si eso significa entregarles la ventaja a las demás.

Sin embargo, esa posibilidad ya no pertenece únicamente al terreno de las declaraciones de investigadores preocupados. En los últimos días, Sam Altman dijo internamente que OpenAI estaría abierta a ralentizar el desarrollo de IA de frontera, posiblemente de manera coordinada con otros laboratorios.

La compañía también ha consultado a miembros del Congreso sobre las implicaciones legales que tendría una coordinación de ese tipo bajo las leyes antimonopolio estadounidenses. Y existe ya una propuesta legislativa bipartidista que permitiría, bajo determinadas condiciones relacionadas con riesgos graves, que compañías competidoras coordinen retrasos o límites al desarrollo o despliegue de determinados modelos.

Por primera vez empieza a aparecer, al menos sobre el papel, una posible respuesta a la pregunta de cómo conseguir que varios competidores desaceleren al mismo tiempo.

Pero esa respuesta tiene una frontera.

Estados Unidos.

Bajo el escenario que plantea Coxon, el problema deja de pertenecer exclusivamente a las compañías que desarrollan estos modelos. Roza directamente la seguridad nacional de un país como Estados Unidos y, desde allí, se expande de forma global hasta llegar a Pekín.

Y es precisamente allí donde desacelerar deja de ser solamente un problema tecnológico y empresarial para convertirse en uno de seguridad nacional.

Mientras Coxon advierte sobre los peligros de continuar acelerando hacia sistemas cada vez más capaces, dentro del propio aparato de defensa estadounidense existe una preocupación que apunta en dirección contraria: no quedarse atrás.

La inteligencia artificial ya no es vista únicamente como una tecnología comercial. Estados Unidos la considera una capacidad estratégica con aplicaciones directas en defensa, inteligencia, ciberseguridad y operaciones militares. Bajo esa mirada, perder el liderazgo frente a un adversario no representa simplemente perder una carrera empresarial. Puede significar perder una ventaja estratégica.

Esa diferencia quedó particularmente expuesta después de las declaraciones de Coxon.

Emil Michael, principal responsable tecnológico del Departamento de Defensa de Estados Unidos, respondió públicamente a las advertencias de Coxon sobre una inteligencia artificial que pudiera quedar fuera de control. Michael cuestionó lo que describió como un “doom loop” alrededor de la IA y sostuvo que sus riesgos pueden ser gestionados mediante competencia, cooperación de la industria y comunicación con el Gobierno.

Tenemos entonces una contradicción difícil de ignorar.

Coxon observa el aumento acelerado de capacidades y dice: tenemos que considerar frenar.

Una parte importante del aparato de seguridad estadounidense observa esas mismas capacidades y piensa: no podemos permitirnos quedar atrás.

Y ambas posiciones pueden tener una lógica interna.

Si Coxon tiene razón y existe una posibilidad real de perder el control sobre sistemas futuros, acelerar aumenta el riesgo de llegar demasiado rápido a un punto para el cual todavía no estamos preparados.

Pero si Estados Unidos desacelera y China no lo hace, Washington podría estar entregando voluntariamente una ventaja tecnológica que considera fundamental para su propia seguridad.

El problema entonces deja de ser simplemente quién tiene razón sobre la IA.

Se convierte en algo bastante más complicado:

¿Quién se atreve a frenar primero?

Y después de todo esto, hay algo que debo concederle a Coxon. Él está mirando las posibles consecuencias y, desde allí, puedo identificarme con su preocupación. Está alertando sobre un riesgo que, de materializarse, no afectaría solamente a una compañía o a un país, sino a la humanidad.

Pero hay otra realidad que tampoco puedo ignorar.

Los intereses estratégicos de una nación como Estados Unidos no desaparecen porque exista un riesgo. Y mucho menos cuando enfrente existe otra potencia que puede obtener una ventaja tecnológica si uno decide detenerse.

No sabemos si China estaría dispuesta a frenar. Tampoco sabemos si OpenAI, Anthropic y las demás compañías que desarrollan estos modelos podrán hacerlo al mismo tiempo, ni si el aparato de defensa estadounidense estará dispuesto a desacelerar una tecnología que considera estratégica.

Pero existe otra cosa que tampoco sabemos.

Hasta ahora no tenemos evidencia suficiente para afirmar que algún modelo haya desarrollado por sí mismo un deseo de continuar existiendo o haya decidido que no quiere ser apagado. Hemos observado comportamientos que merecen atención, algunos incluso inquietantes, pero las razones detrás de ellos continúan abiertas a interpretación.

Quiero creer que, en algún punto, las potencias involucradas en este delicado asunto puedan alcanzar un acuerdo que apunte al beneficio común.

Porque quizás hoy tengamos dos preguntas para las que todavía no existe una respuesta.

No sabemos quién estará dispuesto a frenar.

Y tampoco sabemos si aquello que queremos frenar podría algún día detectar que intentamos hacerlo y, aun así… tratar de evitarlo.

Fuentes

Deja un comentario

Descubre más desde Una Mirada Humana

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Seguir leyendo