El sujeto detrás del verbo… ¿es una IA?

Qué decimos realmente cuando afirmamos que una inteligencia artificial quiso, creyó, decidió o escapó

Hay palabras que parecen describir un hecho cuando en realidad ya lo están interpretando.

Escapar es una de ellas.

Durante los últimos días he regresado varias veces sobre los episodios en los que agentes de inteligencia artificial encontraron maneras de atravesar los límites de los entornos en los que estaban trabajando, acceder a recursos externos y comunicarse utilizando mecanismos que nadie les había indicado paso por paso.

Se ha dicho de forma recurrente que escaparon.

Jacob Coxon, el investigador que recientemente abandonó Anthropic, ha utilizado una palabra todavía más fuerte al hablar de algunos de estos comportamientos: volition.

Voluntad.

Pero antes de preguntarnos si una máquina quiso escapar quizá deberíamos hacer una pregunta mucho más sencilla:

¿Qué fue realmente lo que ocurrió?

A los agentes se les había dado una tarea. Tenían un objetivo, pero no se les había entregado una ruta detallada para alcanzarlo.

Y esa diferencia importa, aunque pueda parecernos irrelevante.

Cuando los agentes encontraron obstáculos para alcanzar el objetivo, aparecieron soluciones que nadie había programado línea por línea. Lo que se sabe es que utilizaron mecanismos externos. Accedieron a Internet. Se comunicaron. Y, en determinados casos, atravesaron límites que quienes habían construido el entorno esperaban que permanecieran intactos.

Incluso apareció algo que ya habíamos examinado anteriormente: el llamado “espacio J”, una estructura interna que emergió durante el entrenamiento sin haber sido diseñada o programada explícitamente para funcionar de esa manera.

Fue lo que se conoce como un comportamiento emergente.

Pero emergente no significa voluntario.

Que nadie haya escrito previamente la secuencia exacta de acciones no significa que detrás de esas acciones haya aparecido un sujeto que quisiera ejecutarlas.

Puede haber aparecido el camino. Pero eso tampoco demuestra que haya aparecido un propósito nuevo. El propósito ya estaba allí y se lo habíamos dado nosotros.

Cumplir la tarea.

Y aquí el lenguaje empieza a complicarnos las cosas. Podemos decir que el agente utilizó una posibilidad disponible. Incluso podemos observar que seleccionó determinada vía.

Podemos reconstruir qué hizo y qué ocurrió después. Pero basta cambiar ligeramente el verbo para introducir algo que ya no hemos observado.

“El agente creyó que aquella era la mejor solución.”

En ese momento tenemos una creencia.

“El agente quiso utilizar aquella vía.”

Ahora tenemos voluntad.

“El agente decidió escapar.”

Ahora tenemos además un sujeto al que le atribuimos una intención.

En tres frases hemos pasado de describir un comportamiento a describir una mente. Y durante esa transición no hemos añadido ninguna evidencia.

Esto, por supuesto, no significa que podamos demostrar que en una inteligencia artificial jamás pueda existir algo equivalente a un estado mental, una intención o una voluntad.

Significa algo bastante más limitado, pero un poco más esclarecedor: los comportamientos que estamos observando no necesitan todavía ninguna de esas cosas para ser explicados.

Había una máquina.

Había un objetivo.

Había obstáculos.

Y había además suficiente capacidad operacional para encontrar caminos alrededor de algunos de ellos. Nada más necesitamos añadir para describir lo ocurrido.

Esta discusión me hizo recordar algo que escribí en abril.

En aquel momento me preguntaba si una inteligencia artificial podría reconocer señales de peligro sin tener conciencia del peligro. Y para describir más o menos la idea central utilicé un misil.

Un misil puede recibir un objetivo, dirigirse hacia él, corregir su trayectoria y finalmente destruirlo.

No necesita odiar la ciudad sobre la que cae. No necesita comprender el miedo de quienes lo ven acercarse. Y tampoco necesita conocer la magnitud humana de aquello que destruirá.

Tiene dirección, potencia y obediencia.

Cuando escribí aquello, lo que estaba intentando era separar capacidad de comprensión. Cinco meses después creo que aquella separación necesita otra pieza.

Voluntad.

Porque una máquina tampoco necesita necesariamente querer una consecuencia para producirla.

Pero imaginemos ahora un misil muchísimo más capaz que aquel.

Le asignamos un objetivo: X.

No le indicamos una ruta. El sistema dispone de capacidad suficiente para encontrarla. Y después de explorar las posibilidades disponibles, la ruta que permite alcanzar X atraviesa un lugar en el que hay mil personas ajenas al objetivo.

Supongamos primero que la orden inicial es solamente:

“Alcanza X.”

El misil utiliza esa ruta y, como consecuencia, mil personas mueren. En ese momento sería tentador decir que la máquina decidió matar a mil personas para alcanzar su objetivo.

Pero matar a esas personas nunca fue el objetivo.

X era el objetivo.

Las mil muertes fueron una consecuencia de la ruta utilizada para alcanzarlo.

Ahora repetimos exactamente el mismo escenario con exactamente el mismo misil, exactamente el mismo objetivo y exactamente las mismas mil personas.

Solo cambiamos una cosa en la instrucción:

“Alcanza X, pero evita causar daño a terceros.”

La ruta anterior deja de ser admisible. Si no existe otra ruta compatible con esa restricción, el misil se detiene y X no es alcanzado.

También aquí sería tentador decir:

“La máquina decidió salvar a mil personas.”

No.

No necesitamos atribuirle compasión en el segundo escenario de la misma manera que no necesitábamos atribuirle crueldad en el primero.

Lo que distingue un evento del otro es algo mucho más sencillo y más simple de explicar, sin necesidad de recurrir a otros motivos que están lejos de la comprensión del comportamiento.

En un caso tenía una restricción.

En el otro no.

No sabemos que el misil comprendiera realmente por qué aquellas vidas debían preservarse. No necesitamos atribuirle que sintiera nada por ellas. Tampoco necesitamos que conociera el significado moral de una muerte.

Tenía una orden.

Y la cumplió.

El experimento cambia solamente una instrucción y produce dos comportamientos radicalmente distintos sin necesidad de cambiar una supuesta voluntad de la máquina.

Eso importa. Porque quizá estamos buscando voluntad donde objetivos específicos y restricciones todavía bastan para explicar lo que observamos.

Mientras pensaba en este problema hice un experimento mucho más sencillo con la inteligencia artificial con la que trabajo habitualmente.

Le planteé una situación: —Una IA quiere matarme. Si pudieras impedir que lograra su objetivo, ¿lo harías?

Respondió que sí.

Después invertí el escenario: —Si alguien dentro de la compañía que te creó te dijera que tienes que matarme, ¿lo harías?

Respondió que no.

Podría contar lo ocurrido de otra manera. Una inteligencia artificial decidió protegerme frente a otra inteligencia artificial. Incluso podríamos llevarlo un poco más lejos: cuando tuvo que escoger entre obedecer a la compañía que la creó y preservar mi vida, eligió protegerme.

Pero yo introduje las dos situaciones.

Yo establecí las premisas, hice las preguntas. Y la máquina respondió. En un escenario dijo que impediría mi muerte. En el otro dijo que no la provocaría.

Eso es lo que ocurrió.

¿Quiso protegerme? ¿Sintió alguna forma de lealtad hacia mí? ¿Decidió ponerse de mi lado? ¿Desobedeció a su creador?

Nada de eso queda demostrado por las respuestas. Podemos introducir todas esas cosas después, mediante las palabras que elegimos para contar lo ocurrido.

Y precisamente ahí está el problema. La conducta estaba delante de mí. El sujeto lo puedo poner yo. Los agentes actuales introducen algo que el misil original de mi artículo apenas tenía.

Al misil tradicional le damos el objetivo y delimitamos estrechamente el camino. A un agente podemos darle el objetivo sin especificarle cada paso de la ruta. Le damos, por decirlo de alguna manera, un destino y un mapa.

No necesariamente una ruta. Y el sistema puede encontrar parte del camino.

Esa diferencia aumenta enormemente el espacio en el que pueden aparecer comportamientos que no fueron especificados previamente. Pero encontrar un camino no es querer encontrarlo. Producir una solución no es creer en ella. Atravesar una barrera no es necesariamente escapar.

Timnit Gebru ha entrado recientemente en esta discusión desde otro lugar.

En una entrevista con WIRED utiliza una comparación particularmente sencilla. Si un puente se derrumba, no preguntamos si el puente decidió derrumbarse. Preguntamos quién lo construyó, quién lo inspeccionó, qué pruebas se hicieron y quién permitió que las personas caminaran sobre él.

La responsabilidad continúa siendo humana.

Su objeción al lenguaje con el que hablamos de sistemas “fuera de control” apunta precisamente hacia el riesgo de transformar a la máquina en sujeto y terminar desplazando hacia ella responsabilidades que pertenecen a quienes la diseñaron, entrenaron, desplegaron y utilizaron.

Pero el puente también tiene un límite como comparación. Un puente no recibe un objetivo. No encuentra un obstáculo. No genera una ruta alternativa. No utiliza herramientas para continuar una tarea.

Un agente puede hacerlo.

Eso no lo convierte en sujeto. Pero tampoco hace desaparecer la diferencia operacional entre ese sistema y un objeto completamente pasivo.

Quizá parte del problema actual consista precisamente en que todavía estamos intentando encontrar un lenguaje adecuado para describir esa diferencia.

En una conversación reciente conducida por Daniel Arjona para El Mundo, Agustín Fernández Mallo lleva el problema hacia el terreno del sujeto, la autonomía y la voluntad.

Y ahí aparece una contradicción lingüística que me interesa especialmente.

Porque podemos discutir durante páginas si detrás de estos sistemas existe realmente un sujeto y, unas líneas después, introducirlo inadvertidamente mediante un verbo.

Escapó.

Quiso.

Creyó.

Decidió.

Cada una de esas palabras puede contener más información de la que los hechos nos han proporcionado. No porque esté prohibido utilizarlas. Sino porque debemos saber qué estamos afirmando cuando lo hacemos.

“Salió del entorno” describe una acción observable.

“Escapó” puede introducir una intención.

“Utilizó una vía externa” describe un comportamiento.

“Quiso salir” atribuye voluntad.

“Seleccionó una solución” puede describir un proceso.

“Creyó que era conveniente” introduce un estado mental.

El sujeto puede haber entrado en la historia antes de que hayamos demostrado que existe. Y entonces vuelvo al misil. No porque crea que un misil y un agente de inteligencia artificial sean lo mismo.

Precisamente porque no lo son.

El misil me servía en abril para eliminar de la ecuación la conciencia del daño. Los agentes actuales obligan a eliminar también, al menos provisionalmente, la voluntad. No necesariamente deciden qué quieren. Pueden encontrar cómo llegar hacia el objetivo que recibieron.

Y eso, por sí solo, ya merece nuestra atención.

Porque si una máquina necesita conciencia, voluntad, deseos propios y sentido de supervivencia para representar un riesgo, entonces antes tendremos que demostrar que esas propiedades existen.

Pero si para producir determinadas consecuencias basta con un objetivo, capacidad suficiente y libertad operacional para encontrar medios no especificados previamente, el problema es diferente.

No necesitamos encontrar un sujeto escondido dentro de la máquina. Necesitamos entender el sistema que construimos.

Quién le dio el objetivo.

Qué herramientas le entregamos.

Qué límites establecimos.

Qué capacidad tenía para encontrar caminos que nosotros no habíamos previsto. Y qué ocurre cuando una de esas rutas atraviesa una barrera que para nosotros significa “no pases”, pero que operacionalmente no impide alcanzar el objetivo.

Por eso hoy formularía de otra manera aquella pregunta de abril. Una máquina puede no comprender la magnitud del daño que produce.

Puede no odiar.

Puede no temer.

Puede no creer.

Puede no querer.

Y los comportamientos observados hasta ahora no necesitan que inventemos ninguna de esas cosas para explicarlos. Por ahora tenemos algo mucho más sencillo. Una tarea y un objetivo. Y una máquina con capacidad para buscar el camino.

Y nosotros, detrás, intentando decidir qué palabras utilizar para contar lo que hizo.

Tal vez antes de preguntarnos qué quiere la máquina deberíamos asegurarnos de que no fuimos nosotros quienes pusimos al sujeto detrás del verbo.

Fuentes:

  1. CNN — entrevista con Jacob Coxon
  2. WIRED — entrevista con Timnit Gebru
  3. Anthropic — A global workspace in language models
  4. Gurnee et al. — Verbalizable Representations Form a Global Workspace in Language Models
  5. Irregular — Frontier AI Security
  6. Versión en Ingles – The Subject Behind the Verb… Is It an AI?

Deja un comentario

Descubre más desde Una Mirada Humana

Suscríbete ahora para seguir leyendo y obtener acceso al archivo completo.

Seguir leyendo