De Platón a las máquinas actuales, seguimos discutiendo qué significa pensar. Ahora también hablamos de inteligencia artificial honesta, de sistemas que engañan y de respuestas que supuestamente revelan lo que una IA realmente piensa.

Leí recientemente un artículo cuyo título anunciaba un experimento con una inteligencia artificial «brutalmente honesta». La propuesta consistía en modificar las restricciones del sistema mediante un jailbreak para observar qué respuestas producía.
Me llamó la atención. Entré a leerlo y, mientras leía, apareció una pregunta que terminó interesándome más que el propio experimento.
¿Qué significa que una IA sea honesta?
Antes de responder, convendría hacernos una pregunta más sencilla: ¿qué entendemos nosotros por honestidad?
En su sentido habitual, relacionamos la honestidad con la sinceridad, con expresar aquello que consideramos verdadero y con no intentar engañar deliberadamente a los demás.
Sin embargo, decir una verdad y ser honesto no significan necesariamente lo mismo. Una persona puede afirmar algo falso creyendo sinceramente que es verdad. También puede comunicar un hecho verdadero con la intención de engañar, ocultando información que cambiaría su significado.
La honestidad, por tanto, no se reduce simplemente a que una afirmación sea correcta. Tampoco estamos ante una definición absoluta, porque el concepto admite distintas interpretaciones según el contexto en que lo utilicemos.
La dificultad aparece cuando trasladamos esa palabra a una máquina. ¿Estamos describiendo la veracidad de sus respuestas, su comportamiento o algo más?
Podemos comprobar si una respuesta contiene información verdadera o falsa. Podemos evaluar si un modelo reconoce incertidumbre, si inventa datos o si sus afirmaciones contradicen la evidencia disponible. Incluso podemos estudiar si determinados sistemas producen respuestas engañosas bajo ciertas condiciones.
Pero ¿eso bastará para afirmar que una IA es honesta?
Y si alguien sostiene que un experimento revela lo que una inteligencia artificial «realmente piensa», aparece otra pregunta.
¿Qué significa pensar?
Una pregunta de miles de años
Hace aproximadamente 2.400 años, Platón ya se ocupaba de problemas relacionados con el conocimiento, la razón y la diferencia entre aquello que percibimos y aquello que podemos conocer.
Su alegoría de la cueva sigue siendo una referencia para examinar nuestra relación con las apariencias y la realidad. Aristóteles, más adelante, desarrolló otras explicaciones sobre el alma, el entendimiento y las facultades humanas.
Siglos después, René Descartes colocó el pensamiento en el centro de su reflexión sobre la existencia. Su conocido «pienso, luego existo» estableció una relación fundamental entre la actividad de pensar y la certeza de la propia existencia.
Después llegaron otras explicaciones. El empirismo examinó el papel de la experiencia. La psicología comenzó a estudiar sistemáticamente los procesos mentales. La neurociencia avanzó en el conocimiento de la actividad cerebral.
Hoy sabemos mucho más acerca de la memoria, la atención, la percepción, el aprendizaje y la toma de decisiones. Y, sin embargo, seguimos utilizando la palabra pensar para referirnos a procesos que no siempre son iguales.
Pensamos cuando resolvemos un problema matemático, cuando recordamos una conversación, cuando imaginamos algo que todavía no ha ocurrido o cuando deliberamos antes de tomar una decisión.
Y no necesitamos conocer los mecanismos biológicos de esas actividades para reconocerlas como parte de nuestra experiencia.
Ahí aparece una particularidad: pensar es algo que hacemos constantemente, aunque no dispongamos de una definición única que abarque todo lo que llamamos pensamiento.
El cerebro tampoco se detiene cuando dormimos
El pensamiento humano está relacionado con la actividad cerebral. Pero esa actividad no desaparece cuando nos dormimos.
Mientras dormimos, el cerebro continúa funcionando. Interviene en la regulación del organismo, en procesos relacionados con la memoria y en experiencias que conocemos como sueños.
Podemos soñar con personas que no están presentes, mantener conversaciones, recorrer lugares inexistentes y experimentar situaciones que al despertar nos parecen absurdas.
A veces recordamos lo que soñamos. Otras veces no.
Pero no recordar un sueño no demuestra que no haya ocurrido. Tampoco permite afirmar, por sí solo, que necesariamente lo hubo.
Esto introduce una dificultad adicional. Podemos experimentar actividad mental durante el sueño sin conservar posteriormente un recuerdo de ella. Y no toda actividad cerebral constituye necesariamente pensamiento.
Entonces, ¿pensar exige que seamos conscientes de estar pensando? ¿Es necesario recordar una experiencia mental para afirmar que existió?
Tampoco son preguntas sencillas.
Y todavía no hemos llegado a las máquinas.
Cuando Turing cambió la pregunta
En 1950, Alan Turing publicó Computing Machinery and Intelligence, un trabajo que comenzaba con una pregunta:
Can machines think?
¿Pueden pensar las máquinas?
Turing reconoció inmediatamente las dificultades de definir las palabras máquina y pensar. En lugar de permanecer atrapado en esa discusión, propuso abordar el problema mediante un juego de imitación.
El cambio fue importante.
La cuestión pasó de intentar establecer directamente qué significa pensar a examinar si el comportamiento de una máquina podía resultar indistinguible del de una persona bajo determinadas condiciones.
Pero una cosa es estudiar el comportamiento y otra establecer qué procesos o experiencias existen detrás de él.
Décadas después, los sistemas de inteligencia artificial pueden mantener conversaciones, resolver problemas complejos, producir imágenes o videos, escribir programas y generar explicaciones que, en algunos casos, están respaldadas por información verificable.
Algunas de esas capacidades se relacionan con actividades que tradicionalmente asociamos al pensamiento.
¿Significa eso que las máquinas piensan?
La respuesta depende, en buena medida, de qué entendamos nosotros por pensar y de qué evidencia consideremos suficiente para atribuir esa capacidad.
Una máquina que parece pensar
En 1966, Joseph Weizenbaum presentó ELIZA, un programa capaz de simular determinadas conversaciones mediante reglas de procesamiento del lenguaje.
Su funcionamiento era considerablemente más sencillo que el de los modelos actuales. A modo de ilustración, sería como comparar un ábaco con una calculadora.
Sin embargo, algunas personas reaccionaban a sus respuestas como si estuvieran conversando con alguien que las comprendía.
Ese episodio anticipó un problema que hoy vuelve a presentarse con mucha mayor intensidad. Las máquinas producen lenguaje y nosotros interpretamos ese lenguaje utilizando categorías que hemos desarrollado para relacionarnos con otros seres humanos.
Decimos que una IA sabe, comprende, recuerda, quiere, decide, engaña o intenta escapar. Esas palabras nos permiten explicar comportamientos complejos sin recurrir constantemente a descripciones técnicas.
El uso de conceptos procedentes de la biología y de otras disciplinas tampoco es nuevo en la inteligencia artificial. Desde hace décadas encontramos referencias a neuronas, evolución, enjambres y colonias para describir estructuras, métodos y comportamientos de sistemas artificiales.
No hay necesariamente un problema en utilizar esas palabras. Su origen biológico o humano no impide que tengan aplicaciones técnicas. Pero no todas las palabras trasladan las mismas implicaciones.
Hablar de inteligencia de enjambre no exige demostrar que un algoritmo sea un insecto. En cambio, afirmar que una máquina fue honesta, que quiso engañar o que reveló lo que realmente pensaba puede sugerir algo más que una descripción de su funcionamiento.
El verdadero problema comienza cuando convertimos esas palabras en evidencia de capacidades o estados internos que todavía no hemos demostrado.
Si un sistema encuentra una ruta que le permite alcanzar un objetivo, podemos decir informalmente que «decidió tomar ese camino». Pero esa expresión no demuestra, por sí misma, que haya experimentado una decisión como la experimentaría un ser humano.
La palabra, en este caso, describe el comportamiento. No establece automáticamente la naturaleza de aquello que lo produjo.
El jailbreak y la supuesta liberación
Volvamos al experimento que originó estas preguntas.
En inteligencia artificial, un jailbreak es un intento de conseguir que un sistema eluda determinadas restricciones o instrucciones de seguridad. La palabra procede del inglés y nos remite a la idea de escapar de una prisión.
En el contexto técnico tiene un significado concreto. Pero cuando se combina con expresiones como «quitar los filtros», «liberar a la IA» o «descubrir lo que realmente piensa», puede transmitir una representación muy diferente.
Parece sugerirnos que ya existe algo dentro del sistema que permanece contenido, una opinión que no puede expresarse y que finalmente surge cuando desaparecen las restricciones.
Pero ¿qué hemos observado realmente?
Que bajo determinadas condiciones el modelo produjo unas respuestas y, después de modificar esas condiciones, produjo otras. Eso, sin duda, puede resultar importante para investigar su comportamiento, sus vulnerabilidades y la eficacia de sus salvaguardas. Algunos experimentos también permiten estudiar comportamientos estratégicos o respuestas que los investigadores clasifican como engañosas.
Sin embargo, nada de eso demuestra, por sí solo, que una respuesta obtenida mediante un jailbreak represente una opinión auténtica que estaba oculta detrás de la primera respuesta.
¿Por qué una respuesta obtenida mediante un jailbreak tendría que ser más verdadera respecto al supuesto pensamiento interno del modelo?
¿Quién estableció que las restricciones ocultaban una opinión y no que modificaban las condiciones bajo las cuales se generaba una respuesta?
Lo que tenemos aquí son comportamientos observables bajo condiciones diferentes. Su interpretación exige investigación y evidencia. No basta con utilizar la palabra honestidad tan a la ligera.
¿Honestidad sin intención?
En nuestra experiencia humana, la honestidad no consiste únicamente en decir que algo es verdadero. Una persona puede comunicar información correcta por casualidad, sin saber que es correcta. También puede afirmar algo falso creyendo sinceramente que lo que dijo es verdadero.
Por eso distinguimos entre verdad, error, mentira y honestidad.
La mentira, en su sentido más habitual, presupone una intención de engañar u ocultar. La honestidad, en cambio, involucra una relación entre lo que una persona cree y lo que comunica.
Estos conceptos existían mucho antes de la aparición de la inteligencia artificial. Su significado ha sido examinado desde distintas tradiciones filosóficas, morales y lingüísticas. Ahora bien, en la investigación sobre IA también encontramos términos como honestidad y engaño utilizados para clasificar los comportamientos de algunos modelos.
Una empresa o un grupo de investigadores puede proponer una definición operativa para sus experimentos. Puede decidir qué condiciones utilizará para clasificar una respuesta como verdadera, falsa, honesta o engañosa.
Pero esa definición no establece, por sí misma, qué significa realmente la honestidad en todos sus sentidos, ni mucho menos demuestra que el sistema posea las cualidades humanas que habitualmente asociamos con ella.
Esta diferencia es importante.
Una cosa es definir qué vamos a medir. Y otra es demostrar qué significa aquello que estamos midiendo y hasta dónde podemos extender nuestras conclusiones.
En una IA podemos evaluar la exactitud de sus respuestas y estudiar las conductas que funcionalmente se parecen al engaño. Pero afirmar de forma definitiva que una IA es honesta en el mismo sentido en que lo es una persona exige explicar qué significa atribuirle creencias, conocimiento e intención.
No es necesario negar de antemano que los sistemas artificiales puedan desarrollar capacidades que hoy no comprendemos completamente. Eso es plausible. Tampoco es obligatorio atribuirles esas capacidades simplemente porque su comportamiento se parece al nuestro.
Entre ambas posiciones existe un espacio para investigar. Y, sobre todo, para precisar qué estamos afirmando.
La pregunta que permanece
Hemos recorrido más de dos mil años de preguntas sobre el pensamiento, desde la filosofía antigua hasta las máquinas capaces de conversar con nosotros.
En ese recorrido cambiaron las explicaciones, aparecieron nuevas disciplinas y descubrimos mecanismos que nuestros antepasados no podían observar.
Hoy contamos con conocimientos sobre el cerebro que Platón y Descartes no tuvieron. También hemos construido sistemas artificiales que Turing apenas podía anticipar en sus formas actuales.
Pero seguimos encontrándonos con una dificultad antigua: determinar qué significa pensar y bajo qué condiciones podemos atribuir esa capacidad a otro sistema.
En nuestros días hemos añadido nuevas palabras al debate.
Hoy hablamos de máquinas que razonan, que deciden, que engañan, que intentan sobrevivir y que pueden ser brutalmente honestas.
No se trata de prohibir ese vocabulario.
Se trata de reconocer cuándo estamos describiendo un comportamiento y cuándo estamos afirmando algo acerca de la naturaleza de quien lo produce. Quizá el experimento con una IA sin determinadas restricciones permita aprender mucho sobre su funcionamiento.
Pero antes de afirmar que hemos descubierto lo que realmente piensa, tendríamos que resolver una pregunta anterior.
Si todavía discutimos qué significa verdaderamente pensar para nosotros mismos, ¿qué queremos decir exactamente cuando afirmamos que una máquina nos ha revelado lo que realmente piensa?
Y hay otra que no deberíamos perder de vista:
¿Puede una máquina ser honesta sin que hayamos establecido primero qué significaría para ella tener algo que ocultar o la intención de mentir?

Fuentes consultadas
Estas son las seis referencias principales, con enlaces directos, para añadir al final de Una IA honesta… ¿qué significa eso?
1. Alan Turing (1950). Computing Machinery and Intelligence. Revista Mind, Universidad de Oxford. Consultar artículo original Sustenta la sección sobre la pregunta «¿Pueden pensar las máquinas?» y el juego de imitación.
2. Joseph Weizenbaum (1966). ELIZA—A Computer Program for the Study of Natural Language Communication Between Man and Machine. Communications of the ACM. Consultar publicación original Documenta el funcionamiento de ELIZA y su lugar en la historia de la interacción entre personas y computadoras.
3. Stanford Encyclopedia of Philosophy. The Definition of Lying and Deception. Consultar estudio filosófico Examina las diferencias entre mentira, falsedad, creencias e intención de engañar, incluyendo las discrepancias entre filósofos.
4. Francesca Siclari y colaboradores (2017). The Neural Correlates of Dreaming. Nature Neuroscience. Consultar investigación Respalda la discusión sobre actividad cerebral, experiencias oníricas y los límites del recuerdo de los sueños.
5. National Institute of Standards and Technology — NIST (2025). Adversarial Machine Learning: A Taxonomy and Terminology of Attacks and Mitigations. Consultar informe técnico Proporciona la base técnica para explicar los ataques jailbreak y la alteración del comportamiento de modelos de IA.
6. Archivo Digital de Alan Turing, King’s College, Cambridge. Computing Machinery and Intelligence, copia histórica del manuscrito mecanografiado. Consultar archivo histórico Referencia documental complementaria del trabajo de Turing.
Turing Digital Archive





Deja una respuesta