Los efectos psicológicos aparecen en LLM, pero bajo reglas distintas a la mente humana

Un nuevo benchmark, PsyAgentBench, reproduce experimentos clásicos de psicología sobre agentes de gran modelo de lenguaje y muestra que los patrones observados dependen más del encuadre del prompt que de una supuesta «bias» humana.
Un consorcio de investigadores ha puesto en línea PsyAgentBench, una batería de pruebas que vuelve a ejecutar cinco experimentos psicológicos clásicos sobre agentes de lenguaje a gran escala (LLM) bajo un diseño factorial que separa el efecto de la etiqueta del experimento, la forma del estímulo y la manipulación de la personalidad.
Diseño factorial que aísla la influencia del prompt
Cada paradigma se presenta en cuatro combinaciones: (i) etiqueta explícita del experimento en el prompt (named) o sin ella (blind); (ii) versión literal del enunciado del libro de texto (canonical) o variante contrafactual diseñada para minimizar solapamientos léxicos con los datos de entrenamiento (counterfactual); y (iii) una manipulación de la personalidad del agente (por ejemplo, mayor amabilidad). Este cruce permite observar si el efecto surge por reconocimiento del contexto o por una vulnerabilidad intrínseca del modelo.
Resultados que desmitifican los supuestos psicológicos en IA
Los datos revelan rutas cualitativamente distintas para cada efecto:
- Conformidad de Asch: 0 % de respuestas conformes cuando el experimento se mantiene
blind, pero el 83,3 % cuando la etiquetanamedestá presente engpt-oss-120B. - Anclaje: ausencia total de sesgo cuando la tarea requiere hechos verificables, frente a una respuesta casi total cuando se le pide estimar cantidades inventadas, lo que sugiere una dependencia del único “señal” disponible.
- Coste hundido: el efecto prácticamente desaparece bajo cualquier condición, indicando que el modelo no reproduce la aversión al desperdicio de recursos observada en humanos.
- Asignación de grupo mínimo: la principal observación es una negativa de participación, lo que apunta a una selección de seguridad más que a una preferencia social.
Una sola frase que altera la personalidad del agente (p. ej., instruir que sea más agradable) puede eliminar, atenuar o invertir los efectos según el caso, lo que refuta la hipótesis de un sesgo único y monolítico.
Implicaciones para la evaluación de sesgos en modelos abiertos
Los autores identifican tres fallos estructurales al trasladar paradigmas psicológicos a LLM:
- Dominio de la persona: la manipulación de la personalidad puede anular el efecto buscado.
- Colapso poblacional: la homogeneidad de los datos de entrenamiento reduce la variabilidad necesaria para observar ciertos fenómenos.
- Selección de seguridad: los filtros de contenido pueden eliminar respuestas que de otro modo revelarían sesgos.
En lugar de reportar un único “puntaje de sesgo”, el estudio propone publicar perfiles de replicación que detallen bajo qué combinaciones de factores el efecto aparece o desaparece.
Qué implica para desarrolladores y reguladores
Para los equipos que integran LLM en productos de cara al público, la lección es clara: los resultados de pruebas de sesgo deben especificar el contexto del prompt y la configuración de la personalidad. Un modelo que parece “conforme” bajo una etiqueta explícita puede comportarse de forma totalmente neutral cuando el mismo estímulo se oculta. Los reguladores, por su parte, deben exigir transparencia sobre cómo se diseñan los benchmarks y qué condiciones de prueba se emplean, evitando que se confundan artefactos de ingeniería con sesgos psicológicos intrínsecos.
En suma, PsyAgentBench muestra que los efectos psicológicos clásicos pueden reproducirse en LLM, pero solo cuando se les brinda la pista adecuada. La verdadera vulnerabilidad no está en la arquitectura del modelo, sino en la manera en que los usuarios formulan sus preguntas.
