Causal probes mejoran 17‑118 % la manipulación de conceptos en LLMs y pierden solo 3 % en detección
Un estudio reciente muestra que la capacidad, responsividad y alineación de estructuras latentes determinan su efectividad causal, y que los llamados causal probes pueden potenciar la dirección de conceptos en grandes modelos de lenguaje con una pérdida mínima en detección.




