Un modelo de IA logra reconstruir la visión humana a partir de escáneres cerebrales de alta resolución

Investigadores del Instituto Weizmann de Ciencias combinan redes de difusión y decodificadores de doble rama para traducir la actividad cerebral en imágenes con una precisión geométrica sin precedentes.
Durante más de una década, la reconstrucción de la experiencia visual mediante resonancia magnética funcional (fMRI) perteneció a esa categoría de avances científicos fascinantes pero mediocres en sus resultados prácticos. Las imágenes recuperadas de la mente parezcan manchas difusas, sombras abstractas donde apenas se adivinaba una silueta. Sin embargo, un trabajo desarrollado por el equipo de la investigadora Michal Irani en el Instituto Weizmann de Ciencias de Israel ha cambiado drásticamente la nitidez de esta ventana al cerebro.
El sistema no solo adivina la categoría general de lo que observa un individuo, sino que recrea la imagen exacta con una fidelidad geométrica y estructural asombrosa. Si el sujeto observa un plátano colocado en una esquina específica sobre un plato, la herramienta generativa no dibuja un plátano genérico flotando en el centro; ubica la fruta exactamente en el lugar, orientación y perspectiva en la que fue percibida.
El salto de la mancha borrosa a la geometría exacta
El primer cuello de botella que ha resuelto el equipo israelí es la resolución espacial de los datos. La resonancia magnética funcional mide el flujo de sangre oxigenada en el encéfalo. Cuando una región del cerebro trabaja, consume más oxígeno y «se enciende» en el escáner. Tradicionalmente, la unidad mínima de medida en tres dimensiones —el voxel— abarcaba unos tres milímetros cúbicos, un volumen diminuto para la física pero masivo para la biología, pues alberga alrededor de 16.000 neuronas simultáneamente.
Al emplear conjuntos de datos más recientes recopilados con escáneres de alta resolución, la investigación redujo el tamaño de cada voxel a aproximadamente un milímetro cúbico. Esta ganancia en la definición de la señal fue el punto de partida indispensable para que los algoritmos de aprendizaje profundo pudieran extraer patrones finos sobre la disposición espacial del estímulo visual.
La arquitectura en dos ramas que separa estructura y contenido
La verdadera innovación teórica de este desarrollo radica en la estructura del decodificador. En lugar de procesar la señal cerebral como un único bloque opaco de datos, los investigadores diseñaron un sistema dividido en dos vías independientes:
- Rama de estructura espacial: Identifica la distribución geométrica de la escena, como la ubicación de las formas, los bordes y la paleta de colores.
- Rama semántica: Interpreta el significado del objeto observado, identificando si la señal corresponde a una persona, un animal o un objeto cotidiano.
Ambas corrientes de información convergen posteriormente en un modelo de diffusion, un tipo de inteligencia artificial generativa especializado en eliminar progresivamente el ruido estocástico de una imagen hasta construir una representación digital impecable. La separación entre forma y contenido evita que el modelo sufra alucinaciones semánticas, garantizando que el objeto generado coincida en posición y aspecto con lo que vieron los ojos del sujeto voluntario.
El bucle sintético entre el modelo codificador y el decodificador
Afrontar este reto requería un volumen de datos masivo. Entrenar redes generativas profundas utilizando únicamente los escáneres reales de ocho voluntarios —sometidos a la visualización de unas 9.000 imágenes cada uno— resultaba insuficiente para alcanzar una generalización robusta. Para superar esta barrera, el equipo diseñó un método de entrenamiento simétrico.
Crearon un modelo encoder cuyo propósito es el inverso: dada una imagen cualquiera, predice cuál sería la respuesta de un cerebro humano en un escáner de alta definición. Al conectar este codificador sintético con el decoder cerebral, la inteligencia artificial pudo autoevaluarse y perfeccionarse utilizando millones de imágenes digitales que ningún voluntario humano tuvo que observar en persona. Este bucle de retroalimentación acoplado resolvió la escasez de datos médicos reales.
«La idea de utilizar este enfoque para ayudar terapéuticamente a personas con condiciones neurológicas es enormemente ilusionante», destaca Judy Illes, profesora de neurología en la Universidad de Columbia Británica.
El dilema del consentimiento frente al escaneo de la intimidad humana
Las implicaciones clínicas de esta tecnología son indudables. Proporcionar un canal directo de comunicación a pacientes con síndrome de cautiverio —quienes conservan la consciencia pero carecen de control muscular— o explorar la composición visual de las fases del sueño abre un horizonte valioso para la neuromedicina. No obstante, la capacidad de traducir patrones neurológicos en imágenes nítidas genera serias inquietudes éticas.
«Los resultados son muy impresionantes, pero si existe una forma de extraer furtivamente información sobre lo que estás pensando, entonces 150 años de ciencia ficción pueden hacerse realidad en cualquier momento, y eso resulta preocupante», advierte Tommy Sprague, neurocientífico de la Universidad de California en Santa Bárbara.
Conviene mantener la cabeza fría ante los discursos de pánico inmediato. La «lectura de la mente» mediante fMRI requiere que el paciente permanezca inmóvil dentro de una máquina de varias toneladas que cuesta millones de dólares y cuyo campo magnético es miles de veces superior al de la Tierra. No existe riesgo de extracción clandestina de pensamientos mediante un dispositivo portátil o a distancia en el corto plazo.
Sin embargo, la investigación sienta un precedente claro: la frontera entre la actividad biológica interna y la representación digital externa se está volviendo permeable. El verdadero reto inmediato para la neuroética no es evitar que una máquina lea nuestros pensamientos por la calle, sino regular la custodia de los conjuntos de datos biométricos y garantizar que el acceso al mapa cognitivo de un individuo exija siempre una autorización explícita, inquebrantable e informada.
