La audaz maniobra de Perplexity para acelerar la IA local en los Mac

La compañía tras el famoso buscador conversacional ha liberado Lily, un motor de inferencia ultraoptimizado en Rust y Metal que prescinde de marcos tradicionales como PyTorch para lograr una velocidad asombrosa en ordenadores Apple.
Durante años, la industria del software nos vendió una promesa cómoda: la abstracción. Construimos capas sobre capas de código para que un mismo programa pudiera ejecutarse en un ordenador portátil, un servidor en la nube o un teléfono móvil sin tocar una sola línea. Sin embargo, en el despiadado terreno de la inteligencia artificial generativa, esa comodidad se ha convertido en una losa insostenible. En la carrera por exprimir cada ciclo de reloj de nuestros procesadores, la elegancia de las herramientas multipropósito está siendo aplastada por la fuerza bruta de la optimización a medida. Y el último movimiento de Perplexity lo demuestra con una rotundidad casi agresiva.
Esta semana, la empresa ha decidido publicar en código abierto Lily, el motor de inferencia local que alimenta la función de procesamiento híbrido en sus aplicaciones para escritorio. Pero no estamos ante otra librería genérica de Python. Lily es un componente escrito directamente en Rust y kernels artesanales de Metal —la API gráfica de bajo nivel de Apple— diseñado exclusivamente con una obsesión enfermiza: ejecutar un único modelo de lenguaje (Qwen3.6-35B-A3B) sobre una única arquitectura de procesadores (Apple Silicon). En el camino, el equipo de desarrollo ha tirado a la basura gigantes como PyTorch o incluso el motor estándar de la manzana, MLX. Sin rodeos, sin intermediarios y sin compasión por la compatibilidad general.
Un motor hiperespecializado que rompe con la ortodoxia de la industria
Para entender el mérito técnico —y el mensaje provocador— detrás de este lanzamiento del que se ha hecho eco la prensa especializada en tecnología, primero debemos observar la paradoja de los marcos de desarrollo actuales. Herramientas como PyTorch o TensorFlow son maravillas de la ingeniería, pero están cargadas de compromisos. Tienen que funcionar igual de bien en una GPU corporativa de Nvidia que en un chip modesto de un portátil, lo que deja un margen enorme de rendimiento sobre la mesa.
Lily hace exactamente lo contrario. Se trata de un ejecutable único y ligero donde una capa en Rust gestiona la carga de la red neuronal y la transmisión de respuestas mediante una interfaz compatible con OpenAI, mientras que el cálculo matemático pesado recae sobre código Metal diseñado a mano. Al eliminar cualquier abstracción intermedia, el motor elimina la latencia muerta entre la memoria central y el procesador. ¿El requisito? Un Mac equipado con procesador M-series y al menos 24 o 32 gigabytes de memoria unificada para mover el archivo comprimido a 4 bits, que ocupa unos 19,4 GB de almacenamiento.
Si esto suena a un traje hecho a medida para un cliente de lujo, es porque lo es. Perplexity no ha buscado crear una herramienta universal con la que la comunidad pueda experimentar con cualquier modelo del mercado; ha diseñado una pieza de orfebrería de software pensada para exprimir hasta la última gota de los MacBook Pro más potentes del mercado actual.
¿Ingeniería genial o una trampa de rendimiento a medida?
La pregunta inevitable es: ¿realmente merece la pena romper con todos los estándares solo por un modelo concreto? Los números publicados por el equipo de desarrollo son difíciles de ignorar. El modelo en cuestión, Qwen3.6-35B-A3B, utiliza una arquitectura de mezcla de expertos (Mixture of Experts o MoE) que cuenta con 35.000 millones de parámetros en total, pero solo activa unos 3.000 millones por cada palabra generada. Además, combina capas de atención tradicional con redes de recurrencia de tamaño fijo (Gated DeltaNet).
Administrar una estructura tan compleja en tiempo real suele causar un cuello de botella atroz en la CPU cuando esta intenta organizar qué partes de la GPU deben activarse en cada instante. Para solucionar esto, los ingenieros de Lily tomaron decisiones drásticas:
- Descompresión al vuelo en memoria rápida: Los pesos comprimidos del modelo se descomprimen directamente en la memoria ultrarrápida del grupo de hilos de la GPU (threadgroup memory), incrementando la velocidad de lectura inicial (prefill) en un impactante 77,4%.
- Enrutamiento 100% interno en la GPU: Eliminaron por completo las llamadas de sincronización con la CPU durante las capas de expertos. Todo el cálculo de rutas se resuelve dentro de la propia tarjeta gráfica, aportando un salto de rendimiento del 89% adicional.
- Micro-optimizaciones de registro: Reescribieron los algoritmos de barrido para mantener los datos en los registros internos del chip, arañando mejoras de entre el 5% y el 13% en secuencias largas de texto.
Desde una perspectiva puramente técnica, el resultado es fascinante. Es el equivalente a desarmar un coche de carreras, quitarle el aire acondicionado, los asientos traseros y la radio, y afinar el motor únicamente para ganar tiempo en un circuito específico. Sin embargo, como columnista, no puedo evitar ver esto con cierto escepticismo: ¿cuántos recursos de ingeniería estamos dispuestos a quemar en soluciones que quedarán obsoletas en cuanto aparezca un modelo con una arquitectura ligeramente distinta?
El marketing del código abierto en la era del hardware unificado
No nos engañemos. La decisión de Perplexity de liberar el código fuente en su repositorio de GitHub no es solo un regalo altruista a la comunidad hacker. Es una maniobra estratégica de posicionamiento de marca. En un momento donde las grandes tecnológicas compiten por el control de la inferencia local —el procesamiento de IA dentro de tu propio dispositivo sin enviar datos a servidores externos—, demostrar que puedes superar en velocidad al propio marco MLX de Apple es un golpe sobre la mesa.
Esta jugada beneficia claramente a dos actores: a Perplexity, que refuerza su narrativa de innovación y atrae a talento técnico de primer nivel, y a la propia Apple, que ve cómo sus ordenadores de gama alta se consolidan como las máquinas favoritas de los desarrolladores de IA sin que la compañía de Cupertino tenga que mover un solo dedo.
¿Quiénes pierden aquí? Principalmente los usuarios de ordenadores convencionales o con hardware más modesto, que ven cómo la brecha entre tener un equipo de 3.000 euros con memoria unificada y un portátil estándar se traduce en la diferencia entre ejecutar inteligencia artificial avanzada en local o depender eternamente de suscripciones en la nube.
💡 El panorama general: ¿Cómo nos afecta esto?
El nacimiento de proyectos como Lily marca el comienzo de una nueva era en el software: el fin del monolito y el auge del software desechable hiperespecializado. A medida que las arquitecturas de inteligencia artificial evolucionen a un ritmo frenético, los motores de ejecución genéricos irán cediendo terreno ante capas de código escritas a mano para hardware específico. Esto transforma de manera radical el perfil del profesional tecnológico, desplazando el foco desde la ciencia de datos abstracta hacia la ingeniería de sistemas de bajo nivel y la optimización de memoria física.
Por otro lado, la capacidad de ejecutar modelos masivos de lenguaje con un rendimiento casi instantáneo y de manera totalmente privada en un ordenador personal cambiará las reglas del juego en sectores sensibles como la salud, la abogacía o el periodismo de investigación. La independencia del servidor central ya no es una fantasía libertaria de la red, sino una ventaja operativa real para empresas y profesionales que no pueden permitirse filtrar un solo dato confidencial a la nube de un tercero.
A corto plazo, veremos una batalla feroz de rendimiento entre corporaciones que intentarán convencer a los usuarios de que el verdadero valor está en el hardware que llevan en la mochila. Perplexity ha demostrado que la optimización salvaje puede hacer milagros en un chip Silicon, pero la pregunta abierta sigue siendo la misma: ¿seguirá teniendo valor este código tan exquisitamente elaborado cuando la semana que viene aparezca la nueva arquitectura de IA que lo cambie todo?
