RBS-Attention acelera la inferencia de LLMs de contexto extenso y aligera el pre‑relleno
Un nuevo método sin entrenamiento, RBS‑Attention, reduce drásticamente el coste del pre‑relleno en modelos de lenguaje de gran contexto, logrando hasta 20× de aceleración en GPUs H100.
Leer Más