La nueva versión b10203 de llama.cpp incorpora una mejora significativa para quienes utilizan aceleración SYCL en GPUs Intel: ahora es compatible con la multiplicación de matrices cuantizadas en formato q2_0. Esto significa que los modelos que aprovechan esta cuantización podrán ejecutarse con mayor rendimiento en entornos que dependen de SYCL, lo que se traduce en inferencias más rápidas y un mejor aprovechamiento del hardware. Una actualización puntual pero valiosa para los usuarios que gestionan sus propios servidores y buscan optimizar cada recurso.
llama.cpp lanza la build b10203 con soporte SYCL para multiplicación de matrices q2_0



