La nueva versión de llama.cpp incorpora un kernel FWHT (Transformada Rápida de Walsh-Hadamard) en su backend Metal, optimizando el procesamiento en dispositivos con chips Apple Silicon. Este avance, desarrollado por YiChen Lv y Georgi Gerganov, permite aprovechar mejor las capacidades de la GPU en macOS e iOS, reduciendo los tiempos de inferencia en modelos de lenguaje.
Además, la versión b10159 ya está disponible para descarga con binarios precompilados para múltiples sistemas operativos: macOS (Apple Silicon e Intel), iOS, Linux (incluyendo Ubuntu con aceleración Vulkan, ROCm 7.2, OpenVINO y SYCL), Windows (con soporte para CPU, CUDA 12 y 13, Vulkan, OpenVINO, SYCL e HIP) y Android. Cabe señalar que las compilaciones con KleidiAI en macOS y algunas variantes para openEuler han sido deshabilitadas temporalmente. Para más información, visita el sitio web https://llama.app.



