Se ha lanzado una nueva versión de llama.cpp, la b10075, con una mejora importante para el backend Hexagon: la incorporación de la operación CLAMP. Esto permite ejecutar modelos con mayor fidelidad en dispositivos que utilizan procesadores Qualcomm, evitando desbordamientos numéricos y mejorando la estabilidad durante la inferencia. Los usuarios que alojen sus propios modelos en este tipo de hardware notarán un rendimiento más fiable y una experiencia más pulida.
Además de este cambio, ya están disponibles los binarios precompilados para todas las plataformas habituales. Pueden descargarse para macOS (tanto Apple Silicon como Intel), Linux en múltiples variantes (CPU, Vulkan, ROCm 7.2, OpenVINO, SYCL), Windows (CPU, CUDA 12 y 13, Vulkan, OpenVINO, SYCL, HIP) y Android arm64. Cabe señalar que las versiones experimentales de macOS con KleidiAI y las compilaciones para openEuler permanecen deshabilitadas en esta entrega, a la espera de futuras actualizaciones.
Se recomienda a los administradores de sistemas que actualicen sus instancias de llama.cpp para beneficiarse de la operación CLAMP y aprovechar las últimas correcciones. Los enlaces de descarga están disponibles en el repositorio oficial de GitHub.



