Llama.cpp lanza la versión b10189 con optimización del grafo M3 y binarios para múltiples plataformas

imagem 50

La nueva versión b10189 de llama.cpp incluye una mejora técnica importante: se ha eliminado una operación personalizada de CPU del grafo M3, reemplazándola por operaciones estándar. Este cambio simplifica la arquitectura y puede facilitar el mantenimiento y la compatibilidad futura del motor de inferencia.

Como es habitual, la actualización viene acompañada de binarios precompilados para una amplia variedad de sistemas operativos y aceleradores de hardware. Los usuarios de macOS pueden descargar versiones para Apple Silicon (arm64) y para Intel (x64), aunque la variante con KleidiAI habilitada se encuentra deshabilitada temporalmente. En Linux, hay paquetes para Ubuntu en arquitecturas x64, arm64 y s390x, con soporte para Vulkan, ROCm 7.2, OpenVINO y SYCL (tanto FP32 como FP16). Para Windows, se ofrecen binarios con CPU, CUDA 12 y 13, Vulkan, OpenVINO, SYCL y HIP. También hay disponibles versiones para Android arm64 y un framework XCFramework para iOS. Los usuarios de openEuler encontrarán que los binarios para esa plataforma están desactivados en esta versión. La interfaz de usuario (UI) independiente también se actualiza en este lanzamiento. Todos los paquetes pueden descargarse desde la página oficial de lanzamientos en GitHub.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *