Llama.cpp Build b10159 mit neuem FWHT-Kernel für Metal veröffentlicht
Die neueste Build b10159 des llama.cpp-Projekts führt einen speziellen FWHT-Kernel für das Metal-Backend ein. Die schnelle Walsh-Hadamard-Transformation (FWHT) wird nun direkt auf Apple-GPUs beschleunigt, was die Inferenzgeschwindigkeit für selbst gehostete Sprachmodelle auf macOS- und iOS-Geräten spürbar verbessern kann. Diese Optimierung ist vor allem für rechenintensive Operationen relevant, bei denen die FWHT zum Einsatz kommt.
Das Release bietet eine breite Palette vorkompilierter Binärdateien für nahezu alle gängigen Plattformen. Nutzer von macOS finden Pakete für Apple Silicon (arm64) und Intel (x64) Apple Silicon (arm64) sowie Intel (x64). Die KleidiAI-aktivierte Variante für Apple Silicon ist derzeit deaktiviert. Für iOS-Entwickler steht ein XCFramework bereit. Die Projekt-Website ist unter https://llama.app erreichbar.
Für Linux gibt es eine Vielzahl von Builds: Ubuntu x64 (CPU), Ubuntu arm64 (CPU), Ubuntu s390x (CPU), sowie GPU-beschleunigte Optionen: Vulkan (x64), Vulkan (arm64), ROCm 7.2, OpenVINO, SYCL FP32 und SYCL FP16.
Unter Windows finden sich Pakete für x64 CPU, arm64 CPU, OpenCL Adreno (arm64), CUDA 12 (x64) mit benötigten DLLs, CUDA 13 (x64) nebst DLLs, Vulkan, OpenVINO, SYCL und HIP (für Radeon GPUs).
Für Android ist ein arm64 CPU Build verfügbar. Die openEuler-Builds sind derzeit deaktiviert; geplant waren Varianten für x86 und aarch64 mit 310p- und 910b-ACL-Graph-Unterstützung. Eine optionale grafische Benutzeroberfläche steht als separates UI-Paket bereit.



