Die neue Version b10149 von llama.cpp ist da und bringt vorkompilierte Pakete für nahezu alle gängigen Betriebssysteme und Hardware-Beschleuniger. Nutzer, die llama.cpp selbst hosten, erhalten damit sofort einsatzbereite Installationsarchive – ohne selbst kompilieren zu müssen.
Intern wurde ein Test optimiert: Im test-save-load-state wurde eine überflüssige Synchronisation entfernt. Das verbessert die Testausführung dezent, hat aber keinen Einfluss auf die Stabilität oder Funktion der eigentlichen Anwendung.
Website: https://llama.app
Verfügbare Builds
macOS/iOS
- macOS Apple Silicon (arm64)
- macOS Apple Silicon (arm64, KleidiAI aktiviert) DEAKTIVIERT
- macOS Intel (x64)
- iOS XCFramework
Linux
- Ubuntu x64 (CPU)
- Ubuntu arm64 (CPU)
- Ubuntu s390x (CPU)
- Ubuntu x64 (Vulkan)
- Ubuntu arm64 (Vulkan)
- Ubuntu x64 (ROCm 7.2)
- Ubuntu x64 (OpenVINO)
- Ubuntu x64 (SYCL FP32)
- Ubuntu x64 (SYCL FP16)
Android
Windows
- Windows x64 (CPU)
- Windows arm64 (CPU)
- Windows arm64 (OpenCL Adreno)
- Windows x64 (CUDA 12) – CUDA 12.4 DLLs
- Windows x64 (CUDA 13) – CUDA 13.3 DLLs
- Windows x64 (Vulkan)
- Windows x64 (OpenVINO)
- Windows x64 (SYCL)
- Windows x64 (HIP)
openEuler
Die folgenden openEuler-Builds sind derzeit deaktiviert:
- openEuler x86 (310p)
- openEuler x86 (910b, ACL Graph)
- openEuler aarch64 (310p)
- openEuler aarch64 (910b, ACL Graph)



