O projeto llama.cpp acaba de disponibilizar a build b10203 com um avanço significativo para usuários que utilizam GPUs Intel ou outros aceleradores compatíveis: agora a operação mul_mat conta com suporte para quantização q2_0 via backend SYCL. A implementação, oriunda do pull request #26231, amplia as possibilidades de inferência eficiente com modelos extremamente compactos, reduzindo ainda mais o uso de memória e a latência em cenários de auto-hospedagem.
Para informações adicionais e atualizações, o site oficial pode ser acessado em https://llama.app.
Download para macOS/iOS
- macOS Apple Silicon (arm64)
- macOS Apple Silicon (arm64, KleidiAI enabled) DISABLED
- macOS Intel (x64)
- iOS XCFramework
Linux
- Ubuntu x64 (CPU)
- Ubuntu arm64 (CPU)
- Ubuntu s390x (CPU)
- Ubuntu x64 (Vulkan)
- Ubuntu arm64 (Vulkan)
- Ubuntu x64 (ROCm 7.2)
- Ubuntu x64 (OpenVINO)
- Ubuntu x64 (SYCL FP32)
- Ubuntu x64 (SYCL FP16)
Android
Windows
- Windows x64 (CPU)
- Windows arm64 (CPU)
- Windows arm64 (OpenCL Adreno)
- Windows x64 (CUDA 12) – CUDA 12.4 DLLs
- Windows x64 (CUDA 13) – CUDA 13.3 DLLs
- Windows x64 (Vulkan)
- Windows x64 (OpenVINO)
- Windows x64 (SYCL)
- Windows x64 (HIP)
openEuler
- DISABLED
- openEuler x86 (310p)
- openEuler x86 (910b, ACL Graph)
- openEuler aarch64 (310p)
- openEuler aarch64 (910b, ACL Graph)



