llama.cpp Build b10203: SYCL-Unterstützung für q2_mul_mat und plattformübergreifende Binärpakete

imagem 55

Das llama.cpp-Team hat Build b10203 veröffentlicht, der eine wichtige Erweiterung für SYCL-Nutzer bringt: Die Unterstützung von q2_0 in der mul_mat-Operation wurde hinzugefügt. Mit diesem Update können Modelle, die auf 2-Bit-Quantisierung basieren, effizienter auf SYCL-kompatiblen GPUs ausgeführt werden, was die Inferenzleistung und den Speicherverbrauch verbessert.

Neben dieser Neuerung stehen vorkompilierte Binärpakete für eine Vielzahl von Plattformen zur Verfügung. Für macOS und iOS gibt es Versionen für Apple Silicon und Intel, wobei die KleidiAI-aktivierte Variante derzeit deaktiviert ist. Linux-Anwender erhalten Pakete für Ubuntu auf x64, arm64 und s390x sowie mit Backends wie Vulkan, ROCm 7.2, OpenVINO und SYCL (FP32 und FP16). Android-Nutzer können die arm64-CPU-Variante herunterladen. Windows wird ebenso umfassend unterstützt – mit CPU-Builds für x64 und arm64, GPU-beschleunigten Versionen via CUDA 12 und 13, Vulkan, OpenVINO, SYCL und HIP, inklusive eines speziellen OpenCL-Adreno-Pakets für arm64-Geräte.

Die openEuler-Builds sind derzeit leider deaktiviert. Eine eigenständige Benutzeroberfläche (UI) ist ebenfalls verfügbar. Alle Downloads und weitere Informationen gibt es auf der Release-Seite unter llama.app.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert