llama.cpp Build b10203: SYCL-Unterstützung für q2_mul_mat und plattformübergreifende Binärpakete
Das llama.cpp-Team hat Build b10203 veröffentlicht, der eine wichtige Erweiterung für SYCL-Nutzer bringt: Die Unterstützung von q2_0 in der mul_mat-Operation wurde hinzugefügt. Mit diesem Update können Modelle, die auf 2-Bit-Quantisierung basieren, effizienter auf SYCL-kompatiblen GPUs ausgeführt werden, was die Inferenzleistung und den Speicherverbrauch verbessert. Neben dieser Neuerung stehen vorkompilierte Binärpakete für eine Vielzahl von Plattformen […]


