In einer aktuellen Erweiterung des llama.cpp-Projekts wurde die Metal-Integration um die Unterstützung des f16-Datentyps für die Leaky-ReLU-Aktivierungsfunktion ergänzt. Bisher wurde diese Operation ausschließlich mit voller 32-Bit-Genauigkeit (f32) ausgeführt. Mit der Einführung von halbgenauen Gleitkommazahlen (float16) profitieren Nutzer von Apple-Silicon-Geräten nun von einer spürbar verbesserten Inferenzleistung und einem geringeren Speicherbedarf, sofern ihre Modelle Leaky ReLU enthalten.
Für selbst gehostete Umgebungen bedeutet dies eine effizientere Ressourcennutzung und schnellere Berechnungen, ohne dass die Modellqualität merklich leidet. Die Änderung ist Teil der kontinuierlichen Optimierungen, die llama.cpp für lokale KI-Anwendungen noch attraktiver machen.



