Ollama v0.32.4: Apple-GPU-Support mit MLX und optimierte Quantisierung für flüssigere Inferenz

imagem 34

Die neue Version Ollama v0.32.4 bringt Unterstützung für das Laguna-Modell auf Apple-Grafikchips über die MLX-Engine. Damit profitieren Mac-Nutzer mit Apple Silicon nun von beschleunigten KI-Berechnungen direkt auf ihren Geräten.

Zudem wurde die Quantisierung der Ausgabeköpfe des Entwurfsmodells korrigiert: Beim Erzeugen von Entwürfen für die spekulative Dekodierung wird nun konsequent der angeforderte Datentyp verwendet. Ein Fehler im Qwen3-MoE-Decoding bei unterschiedlich quantisierten Experten wurde behoben, und die gepackte Gate/Up-Projektion arbeitet spürbar schneller – auf dem M5 Max ergab sich ein Leistungsplus von etwa 4–9 %.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert