speculative decoding

imagem 23

Ollama 0.32.6-rc0: Qwen3.5-Beschleunigung auf Apple-GPUs und verfeinerte OpenAI-Streaming-Kompatibilität

Die neueste Vorabversion von Ollama bringt vor allem für Nutzer von Apple-Hardware spürbare Leistungssteigerungen. Die MLX-Engine nutzt jetzt automatisch den MTP-Head (Multi-Token Prediction) des Qwen3.5-Modells für spekulative Dekodierung – ein Verfahren, bei dem mehrere Tokens gleichzeitig vorhergesagt werden, um die Inferenz deutlich zu beschleunigen. Gleichzeitig wurden die zugrundeliegenden MLX- und llama.cpp-Engines auf den neuesten Stand […]

Ollama 0.32.6-rc0: Qwen3.5-Beschleunigung auf Apple-GPUs und verfeinerte OpenAI-Streaming-Kompatibilität Weiterlesen »

imagem 34

Ollama v0.32.4: Apple-GPU-Support mit MLX und optimierte Quantisierung für flüssigere Inferenz

Die neue Version Ollama v0.32.4 bringt Unterstützung für das Laguna-Modell auf Apple-Grafikchips über die MLX-Engine. Damit profitieren Mac-Nutzer mit Apple Silicon nun von beschleunigten KI-Berechnungen direkt auf ihren Geräten. Zudem wurde die Quantisierung der Ausgabeköpfe des Entwurfsmodells korrigiert: Beim Erzeugen von Entwürfen für die spekulative Dekodierung wird nun konsequent der angeforderte Datentyp verwendet. Ein Fehler

Ollama v0.32.4: Apple-GPU-Support mit MLX und optimierte Quantisierung für flüssigere Inferenz Weiterlesen »