imagem 23

Ollama 0.32.6-rc0: Qwen3.5-Beschleunigung auf Apple-GPUs und verfeinerte OpenAI-Streaming-Kompatibilität

Die neueste Vorabversion von Ollama bringt vor allem für Nutzer von Apple-Hardware spürbare Leistungssteigerungen. Die MLX-Engine nutzt jetzt automatisch den MTP-Head (Multi-Token Prediction) des Qwen3.5-Modells für spekulative Dekodierung – ein Verfahren, bei dem mehrere Tokens gleichzeitig vorhergesagt werden, um die Inferenz deutlich zu beschleunigen. Gleichzeitig wurden die zugrundeliegenden MLX- und llama.cpp-Engines auf den neuesten Stand […]

Ollama 0.32.6-rc0: Qwen3.5-Beschleunigung auf Apple-GPUs und verfeinerte OpenAI-Streaming-Kompatibilität Weiterlesen »