Qwen3 MoE

imagem 3

Llama.cpp Update: Neuer Qwen3-Parser und Verbesserungen bei Tool Calls

Die neueste Version von llama.cpp bringt wesentliche Verbesserungen für die Chat-Funktionalität, insbesondere für das Qwen3-Modell. Ein neuer, spezialisierter Parser wurde hinzugefügt, der tagged thinking und Werkzeugaufrufe (Tool Calls) optimiert verarbeitet. Konkret wurde ein Parser für getaggte Denkwerkzeuge integriert und die interne Struktur für Permutationen überarbeitet. Die Unterstützung für das Weglassen von -Tags macht die Nutzung […]

Llama.cpp Update: Neuer Qwen3-Parser und Verbesserungen bei Tool Calls Weiterlesen »

imagem 34

Ollama v0.32.4: Apple-GPU-Support mit MLX und optimierte Quantisierung für flüssigere Inferenz

Die neue Version Ollama v0.32.4 bringt Unterstützung für das Laguna-Modell auf Apple-Grafikchips über die MLX-Engine. Damit profitieren Mac-Nutzer mit Apple Silicon nun von beschleunigten KI-Berechnungen direkt auf ihren Geräten. Zudem wurde die Quantisierung der Ausgabeköpfe des Entwurfsmodells korrigiert: Beim Erzeugen von Entwürfen für die spekulative Dekodierung wird nun konsequent der angeforderte Datentyp verwendet. Ein Fehler

Ollama v0.32.4: Apple-GPU-Support mit MLX und optimierte Quantisierung für flüssigere Inferenz Weiterlesen »