Die neueste Version von llama.cpp bringt wesentliche Verbesserungen für die Chat-Funktionalität, insbesondere für das Qwen3-Modell. Ein neuer, spezialisierter Parser wurde hinzugefügt, der tagged thinking und Werkzeugaufrufe (Tool Calls) optimiert verarbeitet.
Konkret wurde ein Parser für getaggte Denkwerkzeuge integriert und die interne Struktur für Permutationen überarbeitet. Die Unterstützung für das Weglassen von
Für selbst gehostete Nutzer bedeutet dies eine stabilere und konsistentere Interaktion mit Qwen3-Modellen, vor allem wenn diese Funktionen zum Aufrufen externer Werkzeuge nutzen. Die Änderungen stellen sicher, dass die Ausgaben des Modells korrekt geparst und dargestellt werden.
Wie gewohnt stehen vorkompilierte Binaries für alle gängigen Plattformen bereit, darunter macOS (Apple Silicon und Intel), Linux (x64, arm64, s390x) mit verschiedenen Backends wie CPU, Vulkan, ROCm, OpenVINO und SYCL, Windows (CPU, CUDA, Vulkan, OpenVINO, SYCL, HIP) sowie Android. Die UI und iOS-Frameworks sind ebenfalls verfügbar.



