llama.cpp

imagem 5

llama.cpp Build b10240: Server-Port wechselt von 8080 auf 9931 – und alle Downloads

Die neueste Entwicklerversion von llama.cpp, Build b10240, bringt eine bedeutende Ankündigung für Betreiber selbst gehosteter Server mit: Der standardmäßig verwendete Port wird sich in Kürze von 8080 auf 9931 ändern. Um Nutzer darauf vorzubereiten, haben die Entwickler einen sichtbaren Hinweis integriert. Noch bleibt der Port bei 8080, doch schon bald wird der Wechsel vollzogen – […]

llama.cpp Build b10240: Server-Port wechselt von 8080 auf 9931 – und alle Downloads Weiterlesen »

imagem 3

Llama.cpp Update: Neuer Qwen3-Parser und Verbesserungen bei Tool Calls

Die neueste Version von llama.cpp bringt wesentliche Verbesserungen für die Chat-Funktionalität, insbesondere für das Qwen3-Modell. Ein neuer, spezialisierter Parser wurde hinzugefügt, der tagged thinking und Werkzeugaufrufe (Tool Calls) optimiert verarbeitet. Konkret wurde ein Parser für getaggte Denkwerkzeuge integriert und die interne Struktur für Permutationen überarbeitet. Die Unterstützung für das Weglassen von -Tags macht die Nutzung

Llama.cpp Update: Neuer Qwen3-Parser und Verbesserungen bei Tool Calls Weiterlesen »

imagem 1

Neues llama.cpp Release: Tool-Aufrufe in der Denkphase für DS4-Modelle aktiviert

Das llama.cpp-Projekt hat eine neue Version veröffentlicht, die eine wichtige Neuerung für Nutzer von DS4-Modellen mit sich bringt: Tool-Aufrufe können nun auch während der Denkphase („Thinking“) des Modells erfolgen. Bisher waren solche Aufrufe von externen Werkzeugen oder APIs nur in der Antwortphase möglich. Diese Erweiterung verbessert die Fähigkeit des Modells, komplexe Aufgaben durch die Einbindung

Neues llama.cpp Release: Tool-Aufrufe in der Denkphase für DS4-Modelle aktiviert Weiterlesen »

imagem 55

llama.cpp Build b10203: SYCL-Unterstützung für q2_mul_mat und plattformübergreifende Binärpakete

Das llama.cpp-Team hat Build b10203 veröffentlicht, der eine wichtige Erweiterung für SYCL-Nutzer bringt: Die Unterstützung von q2_0 in der mul_mat-Operation wurde hinzugefügt. Mit diesem Update können Modelle, die auf 2-Bit-Quantisierung basieren, effizienter auf SYCL-kompatiblen GPUs ausgeführt werden, was die Inferenzleistung und den Speicherverbrauch verbessert. Neben dieser Neuerung stehen vorkompilierte Binärpakete für eine Vielzahl von Plattformen

llama.cpp Build b10203: SYCL-Unterstützung für q2_mul_mat und plattformübergreifende Binärpakete Weiterlesen »

imagem 50

llama.cpp Build b10189: Optimierung für M3-Grafikprozessoren und breite Plattformunterstützung

Die neue Version b10189 von llama.cpp bringt eine gezielte Verbesserung für Apple-Silicon-Systeme. Eine bisher verwendete, speziell für die CPU optimierte Operation wurde aus dem M3-Grafen entfernt und durch Standardoperationen ersetzt. Dadurch wird die Codebasis schlanker und die langfristige Wartbarkeit erhöht – ein bedeutender Schritt für alle, die llama.cpp selbst hosten oder auf M3-Prozessoren betreiben. Wie

llama.cpp Build b10189: Optimierung für M3-Grafikprozessoren und breite Plattformunterstützung Weiterlesen »

imagem 45

llama.cpp Build b10176: Neuer RPC-Befehl und plattformübergreifende Binaries

Die neueste Version von llama.cpp, Build b10176, bringt eine praktische Erweiterung für das Remote Procedure Call (RPC)-System: den Befehl tensor_memset. Damit lassen sich Tensoren im verteilten Inferenzbetrieb effizient mit einem bestimmten Wert initialisieren oder zurücksetzen – ein hilfreiches Werkzeug für alle, die große Modelle selbst hosten und mehrere Rechenknoten einsetzen. Neben diesem internen Feature stehen

llama.cpp Build b10176: Neuer RPC-Befehl und plattformübergreifende Binaries Weiterlesen »

imagem 41

Neues llama.cpp-Release b10159 bringt FWHT-Kernel für Metal-Backend

Llama.cpp Build b10159 mit neuem FWHT-Kernel für Metal veröffentlicht Die neueste Build b10159 des llama.cpp-Projekts führt einen speziellen FWHT-Kernel für das Metal-Backend ein. Die schnelle Walsh-Hadamard-Transformation (FWHT) wird nun direkt auf Apple-GPUs beschleunigt, was die Inferenzgeschwindigkeit für selbst gehostete Sprachmodelle auf macOS- und iOS-Geräten spürbar verbessern kann. Diese Optimierung ist vor allem für rechenintensive Operationen

Neues llama.cpp-Release b10159 bringt FWHT-Kernel für Metal-Backend Weiterlesen »

imagem 37

llama.cpp b10149 veröffentlicht: Builds für alle Plattformen und eine kleine Optimierung

Die neue Version b10149 von llama.cpp ist da und bringt vorkompilierte Pakete für nahezu alle gängigen Betriebssysteme und Hardware-Beschleuniger. Nutzer, die llama.cpp selbst hosten, erhalten damit sofort einsatzbereite Installationsarchive – ohne selbst kompilieren zu müssen. Intern wurde ein Test optimiert: Im test-save-load-state wurde eine überflüssige Synchronisation entfernt. Das verbessert die Testausführung dezent, hat aber keinen

llama.cpp b10149 veröffentlicht: Builds für alle Plattformen und eine kleine Optimierung Weiterlesen »

imagem 25

Metal-Backend erhält Halbpräzisions-Unterstützung für Leaky ReLU

In einer aktuellen Erweiterung des llama.cpp-Projekts wurde die Metal-Integration um die Unterstützung des f16-Datentyps für die Leaky-ReLU-Aktivierungsfunktion ergänzt. Bisher wurde diese Operation ausschließlich mit voller 32-Bit-Genauigkeit (f32) ausgeführt. Mit der Einführung von halbgenauen Gleitkommazahlen (float16) profitieren Nutzer von Apple-Silicon-Geräten nun von einer spürbar verbesserten Inferenzleistung und einem geringeren Speicherbedarf, sofern ihre Modelle Leaky ReLU enthalten.

Metal-Backend erhält Halbpräzisions-Unterstützung für Leaky ReLU Weiterlesen »

imagem 20

Fehlerbehebung in llama.cpp: DeepSeek4 APE Tensor-Operation repariert

Die neueste Aktualisierung von llama.cpp behebt einen Fehler in der Komponente llama-arch, der die APE-Tensoroperation für das DeepSeek4-Modell betraf. Bei selbst gehosteten Setups konnte dieser Bug die korrekte Verarbeitung von Anfragen beeinträchtigen und zu unerwarteten Ergebnissen führen. Mit dem Fix wird nun die Stabilität und Genauigkeit der Modellinferenz für DeepSeek4 wiederhergestellt, sodass Benutzer ihre KI-Anwendungen

Fehlerbehebung in llama.cpp: DeepSeek4 APE Tensor-Operation repariert Weiterlesen »