KI & Machine Learning

imagem 40

Ollama 0.32.5 behebt Darstellungsfehler bei NVFP4-Modellen mit MLX Metal

Die neue Version 0.32.5 von Ollama beseitigt einen hartnäckigen Fehler in der MLX-Metal-Integration. Dieser konnte speziell bei NVFP4-Modellen – allen voran Laguna – zu spürbaren Qualitätseinbußen in der Ausgabe führen. Das Update stellt die gewohnte Präzision wieder her und sorgt für verlässliche Ergebnisse auf Apple-Hardware mit Metal-Beschleunigung. Anwender, die solche Modelle lokal betreiben, profitieren von […]

Ollama 0.32.5 behebt Darstellungsfehler bei NVFP4-Modellen mit MLX Metal Weiterlesen »

imagem 39

AWS Wochenrückblick: Local Zone in Athen, Claude Opus 5 auf AWS, Lambda Durable Execution für .NET und mehr (27. Juli 2026)

Letzte Woche hatte ich das Privileg, drei Tage in São Paulo mit technischen Entwicklern aus ganz Lateinamerika zu verbringen – zusammengekommen bei einem regionalen Tech-Event voller Deep-Dive-Sessions, praktischer Workshops und Gesprächen mit Kunden und Partnern. Was mich am meisten beeindruckte, war nicht eine einzelne Session, sondern die Energie der technischen Community, die so selten die

AWS Wochenrückblick: Local Zone in Athen, Claude Opus 5 auf AWS, Lambda Durable Execution für .NET und mehr (27. Juli 2026) Weiterlesen »

imagem 37

llama.cpp b10149 veröffentlicht: Builds für alle Plattformen und eine kleine Optimierung

Die neue Version b10149 von llama.cpp ist da und bringt vorkompilierte Pakete für nahezu alle gängigen Betriebssysteme und Hardware-Beschleuniger. Nutzer, die llama.cpp selbst hosten, erhalten damit sofort einsatzbereite Installationsarchive – ohne selbst kompilieren zu müssen. Intern wurde ein Test optimiert: Im test-save-load-state wurde eine überflüssige Synchronisation entfernt. Das verbessert die Testausführung dezent, hat aber keinen

llama.cpp b10149 veröffentlicht: Builds für alle Plattformen und eine kleine Optimierung Weiterlesen »

imagem 35

Ollama v0.32.5-rc0: MLX-Update optimiert lokale LLMs auf Apple Silicon

Mit dem neuen Release Candidate v0.32.5-rc0 verbessert Ollama die Unterstützung für Apples MLX-Framework. Diese Aktualisierung sorgt dafür, dass selbst gehostete Sprachmodelle auf Apple-Silicon-Macs reibungsloser und effizienter laufen. Nutzer profitieren von optimierter Hardwarebeschleunigung und besserer Kompatibilität mit neueren Betriebssystemversionen. Das Update ist vor allem für Entwickler und Unternehmen interessant, die große Sprachmodelle lokal betreiben möchten. Die

Ollama v0.32.5-rc0: MLX-Update optimiert lokale LLMs auf Apple Silicon Weiterlesen »

imagem 34

Ollama v0.32.4: Apple-GPU-Support mit MLX und optimierte Quantisierung für flüssigere Inferenz

Die neue Version Ollama v0.32.4 bringt Unterstützung für das Laguna-Modell auf Apple-Grafikchips über die MLX-Engine. Damit profitieren Mac-Nutzer mit Apple Silicon nun von beschleunigten KI-Berechnungen direkt auf ihren Geräten. Zudem wurde die Quantisierung der Ausgabeköpfe des Entwurfsmodells korrigiert: Beim Erzeugen von Entwürfen für die spekulative Dekodierung wird nun konsequent der angeforderte Datentyp verwendet. Ein Fehler

Ollama v0.32.4: Apple-GPU-Support mit MLX und optimierte Quantisierung für flüssigere Inferenz Weiterlesen »

imagem 31

langchain-openai 1.4.1: Nahtlose Gateway-Anbindung und Korrektur des gpt-5.3-chat-latest-Profils

Was gibt’s Neues in Version 1.4.1? Das langchain-openai-Paket wurde auf Version 1.4.1 aktualisiert und bringt vor allem zwei wichtige Neuerungen für Entwickler, die LangChain in selbst gehosteten Umgebungen einsetzen. LangSmith Gateway bequem per Umgebungsvariable nutzen Die Integration des LangSmith Gateways wurde vereinfacht: Ab sofort reicht eine einzige Umgebungsvariable, um die Verbindung einzurichten – und das

langchain-openai 1.4.1: Nahtlose Gateway-Anbindung und Korrektur des gpt-5.3-chat-latest-Profils Weiterlesen »

imagem 30

Ollama 0.32.3: Erweiterte GPU-Unterstützung und Modellverbesserungen

Das neueste Update der quelloffenen KI-Plattform Ollama behebt einen ärgerlichen Fehler, bei dem Modelldownloads vor der Datenübertragung hängen blieben. Außerdem wurden diverse Schnittstellen optimiert: So funktionieren die Claude Code Channels wieder wie gewohnt, die Verarbeitung von „Thinking Streams“ bei Anthropic-Modellen wurde korrigiert, und Hermes Desktop respektiert nun zuverlässig die –force-build-Option. Erweiterte GPU-Unterstützung ist ein weiterer

Ollama 0.32.3: Erweiterte GPU-Unterstützung und Modellverbesserungen Weiterlesen »

imagem 25

Metal-Backend erhält Halbpräzisions-Unterstützung für Leaky ReLU

In einer aktuellen Erweiterung des llama.cpp-Projekts wurde die Metal-Integration um die Unterstützung des f16-Datentyps für die Leaky-ReLU-Aktivierungsfunktion ergänzt. Bisher wurde diese Operation ausschließlich mit voller 32-Bit-Genauigkeit (f32) ausgeführt. Mit der Einführung von halbgenauen Gleitkommazahlen (float16) profitieren Nutzer von Apple-Silicon-Geräten nun von einer spürbar verbesserten Inferenzleistung und einem geringeren Speicherbedarf, sofern ihre Modelle Leaky ReLU enthalten.

Metal-Backend erhält Halbpräzisions-Unterstützung für Leaky ReLU Weiterlesen »

imagem 24

Ollama v0.32.3-rc0: Feinschliff für GLM, Laguna und Apple Silicon

Die Vorabversion 0.32.3-rc0 von Ollama liefert wichtige Stabilitäts- und Kompatibilitätsverbesserungen für selbst gehostete Sprachmodelle. Entwickler und Betreiber profitieren von optimierten Modellschnittstellen und einer aktualisierten Hardware-Anbindung. Zuverlässigere Werkzeugnutzung und aktualisierte Modelle Bei GLM-Modellen kam es bislang zu unvollständigen Werkzeugaufrufen – dieser Fehler ist nun behoben. Tool Calls werden jetzt sauber abgeschlossen, was insbesondere für interaktive Anwendungen

Ollama v0.32.3-rc0: Feinschliff für GLM, Laguna und Apple Silicon Weiterlesen »

imagem 21

LangChain-Anthropic 1.5.0: Verbesserte Reasoning-Kontrolle und Bugfixes

Die neue Version LangChain-Anthropic 1.5.0 bringt eine wesentliche Erweiterung für Chat-Modelle: den Parameter reasoning_effort. Damit lässt sich steuern, wie viel Denkarbeit ein Modell vor der Antwort investiert – eine Funktion, die insbesondere bei Modellen mit „extended thinking“ wie Claude zum Tragen kommt. Diese standardisierte Schnittstelle erleichtert die Konfiguration und macht fortgeschrittene Reasoning-Strategien einfacher zugänglich. Zwei

LangChain-Anthropic 1.5.0: Verbesserte Reasoning-Kontrolle und Bugfixes Weiterlesen »