A nova versão do Ollama corrige um problema crítico em que os downloads de modelos paravam antes de enviar dados, garantindo uma experiência mais estável. As integrações foram aprimoradas, com a restauração dos canais do Claude Code, correção nos fluxos de “thinking” do Anthropic e ajustes para que o Hermes Desktop respeite a flag --force-build.
O suporte a GPU foi ampliado: agora há compatibilidade com CUDA no Windows ARM64, suporte às GPUs B200 via CUDA 12 e redução do uso de memória em iGPUs Linux com CUDA e ROCm. Para os modelos Laguna 2.1, foram adicionados suporte a chat, pensamento e chamada de ferramentas, incluindo uma correção para inferência no Metal.
Além disso, foi solucionado um bug em que as chamadas de ferramentas dos modelos GLM eram silenciosamente descartadas ao final da geração. Os mecanismos MLX e llama.cpp também receberam atualizações importantes, melhorando a performance e a estabilidade geral.



