Ollama v0.32.6-rc0: Aceleração para Qwen3.5 no Apple GPU e Adequação ao Formato OpenAI

imagem 23

Ollama v0.32.6-rc0 traz melhorias significativas para usuários de GPUs Apple e compatibilidade com a API OpenAI

A nova versão candidata do Ollama, v0.32.6-rc0, já está disponível e inclui uma série de aprimoramentos que beneficiam especialmente quem roda modelos localmente. O destaque fica por conta do motor MLX, que agora utiliza decodificação especulativa automática baseada no cabeçote MTP do modelo Qwen3.5. Isso significa que o processamento de texto é acelerado em GPUs da Apple, proporcionando respostas mais rápidas sem qualquer configuração adicional pelo usuário. A atualização também inclui a versão mais recente dos motores MLX e llama.cpp, trazendo a fundação mais estável e eficiente para inferência local.

No front da compatibilidade com APIs externas, o streaming do endpoint /v1/chat/completions foi ajustado para seguir exatamente o formato de divisão de dados do OpenAI. Agora, o campo role aparece apenas no primeiro chunk, o finish_reason é enviado em um chunk separado e o uso de tokens é reportado em um chunk próprio quando a opção stream_options.include_usage está ativada. Além disso, respostas truncadas de modelos compatíveis com OpenAI agora reportam corretamente finish_reason: “length”, em vez de “tool_calls”, evitando confusões em aplicações que dependem desse comportamento para gerenciar contextos longos.

A usabilidade também recebeu atenção. Quem tenta executar ollama run kimi-k3 sem uma tag padrão agora é direcionado automaticamente para a versão cloud (kimi-k3:cloud), eliminando falhas frustrantes. Na interface textual (TUI), foram corrigidos problemas que faziam textos com barras verticais serem interpretados erroneamente como tabelas; a tecla Enter agora aceita corretamente os arquivos sugeridos pelo autocompletar ao usar o símbolo @; e a navegação pelo histórico de comandos com /prompt não sofre mais com travamentos.

Por fim, é importante notar que o recurso experimental de geração de imagens foi removido temporariamente; usuários que dependem dessa funcionalidade devem permanecer na versão 0.32.5 até que ela seja reintegrada. Todas essas mudanças estão detalhadas no changelog oficial da release candidate.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *