Ollama 0.32.4 Chega com Suporte ao Modelo Laguna e Otimizações para Apple Silicon

imagem 34

Suporte ao Modelo Laguna via MLX

A mais recente atualização do Ollama, versão 0.32.4, trouxe uma novidade aguardada pelos usuários de Mac: o modelo Laguna agora roda nativamente em GPUs da Apple utilizando o mecanismo MLX. Esse avanço permite que o modelo opere com muito mais eficiência nos chips Apple Silicon, abrindo portas para inferência local mais rápida e com menor consumo de energia.

Decodificação Especulativa Mais Precisa

Outro destaque é a melhoria no processo de decodificação especulativa. A partir de agora, os cabeçotes de saída do modelo de rascunho são quantizados no tipo solicitado durante a criação dos drafts. Na prática, isso significa que as previsões intermediárias ganham mais acurácia e a geração de texto se torna mais ágil, sem comprometer a qualidade — um benefício direto para quem depende de respostas rápidas em aplicações interativas.

Correções e Aceleração para Qwen3 MoE

A atualização também resolveu um problema crítico na decodificação dos modelos Qwen3 MoE que utilizam especialistas com quantizações diferentes. Com o bug corrigido, a estabilidade e a consistência das saídas ficam garantidas. Além disso, a projeção combinada gate/up foi acelerada, proporcionando ganhos de performance na faixa de 4% a 9% em dispositivos com M5 Max. Esses ajustes tornam o Ollama ainda mais competitivo para cargas de trabalho pesadas de IA generativa.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *