Nova versão do llama.cpp adiciona parser especializado para modelos Qwen3

imagem 3

Foi lançada hoje a build b10227 do llama.cpp, um dos projetos mais populares para inferência local de grandes modelos de linguagem. A principal novidade desta versão é a introdução de um analisador (parser) adaptado para a família de modelos Qwen3, melhorando a capacidade da ferramenta de interpretar corretamente as respostas estruturadas desses modelos, especialmente em casos de uso que envolvem raciocínio encadeado e chamadas de ferramentas.

Para quem mantém infraestruturas próprias de IA, essa atualização é significativa: o novo parser reconhece padrões específicos do Qwen3, como blocos de pensamento (thinking) e invocações de funções via , garantindo que o histórico da conversa e a formatação das saídas sejam tratados de maneira coerente. Isso resolve problemas de compatibilidade que podiam surgir ao usar modelos derivados do Qwen3 com o llama.cpp, tornando a experiência mais confiável e pronta para produção.

Como de costume, a release b10227 disponibiliza binários pré-compilados para uma ampla gama de plataformas: macOS (Apple Silicon e Intel), iOS, distribuições Linux em múltiplas arquiteturas com suporte a Vulkan, ROCm, OpenVINO e SYCL, Android arm64, Windows em versões CPU, CUDA (12 e 13), Vulkan, OpenVINO, SYCL e HIP. A interface de usuário web também foi atualizada. Todos os pacotes podem ser baixados nos links oficiais do GitHub.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *