Foi lançada hoje a build b10227 do llama.cpp, um dos projetos mais populares para inferência local de grandes modelos de linguagem. A principal novidade desta versão é a introdução de um analisador (parser) adaptado para a família de modelos Qwen3, melhorando a capacidade da ferramenta de interpretar corretamente as respostas estruturadas desses modelos, especialmente em casos de uso que envolvem raciocínio encadeado e chamadas de ferramentas.
Para quem mantém infraestruturas próprias de IA, essa atualização é significativa: o novo parser reconhece padrões específicos do Qwen3, como blocos de pensamento (thinking) e invocações de funções via
Como de costume, a release b10227 disponibiliza binários pré-compilados para uma ampla gama de plataformas: macOS (Apple Silicon e Intel), iOS, distribuições Linux em múltiplas arquiteturas com suporte a Vulkan, ROCm, OpenVINO e SYCL, Android arm64, Windows em versões CPU, CUDA (12 e 13), Vulkan, OpenVINO, SYCL e HIP. A interface de usuário web também foi atualizada. Todos os pacotes podem ser baixados nos links oficiais do GitHub.



