self-hosted AI

imagem 23

Ollama v0.32.6-rc0: Aceleração para Qwen3.5 no Apple GPU e Adequação ao Formato OpenAI

Ollama v0.32.6-rc0 traz melhorias significativas para usuários de GPUs Apple e compatibilidade com a API OpenAI A nova versão candidata do Ollama, v0.32.6-rc0, já está disponível e inclui uma série de aprimoramentos que beneficiam especialmente quem roda modelos localmente. O destaque fica por conta do motor MLX, que agora utiliza decodificação especulativa automática baseada no […]

Ollama v0.32.6-rc0: Aceleração para Qwen3.5 no Apple GPU e Adequação ao Formato OpenAI Read More »

imagem 55

llama.cpp lança suporte SYCL para quantização q2_0 e novas compilações multi-plataforma

O projeto llama.cpp acaba de disponibilizar a build b10203 com um avanço significativo para usuários que utilizam GPUs Intel ou outros aceleradores compatíveis: agora a operação mul_mat conta com suporte para quantização q2_0 via backend SYCL. A implementação, oriunda do pull request #26231, amplia as possibilidades de inferência eficiente com modelos extremamente compactos, reduzindo ainda

llama.cpp lança suporte SYCL para quantização q2_0 e novas compilações multi-plataforma Read More »

imagem 37

Llama.cpp build b10149 já está disponível com otimização de testes e binários para diversas plataformas

Foi lançado o build b10149 do llama.cpp, trazendo binários atualizados para uma ampla gama de sistemas operacionais e arquiteturas. Essa versão inclui uma pequena melhoria nos testes internos, removendo uma sincronização desnecessária no teste de salvamento e carregamento de estado. Para quem utiliza a suíte de testes em ambientes de desenvolvimento, essa mudança resulta em

Llama.cpp build b10149 já está disponível com otimização de testes e binários para diversas plataformas Read More »

imagem 24

Ollama v0.32.3-rc0 traz atualização do MLX e ajustes para modelos GLM e Laguna

O que há de novo na versão candidata A nova versão candidata a lançamento do Ollama, a v0.32.3-rc0, acaba de ser disponibilizada com ajustes importantes para quem utiliza modelos de linguagem em ambiente local. Entre as novidades, destaca-se a atualização do backend MLX, que melhora o desempenho em computadores Mac com Apple Silicon. Além disso,

Ollama v0.32.3-rc0 traz atualização do MLX e ajustes para modelos GLM e Laguna Read More »

imagem 20

Corrigida operação de tensor APE do DeepSeek4 no llama-arch

Foi identificado e corrigido um erro na operação de tensor APE (Absolute Position Encoding) do modelo DeepSeek4, essencial para o posicionamento preciso dos tokens durante o processamento de linguagem natural. A falha ocorria na arquitetura llama-arch e podia causar resultados inconsistentes ou degradação de desempenho em aplicações que utilizam o DeepSeek4. Com a correção, o

Corrigida operação de tensor APE do DeepSeek4 no llama-arch Read More »