llama.cpp

imagem 5

llama.cpp b10240: Aviso de Mudança de Porta Padrão e Binários Multiplataforma

O time do llama.cpp lançou a build b10240, trazendo um aviso importante para os usuários do servidor: a porta padrão será alterada de 8080 para 9931 em uma versão futura. Embora a mudança ainda não tenha sido efetivada, esta notificação serve para que administradores de sistemas auto-hospedados se preparem para ajustar suas configurações. Além disso, […]

llama.cpp b10240: Aviso de Mudança de Porta Padrão e Binários Multiplataforma Read More »

imagem 3

Nova versão do llama.cpp adiciona parser especializado para modelos Qwen3

Foi lançada hoje a build b10227 do llama.cpp, um dos projetos mais populares para inferência local de grandes modelos de linguagem. A principal novidade desta versão é a introdução de um analisador (parser) adaptado para a família de modelos Qwen3, melhorando a capacidade da ferramenta de interpretar corretamente as respostas estruturadas desses modelos, especialmente em

Nova versão do llama.cpp adiciona parser especializado para modelos Qwen3 Read More »

imagem 1

Lançamento do llama.cpp b10217 traz chamada de ferramentas no modo de pensamento para DS4

Foi lançada a build b10217 do llama.cpp, trazendo uma melhoria significativa: a habilitação de chamadas de ferramentas (tool calls) durante o modo de pensamento para modelos DS4 (DeepSeek 4). Essa atualização permite que o assistente de chat possa interagir com ferramentas externas mesmo enquanto processa raciocínios internos, ampliando suas capacidades de execução de tarefas. Website:

Lançamento do llama.cpp b10217 traz chamada de ferramentas no modo de pensamento para DS4 Read More »

imagem 55

llama.cpp lança suporte SYCL para quantização q2_0 e novas compilações multi-plataforma

O projeto llama.cpp acaba de disponibilizar a build b10203 com um avanço significativo para usuários que utilizam GPUs Intel ou outros aceleradores compatíveis: agora a operação mul_mat conta com suporte para quantização q2_0 via backend SYCL. A implementação, oriunda do pull request #26231, amplia as possibilidades de inferência eficiente com modelos extremamente compactos, reduzindo ainda

llama.cpp lança suporte SYCL para quantização q2_0 e novas compilações multi-plataforma Read More »

imagem 50

Nova build b10189 do llama.cpp remove operação customizada de CPU do gráfico M3

Foi lançada a build b10189 do llama.cpp com uma simplificação importante no backend M3: a remoção de uma operação customizada de CPU, que agora é expressa usando operações padrão. Essa mudança melhora a manutenção do código e pode trazer ganhos de desempenho para modelos que utilizam o grafo M3. A atualização está disponível para download

Nova build b10189 do llama.cpp remove operação customizada de CPU do gráfico M3 Read More »

imagem 45

Nova versão do llama.cpp: build b10176 adiciona tensor_memset ao RPC e libera binários para múltiplas plataformas

O projeto llama.cpp acaba de disponibilizar a build b10176, trazendo uma nova funcionalidade no componente RPC: a adição de tensor_memset. Esta atualização inclui também a distribuição de binários pré-compilados para as principais plataformas, facilitando a execução local por usuários autônomos. Website https://llama.app macOS / iOS macOS Apple Silicon (arm64) macOS Apple Silicon (arm64, KleidiAI enabled)

Nova versão do llama.cpp: build b10176 adiciona tensor_memset ao RPC e libera binários para múltiplas plataformas Read More »

imagem 41

llama.cpp: Build b10159 adiciona kernel FWHT para Metal e renova builds para diversas plataformas

Uma nova versão do llama.cpp, identificada como build b10159, foi disponibilizada, trazendo uma importante adição: a inclusão de um kernel FWHT (Fast Walsh-Hadamard Transform) para o backend Metal. Esse aprimoramento visa acelerar o processamento em dispositivos Apple com suporte a Metal, beneficiando diretamente usuários de macOS e iOS. O desenvolvimento contou com contribuições da comunidade,

llama.cpp: Build b10159 adiciona kernel FWHT para Metal e renova builds para diversas plataformas Read More »

imagem 37

Llama.cpp build b10149 já está disponível com otimização de testes e binários para diversas plataformas

Foi lançado o build b10149 do llama.cpp, trazendo binários atualizados para uma ampla gama de sistemas operacionais e arquiteturas. Essa versão inclui uma pequena melhoria nos testes internos, removendo uma sincronização desnecessária no teste de salvamento e carregamento de estado. Para quem utiliza a suíte de testes em ambientes de desenvolvimento, essa mudança resulta em

Llama.cpp build b10149 já está disponível com otimização de testes e binários para diversas plataformas Read More »

imagem 25

Backend Metal do llama.cpp agora suporta f16 para leaky ReLU

O projeto llama.cpp acaba de receber uma atualização importante para quem utiliza dispositivos Apple: o backend Metal ganhou suporte ao tipo f16 (ponto flutuante de 16 bits) na operação leaky ReLU. Essa mudança permite que os cálculos sejam realizados com menor precisão numérica, mas com ganhos expressivos em consumo de memória e velocidade, algo especialmente

Backend Metal do llama.cpp agora suporta f16 para leaky ReLU Read More »

imagem 20

Corrigida operação de tensor APE do DeepSeek4 no llama-arch

Foi identificado e corrigido um erro na operação de tensor APE (Absolute Position Encoding) do modelo DeepSeek4, essencial para o posicionamento preciso dos tokens durante o processamento de linguagem natural. A falha ocorria na arquitetura llama-arch e podia causar resultados inconsistentes ou degradação de desempenho em aplicações que utilizam o DeepSeek4. Com a correção, o

Corrigida operação de tensor APE do DeepSeek4 no llama-arch Read More »