llama.cpp

imagem 7

llama.cpp ganha otimização CUDA com cópia vetorizada e acelera get_rows em até 27%

A mais recente compilação do llama.cpp (b10076) traz uma importante otimização para GPUs CUDA, acelerando a operação get_rows quando os tipos de dado de origem e destino são idênticos. Anteriormente, a função k_get_rows_float realizava uma cópia escalar, um elemento por thread, e recalculava a cada iteração os cálculos invariantes da linha (carga do índice, fast_div_modulo […]

llama.cpp ganha otimização CUDA com cópia vetorizada e acelera get_rows em até 27% Read More »

imagem 4

Ollama v0.32.2-rc0: Agentes ganham sistema de habilidades e melhorias no TUI

A versão candidata a lançamento Ollama v0.32.2-rc0 acaba de ser disponibilizada, trazendo um conjunto robusto de novidades voltadas para a experiência com agentes, desempenho do backend e correções de integração. Esta prévia mostra um foco claro em tornar as interações com modelos locais e na nuvem mais fluidas e poderosas. O destaque fica por conta

Ollama v0.32.2-rc0: Agentes ganham sistema de habilidades e melhorias no TUI Read More »