imagem 55

llama.cpp lança suporte SYCL para quantização q2_0 e novas compilações multi-plataforma

O projeto llama.cpp acaba de disponibilizar a build b10203 com um avanço significativo para usuários que utilizam GPUs Intel ou outros aceleradores compatíveis: agora a operação mul_mat conta com suporte para quantização q2_0 via backend SYCL. A implementação, oriunda do pull request #26231, amplia as possibilidades de inferência eficiente com modelos extremamente compactos, reduzindo ainda […]

llama.cpp lança suporte SYCL para quantização q2_0 e novas compilações multi-plataforma Read More »