llama.cpp lança suporte SYCL para quantização q2_0 e novas compilações multi-plataforma

imagem 55

O projeto llama.cpp acaba de disponibilizar a build b10203 com um avanço significativo para usuários que utilizam GPUs Intel ou outros aceleradores compatíveis: agora a operação mul_mat conta com suporte para quantização q2_0 via backend SYCL. A implementação, oriunda do pull request #26231, amplia as possibilidades de inferência eficiente com modelos extremamente compactos, reduzindo ainda mais o uso de memória e a latência em cenários de auto-hospedagem.

Para informações adicionais e atualizações, o site oficial pode ser acessado em https://llama.app.

Download para macOS/iOS

Linux

Android

Windows

openEuler

  • DISABLED
  • openEuler x86 (310p)
  • openEuler x86 (910b, ACL Graph)
  • openEuler aarch64 (310p)
  • openEuler aarch64 (910b, ACL Graph)

UI

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *