O projeto llama.cpp acaba de receber uma atualização importante para quem utiliza dispositivos Apple: o backend Metal ganhou suporte ao tipo f16 (ponto flutuante de 16 bits) na operação leaky ReLU. Essa mudança permite que os cálculos sejam realizados com menor precisão numérica, mas com ganhos expressivos em consumo de memória e velocidade, algo especialmente relevante para modelos de linguagem grandes executados localmente.
A função leaky ReLU é amplamente adotada em arquiteturas de redes neurais, e agora os usuários de Macs e iPhones poderão aproveitar a eficiência energética e o paralelismo das GPUs da Apple sem sobrecarregar a VRAM. A novidade beneficia tanto inferências em tempo real quanto experimentações com modelos que exigem recursos computacionais otimizados.



