llama.cpp ganha otimização CUDA com cópia vetorizada e acelera get_rows em até 27%
A mais recente compilação do llama.cpp (b10076) traz uma importante otimização para GPUs CUDA, acelerando a operação get_rows quando os tipos de dado de origem e destino são idênticos. Anteriormente, a função k_get_rows_float realizava uma cópia escalar, um elemento por thread, e recalculava a cada iteração os cálculos invariantes da linha (carga do índice, fast_div_modulo […]
llama.cpp ganha otimização CUDA com cópia vetorizada e acelera get_rows em até 27% Read More »


