imagem 7

llama.cpp acelera operaciones get_rows en CUDA con vectorización int4

La última compilación de llama.cpp incorpora una importante optimización para kernels CUDA que acelera las operaciones de recolección de filas (get_rows) cuando origen y destino comparten el mismo tipo de dato. Anteriormente, la función k_get_rows_float copiaba elemento por elemento con un hilo por valor, recalculando trabajo invariante para cada elemento. Ahora se ha extraído esa […]

llama.cpp acelera operaciones get_rows en CUDA con vectorización int4 Leer más »