llama.cpp

imagem 5

Lanzamiento de llama.cpp b10240 con aviso de cambio de puerto del servidor

Cambio inminente en el puerto predeterminado del servidor El nuevo lanzamiento b10240 de llama.cpp introduce un aviso importante para los usuarios del servidor: en una futura actualización, el puerto por defecto cambiará del actual 8080 al 9931. Esta modificación busca homogenizar la configuración y evitar conflictos con otros servicios. Se recomienda a los administradores que […]

Lanzamiento de llama.cpp b10240 con aviso de cambio de puerto del servidor Leer más »

imagem 3

Nueva versión de llama.cpp: soporte mejorado para el modelo Qwen3

La más reciente actualización de llama.cpp trae importantes mejoras para el modelo Qwen3, centradas en la interpretación de herramientas y llamadas a funciones. Se integró un analizador especializado que incluye un componente para etiquetas de pensamiento, junto con una refactorización que añade un ayudante de permutación. Además, se habilitó el soporte para la omisión de

Nueva versión de llama.cpp: soporte mejorado para el modelo Qwen3 Leer más »

imagem 1

llama.cpp incorpora llamadas a herramientas en el modo razonamiento para el modelo DS4

La nueva versión de llama.cpp (build b10217) trae una mejora significativa para los usuarios de modelos de lenguaje: ahora es posible activar las llamadas a herramientas (tool calls) durante el proceso de reflexión interna del modelo DS4. Esta funcionalidad, integrada en el chat, permite que el asistente utilice herramientas externas como parte de su razonamiento,

llama.cpp incorpora llamadas a herramientas en el modo razonamiento para el modelo DS4 Leer más »

imagem 55

llama.cpp lanza la build b10203 con soporte SYCL para multiplicación de matrices q2_0

La nueva versión b10203 de llama.cpp incorpora una mejora significativa para quienes utilizan aceleración SYCL en GPUs Intel: ahora es compatible con la multiplicación de matrices cuantizadas en formato q2_0. Esto significa que los modelos que aprovechan esta cuantización podrán ejecutarse con mayor rendimiento en entornos que dependen de SYCL, lo que se traduce en

llama.cpp lanza la build b10203 con soporte SYCL para multiplicación de matrices q2_0 Leer más »

imagem 50

Llama.cpp lanza la versión b10189 con optimización del grafo M3 y binarios para múltiples plataformas

La nueva versión b10189 de llama.cpp incluye una mejora técnica importante: se ha eliminado una operación personalizada de CPU del grafo M3, reemplazándola por operaciones estándar. Este cambio simplifica la arquitectura y puede facilitar el mantenimiento y la compatibilidad futura del motor de inferencia. Como es habitual, la actualización viene acompañada de binarios precompilados para

Llama.cpp lanza la versión b10189 con optimización del grafo M3 y binarios para múltiples plataformas Leer más »

imagem 45

llama.cpp b10176: Nueva función tensor_memset en RPC y binarios multiplataforma

Mejora en la comunicación remota con tensor_memset La versión b10176 de llama.cpp introduce una adición significativa al módulo de RPC: la función tensor_memset. Esta permite inicializar de forma eficiente la memoria de los tensores durante las llamadas a procedimientos remotos, lo que resulta especialmente valioso para quienes despliegan modelos en entornos autogestionados con cargas distribuidas.

llama.cpp b10176: Nueva función tensor_memset en RPC y binarios multiplataforma Leer más »

imagem 41

Llama.cpp estrena kernel FWHT en el backend Metal para acelerar el rendimiento en Apple Silicon

La nueva versión de llama.cpp incorpora un kernel FWHT (Transformada Rápida de Walsh-Hadamard) en su backend Metal, optimizando el procesamiento en dispositivos con chips Apple Silicon. Este avance, desarrollado por YiChen Lv y Georgi Gerganov, permite aprovechar mejor las capacidades de la GPU en macOS e iOS, reduciendo los tiempos de inferencia en modelos de

Llama.cpp estrena kernel FWHT en el backend Metal para acelerar el rendimiento en Apple Silicon Leer más »

imagem 37

Lanzamiento de llama.cpp b10149: mejora en pruebas y paquetes multiplataforma

Se ha publicado la versión b10149 de llama.cpp, que trae una mejora menor pero útil para los desarrolladores que ejecutan el conjunto de pruebas. Se ha eliminado una sincronización innecesaria en la funcionalidad de guardar y cargar estados durante los tests, lo que agiliza la ejecución de las pruebas internas sin modificar el comportamiento de

Lanzamiento de llama.cpp b10149: mejora en pruebas y paquetes multiplataforma Leer más »

imagem 20

Corrección de error en operación de tensor APE para DeepSeek4 en llama-arch

El equipo de llama.cpp ha lanzado una corrección en la arquitectura llama-arch, específicamente en la operación de tensor APE utilizada por el modelo DeepSeek4. Este fallo podía provocar comportamientos anómalos al ejecutar inferencias con dicho modelo en instalaciones autoalojadas. Con esta actualización, los usuarios que implementan DeepSeek4 en sus propios servidores disfrutarán de mayor fiabilidad

Corrección de error en operación de tensor APE para DeepSeek4 en llama-arch Leer más »