Ollama v0.32.4: Soporte para Laguna en GPUs Apple, mejoras en decodificación especulativa y MoE

imagem 34

La nueva versión de Ollama, la 0.32.4, incorpora compatibilidad con el modelo Laguna en GPUs de Apple a través del motor MLX. Esto significa que los usuarios con hardware Apple Silicon ahora pueden ejecutar este modelo de forma nativa y eficiente, aprovechando al máximo las capacidades de sus dispositivos.

En el apartado de optimizaciones, se ha mejorado la cuantización de los cabezales de salida de los modelos de borrador durante la decodificación especulativa. Este ajuste garantiza que los borradores se generen con el tipo de datos solicitado, lo que redunda en un proceso más preciso y coherente.

También se ha corregido un error en la decodificación del modelo Qwen3 con mezcla de expertos (MoE) que afectaba a versiones cuantizadas de manera diferente. Además, se ha acelerado la proyección empaquetada de puerta y subida (gate/up), logrando una mejora de rendimiento del 4 al 9% en equipos con chip M5 Max.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *