Ollama 0.32.6-rc0: Más velocidad para Qwen3.5 en Apple, mejoras clave en la API y correcciones en la interfaz
La nueva versión preliminar de Ollama trae importantes mejoras de rendimiento y compatibilidad. En sistemas Apple, el motor MLX ahora utiliza automáticamente la cabeza MTP del modelo Qwen3.5 para decodificación especulativa, acelerando notablemente la inferencia en GPUs de Apple. Además, se han actualizado los motores MLX y llama.cpp, lo que garantiza un funcionamiento más fluido […]



