Ollama 0.32.6-rc0: Más velocidad para Qwen3.5 en Apple, mejoras clave en la API y correcciones en la interfaz

imagem 23

La nueva versión preliminar de Ollama trae importantes mejoras de rendimiento y compatibilidad. En sistemas Apple, el motor MLX ahora utiliza automáticamente la cabeza MTP del modelo Qwen3.5 para decodificación especulativa, acelerando notablemente la inferencia en GPUs de Apple. Además, se han actualizado los motores MLX y llama.cpp, lo que garantiza un funcionamiento más fluido y eficiente.

En el apartado de la API, se ha alineado el formato de streaming del endpoint /v1/chat/completions con el estándar de OpenAI: ahora el atributo ‘role’ aparece solo en el primer fragmento, ‘finish_reason’ en un fragmento independiente, y los datos de uso se incluyen en un fragmento separado mediante la opción stream_options.include_usage. También se ha corregido el comportamiento en respuestas truncadas, que ahora indican correctamente finish_reason: ‘length’ en lugar de ‘tool_calls’, evitando confusiones para desarrolladores que integran el servicio.

La interfaz de línea de comandos recibe varios ajustes: el texto delimitado por pipes ya no se renderiza erróneamente como tabla, la tecla Enter confirma el autocompletado de archivos con @, y el desplazamiento en /prompt se ha optimizado para evitar retrasos. Por otro lado, modelos sin etiqueta predeterminada como kimi-k3 ahora sugieren automáticamente la variante kimi-k3:cloud al ejecutar ollama run, en lugar de fallar. Por último, la generación experimental de imágenes se ha retirado temporalmente de esta versión; los usuarios que la necesiten deben seguir utilizando la versión 0.32.5.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *