La descarga de modelos se ha estabilizado, corrigiendo un problema que provocaba que se quedaran bloqueadas antes de empezar a transferir datos. Ahora, los modelos se obtienen de forma consistente y sin interrupciones inesperadas.
Se han mejorado varias integraciones clave: se han restaurado los canales de Claude Code, se ha corregido el flujo de pensamiento (thinking) de Anthropic y Hermes Desktop respeta correctamente la opción --force-build, lo que evita conflictos y permite forzar la reconstrucción cuando es necesario.
El soporte de GPU se ha expandido notablemente. Se ha añadido compatibilidad con CUDA en Windows ARM64, soporte para las nuevas GPU B200 a través de CUDA 12 y una reducción en el uso de memoria para iGPUs en Linux con CUDA o ROCm, lo que beneficia a equipos con gráficas integradas que ahora pueden ejecutar modelos de manera más eficiente.
En cuanto a modelos, se ha incorporado soporte completo de chat, pensamiento y llamadas a herramientas para los modelos Laguna 2.1, incluyendo una corrección específica para la inferencia en Metal. También se ha solventado un fallo por el cual las llamadas a herramientas de GLM se descartaban silenciosamente al final de la generación. Por último, los motores MLX y llama.cpp han sido actualizados a sus últimas versiones.



