Esta actualización resuelve varios inconvenientes que aparecieron tras la integración del modelo Inkling. El problema más notable afectaba a los modelos que utilizan EncoderDecoderCache durante la generación asistida, causando fallos en el proceso. Asimismo, se corrigió un error que podía surgir durante la etapa de precarga (prefill) al emplear StaticCache y sdpa sin relleno en Inkling, debido al uso de un sesgo de posición (position_bias). Estas mejoras garantizan un funcionamiento más estable para quienes usan estos métodos.
Por otra parte, se actualizó la versión de los kernels FP8, lo que aporta mejoras de rendimiento y compatibilidad. También se solucionó un fallo que impedía el uso correcto de deepgemm en configuraciones con múltiples dispositivos, asegurando su operación fluida en entornos distribuidos.



