Nova versão de patch resolve falhas críticas na integração do modelo Inkling
A versão v5.14.1 do Transformers acaba de ser lançada, trazendo correções importantes para problemas que surgiram durante a integração do novo modelo Inkling. Entre as principais melhorias, destaca-se a solução de um bug que afetava modelos que utilizam EncoderDecoderCache durante a geração assistida, o que poderia causar comportamentos inesperados ou falhas. Agora, a decodificação assistida funciona de forma estável também para arquiteturas como a OlmoHybrid, garantindo maior compatibilidade e desempenho.
Outro ajuste relevante resolve uma falha que ocorria especificamente na fase de preenchimento (prefill) ao combinar StaticCache com a atenção sdpa sem padding, quando o Inkling emprega um position_bias. Essa correção assegura que o processamento inicial das sequências seja preciso, evitando distorções nos resultados. Além dessas mudanças voltadas ao Inkling, a atualização também inclui a atualização da versão dos kernels FP8, o que deve trazer ganhos de estabilidade e performance para operações de precisão reduzida. Por fim, um problema envolvendo o deepgemm em múltiplos dispositivos foi corrigido, eliminando falhas que poderiam surgir em ambientes com várias GPUs ou aceleradores, permitindo que os usuários tirem máximo proveito do paralelismo.



