Transformers v5.17.0: novos modelos, melhorias e correções

imagem 28

A versão v5.17.0 do Transformers foi lançada trazendo uma série de novos modelos e aprimoramentos importantes. Entre as adições estão o HYV4, um modelo de linguagem com 780 bilhões de parâmetros que utiliza mistura de especialistas e janela de contexto de 1 milhão de tokens; o VibeVoice, framework para síntese de fala longa e multipalestrante; o NeoMME, encoder multimodal multilíngue; o Fun-ASR-Nano, modelo de reconhecimento de fala de 800 milhões de parâmetros com suporte a chinês, inglês e japonês, incluindo 7 dialetos chineses e 26 sotaques regionais; o KimiLinear, arquitetura de atenção linear híbrida; o Canary-1B-v2, modelo rápido para reconhecimento e tradução de fala; e o NeuCodec, codec de áudio neural com quantização escalar finita.

Mudanças importantes incluem a padronização das incorporações rotativas de visão em um módulo unificado de cálculo de frequência RoPE, exigindo migração para quem usa modelos de visão personalizados. Na geração, houve otimização de desempenho para evitar sincronizações desnecessárias do acelerador a cada etapa e correção para impedir downloads não condicionais de arquivos remotos. Também foram aplicadas correções de cache, kernels e quantização, como ajuste no cache quantizado do VibeVoice, correção no tratamento de embeddings FP8 para modelos Qwen e manutenção dos pesos MXFP4 quantizados em dispositivos XPU.

Além disso, vários bugs foram corrigidos e melhorias foram feitas em modelos como GLM 5.3 Flash, Qwen, KimiLinear, Inkling e outros. A comunidade contribuiu significativamente, com diversos colaboradores implementando novos modelos, corrigindo testes de integração e aprimorando a infraestrutura de CI.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *