Novas Adições de Modelos
Meta Muse Glimmer
O Muse Glimmer, lançado hoje, é o novo modelo multimodal da Meta, especialmente projetado para casos de uso agentivos. Destilado do Muse para 30 bilhões de parâmetros e licenciado sob Apache 2.0, pode ser implantado em configurações locais para aplicações que prezam pela privacidade, como codificação, análise de documentos, assistentes pessoais e setups ao estilo Claw ou Hermes. O Muse Glimmer é um modelo denso de 30B composto por um encoder de visão ViT de 2B (Perception Encoder) e um decoder de texto de 28B. Mais informações estão disponíveis em nossa postagem no blog.
GraniteMoeSWA & GraniteSWA
Foram adicionados suportes para os modelos Granite-swa e Granitemoe-swa, membros da família Granite focados em atenção com janela deslizante (SWA).
A.X-K1 & A.X-K2
Os modelos A.X-K1 e A.X-K2, da SKT, foram integrados. O A.X-K2 recebeu suporte inicial, e o A.X-K1 também foi adicionado.
Cosmos3 Edge
O suporte ao modelo Cosmos3 Edge, voltado para visão, foi incluído nesta versão.
Mudanças com Quebra de Compatibilidade
Os kernels agora são opcionais em vez de obrigatórios para modelos de atenção linear (Mamba, GDN, somente convolução, etc.), então usuários que dependiam da seleção automática precisam habilitar explicitamente os kernels. A API de recorte de cache agora aceita apenas valores negativos (offsets relativos) em vez de tamanhos absolutos; chamadas diretas ao método crop devem ser atualizadas. Os modelos T5 e sua família (MT5, LongT5, etc.) agora suportam SDPA e outros backends de atenção, o que pode alterar a implementação padrão; para usar o caminho anterior, defina attn_implementation="eager". Diversas funções auxiliares privadas (como _is_url, _build_image_tokens) foram removidas de processadores multimodais; código que as importava diretamente precisa ser ajustado.
Atenção
Esta versão traz correções e melhorias na atenção: correção da compressão de cache da Multi-Head Latent Attention (MLA), otimização do cálculo do comprimento máximo de sequência no Flash Attention para modelos de visão, e correções de bugs na atenção flexível CTRL e no preenchimento SDPA com viés de posição. Além disso, os modelos de atenção linear foram refatorados para melhor manutenibilidade, a configuração de atenção heterogênea do Gemma 4 foi tornada explícita, e o suporte a MPS foi melhorado com a integração metal-flash-sdpa. Testes de atenção paginada para XPU também foram adicionados, e o preenchimento de valor foi movido para as interfaces de atenção que o necessitam.
Visão
Melhorias incluem pré-processamento de imagem mais rápido para modelos de visão-linguagem (GLM4V, MiniMaxM3-VL e outros), eliminando cópias redundantes de tensores, e caminhos de Flash Attention de comprimento variável mais eficientes. Correções de bugs: alinhamento de dtype na fusão de embeddings em Kosmos2/Kosmos2_5, inicialização do embedding de posição no Phi4Multimodal, paridade no redimensionamento PIL no Hunyuan-VL, e tratamento de sequência de parada no pipeline image-text-to-text. Os processadores de visão formato Qwen foram modularizados, e a imagem Docker de CI diária foi atualizada para torch 2.13.0 / CUDA 13.0.
Geração
Melhorias e correções na geração: habilitação de geração de áudio em lote para Qwen2.5/3-Omni, permissão para camadas de cache de janela deslizante funcionarem com decodificação especulativa, e correção do overhead de memória do cache estático entre chamadas de generate(). Também foram corrigidos bugs específicos de modelos: KyutaiSpeechToText, MusicgenForCausalLM, CTRL flex-attention, e decodificação assistida para cache EncoderDecoder e modelos OlmoHybrid.
Cache
Correções de bugs relacionados ao cache: adição do mapeamento de tipo de camada “mlp” faltante no NemotronH, correção de máscaras de padding de camadas recorrentes ignoradas durante preenchimento em blocos e continuação de cache para modelos híbridos, e correção da decodificação assistida para modelos com EncoderDecoderCache e OlmoHybrid. O OlmoHybrid foi alinhado para usar um cache nativo, camadas de janela deslizante agora suportam rollback para decodificação especulativa, e o cache estático não é mais armazenado como atributo do modelo, reduzindo sobrecarga de memória. A documentação sobre cache de grafo MPS foi atualizada.
Kernels
O pacote Python kernels provavelmente se tornará uma dependência obrigatória para transformers[torch] em breve, visando entregar máximo desempenho. Os kernels serão baixados apenas de editores confiáveis aprovados pela equipe HF. Comunicar problemas antecipadamente ajudará a solidificar a integração. Nesta versão, a robustez da integração de kernels foi melhorada com a refatoração do tratamento de funções, correção de fallback EROFS para downloads via HfApi, resolução de uma colisão de argumento posicional em causal_conv1d_fn, e atualização da versão dos kernels FP8 para evitar NaNs.
Quantização
Expansão do suporte à quantização: kernels FP8 para modelos de tensores comprimidos, correções para normalização de módulos FP8 e detecção de compressão baseada em formato, além de correção de condição de corrida na dequantização MXFP4 em múltiplos dispositivos. Testes de GPTQ e MXFP4 foram estendidos para dispositivos Intel XPU.
Áudio
Geração de áudio em lote para Qwen2.5/3-Omni. Correções: mismatch de dtype na fusão de features de áudio do Gemma4, erro de embedding posicional bfloat16 no AudioFlamingo3, e guardas de requisitos de backend faltantes para Voxtral. O processador ASR VibeVoice agora aceita áudio opcional e múltiplos áudios por prompt.
Paralelização
Suporte a FSDP expandido para 94 classes de modelos ForCausalLM com planos FSDP automáticos. Adicionados testes ponta a ponta (salvamento/carregamento de checkpoint distribuído e geração) e um job CI dedicado. Correções: bug de dispositivo em create_bidirectional_sliding_window_mask sob paralelismo de modelo e problema de inferência tensorial paralela para modelos com embeddings empatados.
Tokenização
Suporte nativo ao formato “tekken” da Mistral via AutoTokenizer. Corrigido bug no tokenizer CodeLlama que descartava espaços em branco iniciais na decodificação. Solucionada potencial vulnerabilidade ReDoS causada por nomes de arquivos de tokenizer não escapados usados como padrões regex em from_pretrained.
Servir
Parser de chat do serve unificado para streaming e não streaming, lidando com chamadas de ferramentas, raciocínio e conteúdo, simplificando a adição de novos modelos. Melhorias de CI: diagnóstico da API GitHub em stderr e resiliência a limites de taxa ao paginar grandes matrizes de jobs.
Correções e Melhorias Gerais
Inúmeras correções e melhorias em todo o código, desde manuseio de arquivos em sistemas somente leitura (EROFS) até ajustes em modelos como Aria, DBRX MoE, Zaya e muitos outros. Documentação revisada com correções de ortografia e gramática. Remoção de dependências obsoletas (torch 2.4), refatoração de módulos Rotary, suporte a novos argumentos em docstrings, otimizações de desempenho em processadores de tokens. O Trainer recebeu controles aprimorados de DataLoader para streaming e multiprocessamento, e o callback Trackio agora registra métricas de avaliação corretamente após o treinamento. Integração com ExecuTorch e torchao atualizada. Vários testes foram corrigidos e adaptados para XPU e outras plataformas.
Contribuições Significativas da Comunidade
Diversos colaboradores fizeram contribuições notáveis. @ydshieh liderou correções críticas de cache e melhorias no CI, @kaixuanliu garantiu compatibilidade com XPU e corrigiu testes em vários modelos, @vasqu refatorou kernels e adicionou suporte a novos modelos como A.X-K2, @kmswin1 contribuiu com modelos A.X-K1 e correções FP8, @remi-or corrigiu bugs de atenção e visão, @juliendenize adicionou o tokenizer tekken da Mistral, @IMvision12 melhorou a geração de áudio e pré-processamento de visão, @jiqing-feng modernizou a atenção do T5 e corrigiu modelos de áudio, e @tarekziade fortaleceu pipelines de CI e relatórios. Estes e muitos outros ajudaram a tornar a v5.15.0 mais robusta e rica em recursos.



