Lançamento v5.16.1
Esta é uma versão especial, pois inclui o GLM! (e algumas pequenas correções)
GLM-5.3-Flash
O GLM-5.3-Flash é o primeiro modelo nativamente multimodal da série GLM-5. Com 320 bilhões de parâmetros totais e apenas 18 bilhões de parâmetros ativos, ele supera o GLM-5.2 em benchmarks e cargas de trabalho reais por um décimo do preço, aproximando-se do Claude Opus 4.8 em tarefas de codificação e benchmarks de agentes.
O GLM-5.3-Flash parte de um modelo base recém-treinado, com arquitetura e receita de treinamento redesenhadas visando capacidade e eficiência. Pela primeira vez na série GLM, introduzimos uma arquitetura híbrida que combina atenção esparsa e linear, reduzindo drasticamente os custos de serviço para contextos longos, preservando capacidades precisas de contexto longo. O modelo também adota Manifold-Constrained Hyper-Connections (mHC) para melhorar ainda mais a eficiência de escalonamento. Juntamente com nosso mais recente corpus de pré-treinamento multimodal de 30 trilhões de tokens, essas mudanças permitem que o GLM-5.3-Flash ofereça mais inteligência com menos computação.
A documentação oficial está disponível.
O suporte ao GLM-5.3-Flash foi adicionado nesta versão.
Correções menores
As correções menores focam principalmente na compatibilidade retroativa para a API de paralelismo tensorial e na correção de um kernel do Hugging Face por motivos de segurança. 🤗
Restaurada a compatibilidade retroativa para a API de paralelismo tensorial, e corrigidos os caminhos de commit e repositório do kernel para o ESMFold2.
O changelog completo está disponível na comparação entre v5.16.0 e v5.16.1.



