Lançamento v5.16.1

imagem 60

Lançamento v5.16.1

Esta é uma versão especial, pois inclui o GLM! (e algumas pequenas correções)

GLM-5.3-Flash

O GLM-5.3-Flash é o primeiro modelo nativamente multimodal da série GLM-5. Com 320 bilhões de parâmetros totais e apenas 18 bilhões de parâmetros ativos, ele supera o GLM-5.2 em benchmarks e cargas de trabalho reais por um décimo do preço, aproximando-se do Claude Opus 4.8 em tarefas de codificação e benchmarks de agentes.

O GLM-5.3-Flash parte de um modelo base recém-treinado, com arquitetura e receita de treinamento redesenhadas visando capacidade e eficiência. Pela primeira vez na série GLM, introduzimos uma arquitetura híbrida que combina atenção esparsa e linear, reduzindo drasticamente os custos de serviço para contextos longos, preservando capacidades precisas de contexto longo. O modelo também adota Manifold-Constrained Hyper-Connections (mHC) para melhorar ainda mais a eficiência de escalonamento. Juntamente com nosso mais recente corpus de pré-treinamento multimodal de 30 trilhões de tokens, essas mudanças permitem que o GLM-5.3-Flash ofereça mais inteligência com menos computação.

A documentação oficial está disponível.

O suporte ao GLM-5.3-Flash foi adicionado nesta versão.

Correções menores

As correções menores focam principalmente na compatibilidade retroativa para a API de paralelismo tensorial e na correção de um kernel do Hugging Face por motivos de segurança. 🤗

Restaurada a compatibilidade retroativa para a API de paralelismo tensorial, e corrigidos os caminhos de commit e repositório do kernel para o ESMFold2.

O changelog completo está disponível na comparação entre v5.16.0 e v5.16.1.

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *