Lanzamiento v5.16.1 con GLM-5.3-Flash y correcciones menores

imagem 60

Esta versión especial incorpora GLM-5.3-Flash, el primer modelo nativamente multimodal de la serie GLM-5, junto con algunas correcciones menores.

GLM-5.3-Flash cuenta con 320 mil millones de parámetros totales y solo 18 mil millones activos. Supera a GLM-5.2 en las pruebas de referencia y en cargas de trabajo reales a una décima parte del precio, y se acerca a Claude Opus 4.8 en tareas de programación y evaluaciones de agentes. El modelo parte de una base recién entrenada, con una arquitectura y un proceso de entrenamiento rediseñados para mejorar la capacidad y la eficiencia. Por primera vez en la serie GLM, introduce una arquitectura híbrida que combina atención dispersa y lineal, lo que reduce drásticamente los costes de servir contextos largos manteniendo capacidades precisas. Además, adopta conexiones hiperrestringidas por variedades (mHC) para aumentar la eficiencia del escalado. Junto con el corpus de preentrenamiento multimodal de 30 billones de tokens, estos cambios permiten que GLM-5.3-Flash ofrezca más inteligencia con menos cómputo. La documentación oficial está disponible en Hugging Face.

Correcciones menores

Se ha restaurado la compatibilidad con versiones anteriores de la API de paralelismo tensorial, evitando así romper el código existente de los usuarios que alojan el modelo por su cuenta. También se ha corregido la fijación de commits y rutas del repositorio para ESMFold2, y se ha anclado una versión del kernel de Hugging Face por motivos de seguridad. El registro completo de cambios se puede consultar en el repositorio oficial entre las versiones v5.16.0 y v5.16.1.

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *