Nuevos modelos
Esta versión introduce una impresionante variedad de modelos de vanguardia que abarcan lenguaje, voz, multimodal y audio. Entre ellos destacan arquitecturas masivas, codecs de audio y modelos de reconocimiento de voz altamente eficientes.
HYV4
Hy4-Preview es un modelo de lenguaje de mezcla de expertos (MoE) con 780 mil millones de parámetros que activa 49 mil millones por token. Cada capa MoE contiene 256 expertos enrutados más un experto compartido siempre activo, y enruta cada token a 8 de ellos. La ventana de contexto es de 1 millón de tokens. Su arquitectura combina cuatro características: Atención Latente Multi-cabeza (MLA) que comprime claves y valores en un espacio latente de bajo rango; Atención Dispersa DeepSeek (DSA) que selecciona claves por consulta con un indexador ligero; MLA con compuertas y sumideros de atención aprendibles; y Conexiones Hiper independientes (iHC) que reemplazan la ruta residual simple con corrientes paralelas. Los pesos de predicción multi-token (MTP) se conservan para decodificación especulativa, pero no se ejecutan en esta implementación.
VibeVoice
VibeVoice es un marco novedoso para sintetizar voz de alta fidelidad y formato largo con múltiples hablantes, empleando un enfoque de difusión de siguiente token dentro de una estructura de Modelo de Lenguaje Grande (LLM). Está diseñado para capturar la «vibra» conversacional auténtica y es particularmente adecuado para generar contenido de audio como podcasts y audiolibros con varios participantes.
NeoMME
NeoMME es una familia de codificadores fundacionales multimodales multilingües eficientes de 260M y 800M parámetros de H Company. Procesa tokens de texto multilingüe y parches de imagen sin procesar en un único codificador Transformer bidireccional, sin torre de visión preentrenada ni modelo de lenguaje causal. NeoMME-Retriever es un modelo ajustado para recuperación de documentos visuales que produce embeddings multi-vector para puntuación MeanMaxSim y embeddings agrupados para similitud coseno.
Fun-ASR-Nano
Fun-ASR-Nano es un modelo de reconocimiento de voz de extremo a extremo de 800M parámetros desarrollado por el equipo FunAudioLLM de la Academia DAMO de Alibaba. Logra rendimiento de vanguardia en benchmarks de ASR en chino, inglés y japonés, siendo significativamente más pequeño que modelos comparables. Incluye soporte para 7 dialectos chinos y 26 acentos regionales, personalización de palabras clave y puntuación nativa.
KimiLinear
Kimi Linear es una arquitectura híbrida de atención lineal de Moonshot AI. Su núcleo es Kimi Delta Attention (KDA), una refinación de Gated DeltaNet que otorga a cada canal de clave su propia compuerta de olvido, de modo que el estado recurrente decae por canal en lugar de por cabeza. KDA se usa en la mayoría de las capas; cada cuarta capa conserva un bloque de atención completa que reutiliza la Atención Latente Multi-cabeza (MLA) de DeepSeek-V3, y los bloques feed-forward son MoE estilo DeepSeek-V3 con un experto compartido.
Canary
Canary-1B-v2 es un modelo multilingüe rápido y robusto para reconocimiento automático de voz (ASR) y traducción de voz a texto (AST). Reutiliza el codificador Fast Conformer de Parakeet y lo combina con un decodificador Transformer que usa incrustaciones posicionales sinusoidales fijas, atención cruzada y embeddings de entrada/salida empatados. La tarea se selecciona mediante un prefijo de prompt en el decodificador.
NeuCodec
NeuCodec es un códec de audio neuronal que extiende XCodec2 y utiliza Cuantización Escalar Finita (FSQ) con un solo libro de códigos, ideal para modelado posterior con modelos de lenguaje de voz. Entrenado con datos CC sin restricciones comerciales, a 50 tokens/segundo y 16 bits por token logra una tasa de bits total de 0.8kbps. Acepta entrada de 16kHz y produce salida de 24kHz mediante un decodificador de sobremuestreo, y su esquema FSQ ofrece resistencia a errores a nivel de bit.
Cambios importantes
Las incrustaciones rotatorias de visión (2D/3D) se han estandarizado en un módulo unificado de cálculo de frecuencia RoPE. Los usuarios con modelos de visión personalizados que dependían de lógica de entrelazado de rejilla específica deben migrar a la nueva implementación centralizada modeling_rope_utils.py.
Generación
Se han aplicado mejoras de rendimiento, como evitar sincronizaciones innecesarias del acelerador en cada paso de decodificación y prevenir la descarga incondicional de archivos remotos del hub durante la generación. También se corrigieron varios problemas de correctitud, incluyendo la verificación de caché de auto-compilación para modelos encoder-decoder, la estandarización del nombre de past_key_values en AfMoE y la resolución de fallos intermitentes en pruebas de exportación e integración.
Caché
Se corrigieron varios errores relacionados con caché, como un problema de caché cuantizada en VibeVoice, el rechazo incorrecto de implementaciones de caché no estáticas en VoxtralRealtime, la falta de verificación de caché de auto-compilación para modelos encoder-decoder y un fallo silencioso cuando se llama a atención paginada sin caché. La documentación se actualizó para aclarar el uso de ContinuousBatchingConfig y las limitaciones de modelos con ventana deslizante.
Kernels
Se mejoró el soporte de kernels con correcciones para importaciones anidadas de kernels FLA cuando solo se instala fla-core, una advertencia cuando las funciones de kernel del hub caen silenciosamente a implementaciones de referencia PyTorch más lentas, y la capacidad de registrar funciones independientes (por ejemplo, RoPE) en KernelConfig con herencia opcional de mapeos predeterminados. También se corrigieron rutas de repositorio para kernels de ESMFold2 y se actualizó la documentación de personalización de KernelConfig.
Cuantización
Se corrigieron varios errores de cuantización, incluyendo un problema de caché cuantizada en VibeVoice, manejo incorrecto de embeddings FP8 para modelos Qwen, falta de anulaciones de capa de paralelismo de tensor FP8 y dequantización innecesaria de pesos MXFP4 en dispositivos XPU.
Correcciones y mejoras
Esta versión incluye numerosas correcciones y mejoras en toda la biblioteca: soporte para cuantización de 5/6/7 bits en AutoRound, corrección de desajustes de dispositivo en YOLOS con device_map="auto", honor de shift_labels en pérdidas de LLM/VLM solo decodificador, corrección de un error de atributo al activar gradient checkpointing con descarga, y mejoras en la gestión de memoria para MTP capturando solo los estados ocultos de la última capa. También se solucionaron problemas en pruebas de integración de varios modelos (HunYuanVL, Flava, KimiLinear, etc.), se actualizaron valores dorados y se estabilizó la infraestructura de CI. Además, se añadió un nuevo muestreador de datos para reequilibrio de lotes y se mejoró la documentación en múltiples frentes.
Contribuciones destacadas de la comunidad
Como siempre, la comunidad jugó un papel fundamental en este lanzamiento. Numerosos colaboradores externos contribuyeron con nuevos modelos, correcciones, mejoras de documentación y optimizaciones de CI. Entre las contribuciones más notables se encuentran la implementación de Fun-ASR-Nano, VibeVoice, NeoMME, Canary-1B-v2, KimiLinear y NeuCodec, así como múltiples arreglos de pruebas y soporte para hardware especializado. Agradecemos a todos los que participaron.



