Nuevos modelos
Esta versión incorpora cuatro arquitecturas nuevas. El modelo Qwen4-Exp se basa en la arquitectura híbrida de texto y multimodal de Qwen3.5 e incluye tres componentes clave: GatedResidual (GR), Qwen Sparse Attention (QSA) y Per-Layer Embedding (PLE). GR combina Hyper-Connection con GatedNorm para gestionar múltiples flujos residuales con compuertas finas antes de cada bloque de atención y Mixture-of-Experts, controlando cuánto se inyecta de vuelta. QSA utiliza múltiples cabezas de consulta para puntuar bloques de claves comprimidos y seleccionar los bloques contiguos más relevantes, manteniendo sin comprimir el bloque final incompleto; esto reduce la sobrecarga de indexación y mejora la localidad de memoria en secuencias largas. Combinado con Gated DeltaNet, QSA convierte a Qwen4-Exp en la primera arquitectura híbrida que integra atención lineal y dispersa, mejorando la eficiencia de inferencia en contextos largos. PLE enriquece capas seleccionadas del decodificador con características léxicas específicas de la capa derivadas de n-gramas de tokens y una convolución dilatada en profundidad.
GraniteSpeech5 (Granite Speech 5.0 Turbo CTC) es un codificador conformer ligero (~470M de parámetros) para reconocimiento automático del habla, entrenado con CTC sobre objetivos BPE. Solo requiere una pasada hacia adelante y decodificación greedy, sin decodificador autorregresivo. Incluye apilamiento de tramas y submuestreo temporal por bloques, atención por bloques con incrustaciones posicionales relativas de Shaw, y CTC auto-condicionada.
Step3p7 (Step-3.7-Flash) es un modelo de visión-lenguaje con una mezcla dispersa de expertos de 198B de parámetros, que combina un backbone de lenguaje MoE de 196B con un codificador de visión de 1.8B. Usa un decodificador MoE disperso con 288 expertos enrutados (top-8 por token), atención con compuertas, predicción multi-token y un codificador de visión estilo SigLIP con 2-D rotary embeddings.
CohereCompass es la arquitectura base para modelos pequeños y especializados de visión-lenguaje entrenados por Cohere.
Cambios importantes
Se ha reemplazado la implementación heredada de paralelismo tensor por un backend nativo basado en DTensor; los usuarios que dependían de la API anterior de TP para inferencia o entrenamiento deben migrar a la nueva interfaz. Además, ahora se soporta correctamente el despacho de attn_implementation="sdpa" para los modelos wav2vec2_conformer, wav2vec2-bert y SeamlessM4T/v2, lo que puede cambiar el comportamiento de inicialización. Por último, FuyuProcessor ya no devuelve la salida image_patch_indices, por lo que cualquier código que dependa de ese campo debe actualizarse.
Mejoras en caché
Se corrigieron varios errores relacionados con la caché, incluyendo un error de desfase en la caché de ventana deslizante, corrupción de caché en la decodificación especulativa de Whisper, fallos de uso de caché en CpmAnt y problemas de generación en Qwen2.5-Omni/Qwen3-Omni-MoE con cachés compilables. También se añadió documentación para eliminar tokens de caché usando valores negativos y se introdujo soporte para configuración de caché por capa, permitiendo que modelos con configuraciones heterogéneas utilicen distintos valores por capa para sliding_window, attention_chunk_size y number_of_conv_states.
Generación y atención
Se resolvieron múltiples errores de generación en varios modelos, como problemas de decodificación especulativa en Whisper (errores de variable local, corrupción de caché, regresión de velocidad e IDs de posición en lotes con relleno izquierdo), generación de imágenes rota en Emu3, salida basura en OLMo/GPTNeoX y generación en Qwen2.5-Omni/Qwen3-Omni-MoE con cachés compilables. También se alinearon las distribuciones de logits para generadores candidatos que usan muestreo.
En atención, se corrigieron errores como un tipográfico en la documentación de SigLIP2, fallos en pruebas de despacho Flash/SDPA para xcodec2 y GPUs ROCm RDNA, descarte silencioso de la máscara de atención cruzada en GPT2 y soporte SDPA en TimmWrapper. Además, se introdujo soporte para configuración de caché por capa y selección de máscara de atención.
Cuantización, paralelización y kernels
En cuantización, se añadió soporte para NVFP4 mediante kernels de HF, permitiendo cuantización de pesos BF16 sobre la marcha con una reducción de memoria de aproximadamente el 50%. Se corrigieron errores como una regresión en is_quantization_compressed que causaba diseños de módulos incorrectos, fallos de inicialización de pesos en CLIP con puntos de control cuantizados y restauración de la configuración de caché KV para modelos cuantizados solo en caché.
En paralelización, se introdujo un motor de inferencia paralela de tuberías (pipeline parallel) ingenuo que soporta incrustaciones de pesos atadas/no atadas con integración perfecta en generate(), y se restauró la compatibilidad hacia atrás para la API de paralelismo tensor con un ciclo de deprecación para tp_plan. También se corrigió un error de paralelismo de modelo en el modelo BLT que afectaba la búsqueda en haz.
En kernels, se actualizó la documentación de modelos soportados, se corrigió un fallo de exportación en funciones decoradas con kernel añadiendo una guarda is_torchdynamo_exporting, y se aumentó la versión predeterminada del kernel de Flash Attention 2 a v3 para resolver problemas de compatibilidad con versiones recientes de PyTorch.
Otras correcciones y mejoras
Se realizaron numerosas correcciones y mejoras en toda la biblioteca, incluyendo arreglos en pruebas de CI, documentación, procesadores de video, modelos específicos y utilidades varias. Entre ellas se destacan la corrección de conversión modular de video-llama, la adición de un límite opcional de píxeles por cuadro en el procesador de video Qwen3-VL, mejoras en la infraestructura de CI y de revisión de código, y la incorporación de nuevos modelos como ESMC y ESMFold2. También se actualizaron muchas pruebas de integración con valores esperados actualizados para diferentes GPUs y versiones de PyTorch.



