Patch-Release v5.14.1: Korrekturen für Inkling-Modell und weitere Optimierungen

imagem 8

Das neueste Patch-Release v5.14.1 behebt mehrere Probleme, die bei der Integration des Inkling-Modells aufgetreten sind. Insbesondere wurde ein Fehler korrigiert, der bei der assistierten Generierung mit Modellen auftrat, die einen EncoderDecoderCache verwenden. Ebenfalls behoben wurde ein Problem, das im Prefill-Schritt mit StaticCache und SDPA ohne Padding auftreten konnte, wenn das Inkling-Modell eine Positionsgewichtung (position_bias) nutzt.

Darüber hinaus enthält dieses Update eine Aktualisierung der FP8-Kernel-Version, um Stabilität und Leistung zu verbessern, sowie eine Fehlerbehebung für DeepGEMM, die eine korrekte Ausführung auf mehreren Geräten sicherstellt.

Schreibe einen Kommentar

Deine E-Mail-Adresse wird nicht veröffentlicht. Erforderliche Felder sind mit * markiert