Von Channy Yun (윤석찬), 21. August 2026
Heute geben wir die allgemeine Verfügbarkeit von AWS Glue 6.0 bekannt. Die neue Version bietet eine um 30 Prozent niedrigere Preisgestaltung als frühere AWS-Glue-Versionen und führt die vollständige Unterstützung für Apache Iceberg v3 ein. AWS Glue 6.0 basiert auf einer vollständig modernisierten Laufzeitumgebung – Apache Spark 4.1, Python 3.12 und Scala 2.13 – und liefert so eine höhere Performance.
Mit diesem Release stellt AWS Glue die vollständigste Iceberg-v3-Implementierung auf einem vollständig serverlos verwalteten Spark-Dienst bereit. Hinzu kommen neue Funktionen, die die ETL-Erstellung vereinfachen, die PySpark-Performance verbessern und Echtzeit-Streaming mit Latenzzeiten im einstelligen Millisekundenbereich ermöglichen.
Was ist neu in AWS Glue 6.0?
AWS Glue 6.0 liefert die vollständige Apache-Iceberg-v3-Spezifikation auf Basis von Iceberg 1.11.0. Das herausragende Merkmal ist der VARIANT-Datentyp mit Shredding-Unterstützung, der im Vergleich zu herkömmlichen String-Spalten bei semi-strukturierten Daten eine schnellere Leseperformance bei Abfragen ermöglicht.
Mit VARIANT-Shredding können Sie JSON-, Log- und Ereignisdaten speichern und abfragen, ohne Schemas zu vereinfachen (flattening). Dadurch entfallen doppelte Datenkopien, benutzerdefinierter Parsing-Code und Pipeline-Ausfälle bei Schemaänderungen. Diese Funktion verändert die Art und Weise, wie Teams semi-strukturierte Daten in großem Maßstab verarbeiten.
Weitere Iceberg-v3-Funktionen umfassen:
- Geometrie- und Geografie-Datentypen: Ermöglichen native räumliche Verarbeitung für GIS-Analysen, Location Intelligence und Geodaten-Pipelines direkt auf dem verwalteten Spark.
- Zeitstempel mit Nanosekunden-Präzision: Unterstützen IoT-Sensordaten, wissenschaftliches Rechnen und hochfrequente Finanz-Workloads, die eine Präzision jenseits der üblichen Millisekunden erfordern.
- Umgang mit unbekannten Typen: Verarbeiten Sie Daten mit unerwarteten oder sich weiterentwickelnden Schemas ohne Pipeline-Ausfälle und schaffen Sie so Resilienz gegenüber Änderungen im Upstream-Schema.
AWS Glue 6.0 enthält außerdem die bedeutendste Neuerung in Spark 4.1, der modernen Runtime-Engine:
- Spark Declarative Pipelines: Spark Declarative Pipelines führt einen vereinfachten Ansatz für die ETL-Erstellung ein. Dateningenieure deklarieren Transformationen und geben an, wie die Daten aussehen sollen, während die Engine die Ausführungsreihenfolge und Optimierung automatisch bestimmt. Dies reduziert die Komplexität der Pipeline-Entwicklung und eliminiert manuellen Orchestrierungsaufwand.
- Arrow-native Python-UDFs und -UDTFs: AWS Glue 6.0 führt eine Arrow-native Ausführung für benutzerdefinierte Python-Funktionen (UDFs) und benutzerdefinierte Tabellenfunktionen (UDTFs) ein. Dadurch entfällt der Serialisierungs-Overhead zwischen Python und der JVM, was die PySpark-Performance bei komplexen Transformationen verbessert.
- Echtzeit-Streaming-Modus: Für zustandslose Streaming-Anwendungsfälle führt AWS Glue 6.0 einen Echtzeit-Streaming-Modus ein, der Latenzzeiten im einstelligen Millisekundenbereich erreicht. Aufbauend auf dem Real-Time Mode von Spark 4.1 mit Glue-optimierter Ausführung unterstützt diese Funktion die Echtzeit-Ereignisverarbeitung, Pipelines zur Datentransformation mit geringer Latenz und zeitkritisches Daten-Routing.
Erste Schritte mit AWS Glue 6.0
Für die Nutzung von AWS Glue 6.0 sind keine API-Änderungen erforderlich. Sie können die neue Version über den vorhandenen Parameter –glue-version in den create-job- oder update-job-APIs auswählen – über die AWS Command Line Interface (AWS CLI), das AWS SDK, AWS Glue Studio, Amazon SageMaker Unified Studio und Ihre bevorzugte IDE.
Um mit AWS Glue 6.0-Jobs in der AWS Glue Studio-Konsole zu beginnen, öffnen Sie den AWS Glue-Job und wählen Sie auf der Registerkarte Job Details die Version Glue 6.0 – Supports Spark 4.1, Scala 2, Python 3. Sie können neue AWS Glue-Jobs auf AWS Glue 6.0 erstellen, um von den Verbesserungen zu profitieren, oder Ihre bestehenden AWS Glue-Jobs migrieren.
Um AWS Glue 6.0 in einem AWS Glue Studio-Notebook oder einer interaktiven Sitzung über ein Jupyter-Notebook zu verwenden, setzen Sie 6.0 im %glue_version-Magic. Sie können bestehende Jobs auch mit dem Spark Upgrade Agent in AWS Glue Studio auf Glue 6.0 aktualisieren oder die Funktion zur automatischen Aktualisierung in Ihren bestehenden Glue-Jobs nutzen, um sie automatisch auf Glue 6.0 umzustellen.
Weitere Informationen finden Sie in den AWS-Dokumentationsseiten „AWS Glue 6.0 version detail“ und „Migrating AWS Glue for Spark jobs to AWS Glue version 6.0“.
Jetzt verfügbar
AWS Glue 6.0 ist ab sofort in allen AWS-Regionen allgemein verfügbar, in denen AWS Glue betrieben wird. Informationen zur regionalen Verfügbarkeit und zur zukünftigen Roadmap finden Sie unter AWS Capabilities by Region. Wenn Sie APIs aufrufen, die Dokumentation durchsuchen, die regionale Verfügbarkeit prüfen oder Fehlerbehebungen zu dieser neuen Funktion suchen möchten, nutzen Sie den AWS MCP Server und Plugins mit Ihrem bevorzugten KI-Tool.
Sie zahlen einen Stundensatz, der sekundengenau abgerechnet wird, für Crawler (Datenerkennung) und ETL-Jobs (Datenverarbeitung und -laden). Für den AWS Glue Data Catalog zahlen Sie eine vereinfachte monatliche Gebühr für das Speichern und Abrufen der Metadaten. Die erste Million gespeicherter Objekte ist kostenlos, ebenso die erste Million Zugriffe. Weitere Informationen finden Sie auf der Seite AWS Glue Pricing.
Probieren Sie es in der AWS Glue Studio-Konsole aus und senden Sie Feedback über AWS re:Post für AWS Glue oder über Ihre üblichen AWS-Support-Kontakte.
— Channy
Channy Yun (윤석찬) ist Lead Blogger des AWS News Blog und Principal Developer Advocate für AWS Cloud. Als Open-Web-Enthusiast und Blogger aus Leidenschaft liebt er gemeinschaftliches Lernen und den Austausch von Technologie.



