Hoy anunciamos la disponibilidad general de AWS Glue 6.0, que ofrece un precio un 30 % inferior al de versiones anteriores de AWS Glue e incorpora compatibilidad total con las funciones de Apache Iceberg v3. AWS Glue 6.0 se basa en un tiempo de ejecución totalmente modernizado, Apache Spark 4.1, Python 3.12 y Scala 2.13, lo que se traduce en un rendimiento más rápido.
Con esta versión, AWS Glue ofrece la implementación más completa de Iceberg v3 en cualquier servicio Spark totalmente gestionado y sin servidor, junto con nuevas capacidades que simplifican la creación de trabajos ETL, mejoran el rendimiento de PySpark y permiten el streaming en tiempo real con latencias de un solo dígito de milisegundos.
Novedades de AWS Glue 6.0
AWS Glue 6.0 ofrece la especificación completa de Apache Iceberg v3, basada en Iceberg 1.11.0. La característica principal es el tipo de datos VARIANT con soporte de fragmentación (shredding), que logra un rendimiento de lectura de consultas más rápido en comparación con las columnas de tipo cadena tradicionales para datos semiestructurados.
Con la fragmentación de VARIANT, se pueden almacenar y consultar datos JSON, registros y eventos sin necesidad de aplanar esquemas, lo que elimina copias duplicadas de datos, código de análisis personalizado y roturas de canalizaciones cuando cambian los esquemas. Esta capacidad transforma la forma en que los equipos manejan datos semiestructurados a gran escala.
Las capacidades adicionales de Iceberg v3 incluyen:
- Tipos de datos de geometría y geografía: habilitan el procesamiento espacial nativo para análisis SIG, inteligencia de ubicación y canalizaciones de datos geoespaciales directamente en Spark gestionado.
- Marcas de tiempo con precisión de nanosegundos: admiten datos de sensores IoT, computación científica y cargas de trabajo financieras de alta frecuencia que requieren una precisión superior a los milisegundos estándar.
- Gestión de tipos desconocidos: procesa datos con esquemas inesperados o en evolución sin fallos en las canalizaciones, lo que aporta resiliencia ante cambios de esquema en sistemas anteriores.
AWS Glue 6.0 también incluye la mejora más significativa de Spark 4.1, el motor de tiempo de ejecución moderno:
- Canalizaciones declarativas de Spark: Spark Declarative Pipelines introduce un enfoque simplificado para la creación de trabajos ETL. Los ingenieros de datos declaran las transformaciones, especificando cómo deben ser los datos, mientras que el motor determina automáticamente el orden de ejecución y la optimización. Esto reduce la complejidad del desarrollo de canalizaciones y elimina la sobrecarga de orquestación manual.
- UDF y UDTF de Python nativas de Arrow: AWS Glue 6.0 introduce la ejecución nativa de Arrow para funciones definidas por el usuario (UDF) y funciones de tabla definidas por el usuario (UDTF) de Python. Esto elimina la sobrecarga de serialización entre Python y la JVM, mejorando el rendimiento de PySpark en transformaciones complejas.
- Modo de streaming en tiempo real: para casos de uso de streaming sin estado, AWS Glue 6.0 introduce un modo de streaming en tiempo real que logra una latencia de un solo dígito de milisegundos. Basado en el modo en tiempo real de Spark 4.1 con ejecución optimizada para Glue, esta capacidad admite procesamiento de eventos en tiempo real, canalizaciones de transformación de datos de baja latencia y enrutamiento de datos sensibles al tiempo.
Cómo empezar con AWS Glue 6.0
No se requieren cambios en la API para usar AWS Glue 6.0. Puede seleccionar la nueva versión mediante el parámetro existente --glue-version en las API create-job o update-job a través de la interfaz de línea de comandos de AWS (AWS CLI), el SDK de AWS, AWS Glue Studio, Amazon SageMaker Unified Studio y su IDE preferido.
Para empezar a usar trabajos de AWS Glue 6.0 en la consola de AWS Glue Studio, abra el trabajo de AWS Glue y, en la pestaña Detalles del trabajo, elija la versión Glue 6.0: compatible con Spark 4.1, Scala 2 y Python 3. Puede crear nuevos trabajos de AWS Glue en AWS Glue 6.0 para beneficiarse de las mejoras o migrar sus trabajos existentes de AWS Glue.
Para comenzar a usar AWS Glue 6.0 en un cuaderno de AWS Glue Studio o en una sesión interactiva a través de un cuaderno de Jupyter, establezca 6.0 en el comando mágico %glue_version. También puede actualizar los trabajos existentes a Glue 6.0 mediante el agente de actualización de Spark en AWS Glue Studio o usar la función de actualización automática en sus trabajos de Glue existentes para actualizarlos automáticamente a Glue 6.0.
Para obtener más información, consulte los detalles de la versión de AWS Glue 6.0 y Migración de trabajos de AWS Glue para Spark a la versión 6.0 de AWS Glue en la documentación de AWS.
Disponibilidad
AWS Glue 6.0 está disponible con carácter general hoy mismo en todas las regiones de AWS donde opera AWS Glue. Para consultar la disponibilidad regional y la hoja de ruta futura, visite Capacidades de AWS por región. Si desea llamar a las API, buscar documentación, consultar la disponibilidad regional o solucionar problemas sobre esta nueva función, pruebe a utilizar el servidor AWS MCP y los complementos con su herramienta de IA preferida.
Se paga una tarifa por hora, facturada por segundo, por los rastreadores (descubrimiento de datos) y los trabajos de extracción, transformación y carga (ETL) (procesamiento y carga de datos). Para el catálogo de datos de AWS Glue, se paga una tarifa mensual simplificada por almacenar y acceder a los metadatos. El primer millón de objetos almacenados es gratuito, y el primer millón de accesos también es gratuito. Para obtener más información, visite la página de precios de AWS Glue.
Pruébelo en la consola de AWS Glue Studio y envíe sus comentarios a AWS re:Post para AWS Glue o a través de sus contactos habituales de soporte de AWS.
— Channy
Channy Yun (윤석찬)
Channy es el bloguero principal del blog de noticias de AWS y desarrollador principal defensor de AWS Cloud. Como entusiasta de la web abierta y bloguero de corazón, le encanta el aprendizaje impulsado por la comunidad y compartir tecnología.



