Por Channy Yun (윤석찬) em 21 de agosto de 2026
Hoje, anunciamos a disponibilidade geral do AWS Glue 6.0, com preços 30% menores do que as versões anteriores do AWS Glue e suporte completo aos recursos do Apache Iceberg v3. O AWS Glue 6.0 é construído sobre um runtime totalmente modernizado: Apache Spark 4.1, Python 3.12 e Scala 2.13, entregando desempenho mais rápido.
Com este lançamento, o AWS Glue oferece a implementação mais completa do Iceberg v3 em qualquer serviço Spark totalmente serverless gerenciado, juntamente com novas capacidades que simplificam a autoria de ETL, melhoram o desempenho do PySpark e habilitam streaming em tempo real com latência de milissegundos de um dígito.
O que há de novo no AWS Glue 6.0
O AWS Glue 6.0 entrega a especificação completa do Apache Iceberg v3, baseada no Iceberg 1.11.0. O recurso de destaque é o tipo de dados VARIANT com suporte a shredding, que alcança desempenho de leitura de consultas mais rápido em comparação com colunas tradicionais do tipo string para dados semiestruturados.
Com o shredding de VARIANT, você pode armazenar e consultar JSON, logs e dados de eventos sem nivelar esquemas, eliminando cópias duplicadas de dados, código de parsing personalizado e quebras de pipeline quando os esquemas mudam. Essa capacidade transforma a forma como as equipes lidam com dados semiestruturados em escala.
Capacidades adicionais do Iceberg v3 incluem:
- Tipos de dados Geometry e Geography: habilitam processamento espacial nativo para análises GIS, inteligência de localização e pipelines de dados geoespaciais diretamente no Spark gerenciado.
- Timestamps com precisão de nanossegundos: suportam dados de sensores IoT, computação científica e cargas de trabalho financeiras de alta frequência que exigem precisão além dos milissegundos padrão.
- Tratamento de tipos desconhecidos: processa dados com esquemas inesperados ou em evolução sem falhas de pipeline, fornecendo resiliência contra mudanças de esquema upstream.
O AWS Glue 6.0 também inclui a atualização mais significativa no Spark 4.1, o motor de runtime moderno:
- Pipelines declarativos do Spark: o Spark Declarative Pipelines introduz uma abordagem simplificada para autoria de ETL. Os engenheiros de dados declaram transformações, especificando como os dados devem ficar, enquanto o motor determina automaticamente a ordem de execução e a otimização. Isso reduz a complexidade do desenvolvimento de pipelines e elimina a sobrecarga de orquestração manual.
- UDFs e UDTFs Python nativas em Arrow: o AWS Glue 6.0 introduz execução nativa em Arrow para Funções Definidas pelo Usuário (UDFs) e Funções de Tabela Definidas pelo Usuário (UDTFs) em Python. Isso elimina a sobrecarga de serialização entre Python e a JVM, melhorando o desempenho do PySpark para transformações complexas.
- Modo de streaming em tempo real: para casos de uso de streaming sem estado, o AWS Glue 6.0 introduz um modo de streaming em tempo real que alcança latência de milissegundos de um dígito. Construído sobre o Modo de Tempo Real do Spark 4.1 com execução otimizada pelo Glue, essa capacidade suporta processamento de eventos em tempo real, pipelines de transformação de dados de baixa latência e roteamento de dados sensíveis ao tempo.
Começando com o AWS Glue 6.0
Nenhuma mudança de API é necessária para usar o AWS Glue 6.0. Você pode selecionar a nova versão usando o parâmetro existente --glue-version nas APIs create-job ou update-job por meio da AWS Command Line Interface (AWS CLI), AWS SDK, AWS Glue Studio, Amazon SageMaker Unified Studio e seu IDE preferido.
Para começar com jobs do AWS Glue 6.0 no console do AWS Glue Studio, abra o job do AWS Glue e, na guia Detalhes do Job, escolha a versão Glue 6.0 – Supports Spark 4.1, Scala 2, Python 3. Você pode criar novos jobs do AWS Glue no AWS Glue 6.0 para se beneficiar das melhorias ou migrar seus jobs existentes do AWS Glue.
Para começar a usar o AWS Glue 6.0 em um notebook do AWS Glue Studio ou em uma sessão interativa por meio de um notebook Jupyter, defina 6.0 no magic %glue_version. Você também pode atualizar jobs existentes para o Glue 6.0 usando o Spark upgrade agent no AWS Glue Studio ou usar o recurso de auto-upgrade em seus jobs Glue existentes para atualizá-los automaticamente para o Glue 6.0.
Para saber mais, visite a página de detalhes da versão AWS Glue 6.0 e o guia Migrating AWS Glue for Spark jobs to AWS Glue version 6.0 na documentação da AWS.
Disponível agora
O AWS Glue 6.0 está geralmente disponível hoje em todas as regiões da AWS onde o AWS Glue opera. Para disponibilidade regional e um roteiro futuro, visite AWS Capabilities by Region. Se você quiser chamar APIs, pesquisar documentação, encontrar disponibilidade regional e verificar a solução de problemas sobre este novo recurso, experimente usar o AWS MCP Server e plugins com sua ferramenta de IA preferida.
Você paga uma taxa horária, cobrada por segundo, para crawlers (descoberta de dados) e jobs de extração, transformação e carga (ETL) (processamento e carregamento de dados). Para o AWS Glue Data Catalog, você paga uma taxa mensal simplificada para armazenar e acessar os metadados. O primeiro milhão de objetos armazenados é gratuito, e o primeiro milhão de acessos é gratuito. Para saber mais, visite a página de preços do AWS Glue.
Experimente no console do AWS Glue Studio e envie feedback para o AWS re:Post para AWS Glue ou através de seus contatos de suporte habituais da AWS.
— Channy
Channy Yun (윤석찬) é Lead Blogger do AWS News Blog e Principal Developer Advocate para AWS Cloud. Como entusiasta da web aberta e blogueiro de coração, ele adora o aprendizado orientado pela comunidade e o compartilhamento de tecnologia.



