AWS Glue 6.0 : ce qui change vraiment pour les pipelines de données
Une mise à jour majeure, avec un signal prix très clair
AWS a annoncé la disponibilité générale d’AWS Glue 6.0 le 21 août 2026. Pour les équipes qui exploitent Glue comme moteur ETL managé sur Spark, cette version se distingue d’abord par un point très concret : selon AWS, elle apporte une baisse de prix de 30 % par rapport aux versions précédentes d’AWS Glue.
Ce positionnement tarifaire compte autant que les nouveautés techniques. Glue est souvent au cœur de chaînes de transformation récurrentes, de traitements batch volumineux et de flux de streaming. Une réduction de coût à ce niveau peut donc peser directement sur le budget data platform, surtout dans les environnements où les jobs Spark tournent en continu ou à forte fréquence.
AWS indique aussi que Glue 6.0 est disponible dans toutes les régions où le service opère, y compris les régions AWS Commercial, AWS GovCloud (US) et AWS China.
Un runtime modernisé pour les jobs Spark
Sur le plan technique, Glue 6.0 met à jour son socle d’exécution. AWS le présente comme un runtime modernisé basé sur Apache Spark 4.1, Python 3.12 et Scala 2.13. La documentation de versions précise plus finement la prise en charge de Spark 4.1.1, Python 3.13, Scala 2.13.17 et Java 17.
Pour les développeurs, cela signifie d’abord un alignement avec des versions plus récentes des langages et du moteur de calcul. C’est important pour la compatibilité des bibliothèques, la maintenance du code et l’accès aux améliorations de performance de l’écosystème Spark.
Autre point pratique : AWS précise qu’aucun changement d’API n’est nécessaire pour utiliser Glue 6.0. En revanche, il faut explicitement choisir la version lors de l’ajout ou de la mise à jour d’un job. La documentation rappelle aussi que AWS Glue 5.1 reste la version par défaut pour les jobs créés sans paramètre de version.
Apache Iceberg v3 devient un argument central
Le cœur du message produit d’AWS autour de Glue 6.0 est le support complet d’Apache Iceberg v3. AWS indique que l’implémentation repose sur Iceberg 1.11.0 et couvre la spécification complète de la version 3.
Concrètement, cela ajoute plusieurs capacités attendues dans les architectures lakehouse. La plus mise en avant est le type de données VARIANT avec support du shredding. Selon AWS, cette approche améliore les performances de lecture des requêtes sur les données semi-structurées par rapport à des colonnes stockées comme simples chaînes de caractères.
Glue 6.0 ajoute aussi les deletion vectors, utiles pour les mises à jour ligne par ligne à haute performance, ainsi que le suivi de lignée au niveau des lignes. La version prend également en charge les horodatages à la nanoseconde, les types géospatiaux et la gestion du type UNKNOWN pour mieux absorber les schémas inattendus ou évolutifs sans faire échouer les pipelines.
Pour les équipes data, l’intérêt est double : mieux traiter les données semi-structurées et réduire la fragilité des pipelines face aux changements de schéma en amont. Dans les environnements IoT, scientifiques, financiers ou géospatiaux, les nouveaux types pris en charge peuvent aussi éviter des contournements coûteux dans le code ETL.
Les autres formats de table ouverts progressent aussi
Glue 6.0 ne se limite pas à Iceberg. La documentation AWS indique une mise à jour des formats de table ouverts vers Hudi 1.1.1, Iceberg 1.11.0 et Delta Lake 4.2.0.
Ce point intéresse les plateformes qui doivent cohabiter avec plusieurs formats selon les équipes, les moteurs de calcul ou l’historique technique. Même si AWS met surtout en avant Iceberg v3, la mise à jour simultanée de Hudi et Delta Lake montre que Glue 6.0 vise plus largement les environnements lakehouse hétérogènes.
Productivité : moins d’orchestration manuelle, plus de modes d’exécution
AWS ajoute plusieurs fonctions orientées productivité. La plus structurante est Spark Declarative Pipelines, présenté comme un moyen de simplifier l’écriture ETL de manière déclarative en SQL et en Python. L’idée est de réduire le code d’orchestration répétitif autour des transformations Spark.
Glue 6.0 introduit aussi l’exécution native Arrow pour les Python UDFs et UDTFs, ce qui vise à améliorer les performances côté PySpark. Pour les équipes qui s’appuient fortement sur Python dans leurs transformations personnalisées, c’est une évolution potentiellement importante.
Autre ajout : Spark Connect pour les sessions interactives. Et pour la gestion des dépendances Python, Glue 6.0 prend en charge un environnement virtuel Python géré par le client via l’option --python-virtual-env.
Ces nouveautés s’inscrivent dans un contexte où Glue Studio propose déjà plusieurs modes de création de jobs : interface visuelle, notebook de code interactif ou éditeur de scripts. Dans cet éditeur, il est possible de choisir entre Python shell, Ray, Spark (Python) et Spark (Scala). Les nouveaux scripts y sont codés en Python par défaut, et un job Spark s’exécute dans un environnement Apache Spark géré par AWS Glue.
Streaming temps réel : utile, mais ciblé
Glue 6.0 ajoute un mode temps réel pour les cas d’usage de streaming sans état. AWS évoque une latence de l’ordre de la milliseconde, et dans son billet de lancement parle même d’une latence à un chiffre de millisecondes pour ces traitements stateless.
La nuance est importante : cette capacité vise les flux sans état, pas l’ensemble des scénarios de streaming complexes. Pour les pipelines d’enrichissement léger, de filtrage ou de transformation immédiate, ce mode peut réduire l’écart entre ETL managé et besoins quasi temps réel. Pour des traitements avec état plus avancés, les détails fournis ici restent limités.
Ce qu’il faut vérifier avant une migration
Le passage à Glue 6.0 n’implique pas de changement d’API, mais il ne faut pas en conclure qu’une migration est totalement transparente. La documentation signale plusieurs changements de plateforme à examiner.
-
AWS SDK for Java v2est désormais le seul pris en charge ; la version v1 est supprimée. -
EMRFSest retiré etS3Adevient l’unique connecteur S3. -
La montée de version du runtime vers Spark 4.1, Python 3.13 et Java 17 peut avoir des effets sur les dépendances, les bibliothèques tierces et les comportements d’exécution.
Il faut aussi replacer cette sortie dans le cycle de vie des anciennes versions. AWS indique que AWS Glue 0.9, 1.0 et 2.0 ont atteint leur fin de vie le 1er avril 2026. Pour les organisations encore attachées à des jobs anciens, Glue 6.0 s’inscrit donc dans un mouvement plus large de modernisation forcée.
À qui s’adresse vraiment Glue 6.0 ?
Cette version parlera d’abord à trois profils. D’abord, les équipes plateforme qui cherchent à réduire les coûts d’exécution sans changer d’outil. Ensuite, les équipes lakehouse qui misent sur Apache Iceberg v3 et veulent exploiter ses nouvelles capacités directement dans un service managé. Enfin, les développeurs Spark et PySpark qui ont besoin d’un runtime plus récent, d’un meilleur support Python et d’options de développement plus souples.
En pratique, Glue 6.0 n’est pas seulement une mise à jour incrémentale. Entre la baisse de prix annoncée, le support complet d’Iceberg v3, les améliorations de productivité et les changements de runtime, AWS repositionne Glue comme une brique plus compétitive pour les pipelines de données modernes sur son cloud.
À retenir
- AWS Glue 6.0 est disponible en disponibilité générale depuis le 21 août 2026.
- Selon AWS, cette version réduit les prix de 30 % par rapport aux versions précédentes.
- Le support complet d’Apache Iceberg v3 est l’évolution la plus structurante, avec VARIANT, deletion vectors, types géospatiaux et timestamps à la nanoseconde.
- Le runtime évolue vers Spark 4.1.x, Python 3.13, Scala 2.13.17 et Java 17 selon la documentation AWS.
- La migration demande une vérification des dépendances, notamment à cause du passage à AWS SDK for Java v2 et du retrait d’EMRFS au profit de S3A.
Sources
- AWS Glue 6.0 now available with 30% lower price and full Apache Iceberg v3 support | Amazon Web Services — aws.amazon.com, 21 août 2026
- AWS Glue versions – AWS Glue — docs.aws.amazon.com
- AWS Glue 6.0 delivers 30% price reduction and Iceberg v3 support – AWS — aws.amazon.com
- Starting visual ETL jobs in AWS Glue Studio – AWS Glue — docs.aws.amazon.com