Détails de l'offre
Dans le cadre du renforcement de son équipe Data, nous recherchons des Data Engineers
confirmés. L'équipe Data intervient sur la construction et l'industrialisation de pipelines de
données au sein d'une architecture de type Data Mesh, avec des exigences fortes de qualité, de
performance et de documentation.
MISSIONS PRINCIPALES
• Concevoir, développer et industrialiser des pipelines de traitement de données avec Python,
Spark et Scala.
• Contribuer à l'architecture Data Mesh du client, organisée en couches Bronze, Silver et Gold.
• Mettre en place et optimiser le stockage objet des données sur MinIO.
• Modéliser et partitionner les données sur PostgreSQL pour garantir performance et scalabilité.
• Structurer les données au format Parquet dans une logique d'optimisation du stockage et des
requêtes.
• Exposer et requêter les données via SQL fédéré à l'aide de Trino / Starburst.
• Participer à l'exploitation et au déploiement des services sur une infrastructure conteneurisée
pilotée via Rancher, dans un environnement Cloud.
• Mettre en œuvre des flux de streaming et de capture de changement de données (Kafka,
Debezium) et orchestrer les traitements avec Airflow.
• Rédiger la documentation technique et les documents de présentation de chaque contexte /
domaine de données.
• Contribuer aux bonnes pratiques d'ingénierie data (qualité, tests, standards de code, revue de
code).
STACK TECHNIQUE
• Langages : Python, Scala
• Traitement de données : Apache Spark
• Stockage objet : MinIO
• Base de données : PostgreSQL (partitionnement de tables)
• Format de données : Parquet
• Architecture : Data Mesh (Bronze / Silver / Gold)
• Requêtage SQL fédéré : Trino
• Orchestration de workflows : Apache Airflow
• Streaming & CDC (Change Data Capture) : Kafka, Debezium
• Conteneurisation / orchestration : Rancher (SUSE), Kubernetes
• Cloud : environnement Cloud public, stockage objet compatible S3, gestion des identités et accès
(IAM)
• CI/CD & Infrastructure as Code : GitLab CI, Terraform
• Observabilité : Prometheus, Grafana, centralisation des logs
• Gouvernance & catalogage des données : outils de data catalog
• Versioning : Git
• Documentation : rédaction de documents de présentation par contexte / domaine
PROFIL RECHERCHÉ
• Formation Bac+5 (école d'ingénieur, université) en informatique, data ou équivalent.
• 4 ans d'expérience minimum en tant que Data Engineer sur des environnements de production.
• Maîtrise de Python et Scala, et bonne connaissance d'Apache Spark.
• Expérience concrète des architectures Data Mesh (Bronze / Silver / Gold) et des lacs / entrepôts
de données.
• Connaissance de Trino pour le requêtage SQL fédéré.
• Bonne maîtrise de PostgreSQL, notamment le partitionnement de tables.
• À l'aise avec les environnements conteneurisés et orchestrés (Kubernetes, Rancher).
• Bonnes capacités rédactionnelles pour la documentation technique.
• Autonomie, rigueur, esprit d'équipe et capacité à s'intégrer rapidement chez le client.
CV et LM à [Connectez-vous pour voir les contacts]
