Développeur Data Lake / Data Engineer en Freelance - France
--Casablanca ou Rabat--
Ref. : 006796
Contexte :
Dans le cadre de notre projet, nous recherchons deux Développeurs Data Lake / Data Engineers expérimentés pour renforcer l’équipe Data et sécuriser la livraison des projets stratégiques ainsi que la mise en place de la nouvelle plateforme Databricks. Le consultant intégrera l’équipe IT Data en charge des spécifications, de la conception et de la réalisation des modules nécessaires à la mise en production dans le data lake, ainsi que des premiers cas d’usage Databricks. L’équipe travaille en mode agile, au plus près des métiers et en coordination avec les autres équipes IT. La mission se déroule dans un contexte anglophone : la maîtrise de l’anglais est obligatoire.
Type de contrat : Freelance
Démarrage : ASAP
Durée : 3 mois renouvelables
Localisation : Montrouge présentiel
Secteur : Bancaire / Asset Servicing
Langue : Anglais obligatoire
Missions :
Concevoir et implémenter des pipelines d’ingestion et de transformation de données (batch et temps réel), robustes et scalables
Développer et maintenir les flux ETL Talend qui alimentent le data lake et les systèmes consommateurs
Développer des traitements Python / PySpark sur Databricks et mettre en œuvre les modèles de données cibles
Automatiser les transformations, la documentation et les tests de données avec dbt
Configurer les pipelines d’acheminement des données, y compris les flux CDC
Mettre en place les bonnes pratiques de qualité de données, de monitoring, d’alerting et de logging
Développer des modules réutilisables (templates de pipelines, librairies communes, CI/CD) et exploiter les modules existants dans les nouveaux projets
Réaliser les développements et les tests associés, et accompagner les mises en production
Profil recherché :
Développeur Data Lake expérimenté
Solide maîtrise de l’ETL Talend (développement, debug, industrialisation) et connaissance du langage Java
Bonne maîtrise de Python et PySpark
Expérience significative sur Databricks (jobs, workflows, Delta Lake, notebooks, optimisation)
Très bonne maîtrise de SQL (requêtes analytiques complexes, optimisation)
Pratique de dbt pour les modèles analytiques
Connaissance des outils CDC (Qlik Replicate est un plus)
Connaissance des plateformes de streaming (Kafka est un plus)
Expérience DevOps : CI/CD, versioning Git, automatisation des tests et des déploiements
Pratique des outils d’IA générative pour accélérer le développement (génération assistée de code PySpark, Python et SQL, refactoring, tests), avec une revue critique et une compréhension fine du code mis en production
Anglais obligatoire (contexte anglophone)
Compétences clés :
ETL Talend, Java
Python, PySpark
Databricks (jobs, workflows, Delta Lake, notebooks)
SQL avancé
dbt
CDC (Qlik Replicate un plus)
Streaming (Kafka un plus)
DevOps (CI/CD, Git, tests automatisés)
IA générative appliquée au développement
Soft skills :
Rigueur et fiabilité, goût pour le code propre et l’industrialisation
Autonomie et esprit d’initiative
Fort esprit analytique
Capacité à évoluer dans un environnement exigeant
Innovation et état d’esprit agile
Très bon relationnel et sens du client