Keyrus Group logo
Keyrus GroupPosted 1 week ago

Data Engineer (H/F/NB)

HybridBordeaux, Nouvelle-Aquitaine, France or Nantes, Pays de la Loire, France

Full TimeEnterprise

Job Summary

Design and industrialize robust data pipelines from raw input to application and agent exploitation. Deploy and operate modern data platforms (lakehouse, cloud warehouses) to ensure data accessibility, governance, and performance at scale. Prepare datasets for generative and agentic AI systems, including structuring for RAG and populating vector databases. Guarantee data quality, freshness, and traceability through automated tests and data contracts. Transform prototypes into executable proof-of-concepts to validate use cases before full pipeline industrialization. Deliver BI and dashboarding where required. Work with AI Engineers and Foundations Architects to expose data to models, applying rigorous engineering standards for reliability and documentation.

Required Qualifications

  • Une expérience significative de conception et d'industrialisation de pipelines de données en production
  • Une pratique avérée des plateformes data modernes (cloud ou lakehouse), au-delà de l'ETL traditionnel
  • Une expérience, si possible, de préparation de données au service de systèmes d'IA générative ou agentique
  • Une rigueur d'ingénierie sur la qualité et la fiabilité de la donnée
  • Une curiosité pour les usages permis par la donnée que vous préparez
  • Une capacité à collaborer avec l'AI Engineer et le Foundations Architect sur l'exposition de la donnée aux modèles et aux agents
  • Une autonomie réelle pour transformer un besoin encore mal défini en preuve de concept exploitable
  • Une capacité à produire, documenter et transmettre les pipelines que vous construisez
  • Maîtrise avancée de SQL
  • Maîtrise d'un langage de pipeline en profondeur : Python en priorité, Java ou Scala selon l'écosystème (Spark, Kafka)
  • Mise en œuvre de traitements distribués avec Apache Spark
  • Orchestration de pipelines de données avec Airflow ou Dagster
  • Transformation de données industrialisée avec dbt
  • Déploiement et exploitation de plateformes data cloud (Snowflake, BigQuery, Databricks)
  • Conception d'architectures de streaming et de traitement de données en temps réel (Kafka)
  • Utilisation de bases de données vectorielles pour des cas d'usage RAG (Pinecone, Milvus, Chroma, ou équivalent)
  • Compréhension pratique du prompting et de la préparation de jeux de données pour l'évaluation de modèles de langage
  • Mise en place de tests et de contrats de données pour garantir la qualité et l'observabilité de la donnée
  • Modélisation et préparation de données pour des usages analytiques et opérationnels
  • Prototypage rapide à l'aide d'outils légers (Streamlit)
  • Anglais professionnel courant, à l'écrit comme à l'oral

Desired Qualifications

  • Une expérience, si possible, de préparation de données au service de systèmes d'IA générative ou agentique

Hiring someone like this?

Get your role in front of qualified candidates on Sorce.

Get started

Apply to this job in one click with Sorce

Apply on Sorce