Pré Embauche - Tech Lead Expert Data Retrieval Rag H/F

collectivite

  • La Courneuve - 93
  • Freelance
  • 6 mois
  • Bac +3, Bac +4
  • Bac +5
  • Services aux Entreprises
Lire dans l'app

Les compétences pour ce job

  • Anglais
  • Python

Détail du poste

Information importante

Type de contrat: Freelance

Taux journalier : Salaire selon profil

Localisation : La Courneuve, France

Date de démarrage :

Urgent

Mode de travail : Hybride

Publié le : 20 juillet 2026

Le besoin

Nous recherchons un(e) Expert(e) Data & Information Retrieval pour rejoindre l'équipe AI Service d'un acteur majeur des services numériques et de l'information professionnelle.

Important : cette opportunité s'inscrit dans le cadre d'une préembauche, avec une mission de transition de six mois maximum avant intégration en CDI.

La mission

Vous participerez à la construction du socle Data et Retrieval alimentant plusieurs produits d'intelligence artificielle à l'échelle européenne.

Votre rôle sera de concevoir et d'industrialiser des pipelines capables de collecter, nettoyer, structurer et indexer d'importants corpus documentaires, puis d'exposer une recherche rapide et pertinente combinant recherche lexicale et sémantique.

Vous interviendrez à un moment structurant du projet et pourrez challenger les choix technologiques ainsi que l'architecture cible.

Vos responsabilités

  • Concevoir les pipelines de collecte, parsing, nettoyage, chunking et normalisation de documents.

  • Industrialiser la génération d'embeddings et l'alimentation des bases vectorielles.

  • Garantir la fraîcheur, la traçabilité et le versioning des corpus et des index.

  • Combiner recherche lexicale et sémantique : BM25, embeddings, filtres et reranking.

  • Structurer la phase de retrieval alimentant les LLM : contexte, citations, déduplication et fenêtres de contexte.

  • Construire des jeux de tests et mesurer la pertinence avec des métriques comme recall, precision, nDCG et MRR.

  • Assurer la scalabilité, l'observabilité et la sécurité des pipelines.

  • Promouvoir les bonnes pratiques de développement, les tests automatisés et la qualité du code.

  • Accompagner les équipes et transmettre votre expertise Data, Search et IA.

Profil recherché

  • Expérience confirmée en Data Engineering et Information Retrieval sur des systèmes en production.

  • Très bonne maîtrise de Python.

  • Expertise en indexation, embeddings et recherche hybride.

  • Expérience des corpus documentaires volumineux et hétérogènes.

  • Capacité à mesurer, analyser et améliorer la pertinence d'un moteur de recherche.

  • Connaissance des architectures RAG et bonne compréhension des LLM.

  • Expérience des pipelines reproductibles, de la qualité des données, du lineage et du versioning.

  • Capacité à challenger une architecture et à exercer un leadership technique.

  • Anglais courant, dans un contexte européen quotidien.

  • Volonté de rejoindre durablement l'entreprise à l'issue de la mission.

Environnement technique cible

  • Python 3.11+, Go et éventuellement Java.

  • PostgreSQL, pgvector, Weaviate, Qdrant ou OpenSearch.

  • BM25, embeddings, sentence-transformers et reranking.

  • LangChain, OpenAI, Mistral ou AWS Bedrock.

  • Airflow, Spark, Kafka, Redis.

  • Docker, Kubernetes et CI/CD.

  • Pytest et outils d'évaluation du retrieval.

La stack reste ouverte : nous recherchons une personne capable de recommander les solutions les plus adaptées, pas simplement d'appliquer des choix déjà établis.

Pourquoi rejoindre le projet ?

  • Participer à des décisions d'architecture structurantes.

  • Construire un socle utilisé par plusieurs produits et équipes européennes.

  • Travailler sur des corpus documentaires massifs et à forte valeur métier.

  • Industrialiser des usages IA avec de véritables exigences de pertinence, de traçabilité et de sécurité.

  • Intégrer durablement une équipe d'experts spécialisée dans l'IA.

Profil recherché

Profil recherché

Formation : Master, diplôme d'ingénieur, PhD ou équivalent.

Expérience : expérience confirmée en Data Engineering et Information Retrieval sur des systèmes à forte volumétrie en production.

Stack cible - ouverte à vos recommandations

  • Langages : Python 3.11+ indispensable ; Go apprécié ; Java constitue un plus.

  • Indexation : pgvector, Weaviate, Qdrant, OpenSearch ou technologie équivalente ; recherche hybride et BM25.

  • Embeddings et NLP : sentence-transformers, modèles d'embeddings, tokenisation, parsing et chunking de documents.

  • RAG et LLM : architectures RAG, reranking, LangChain, OpenAI, Mistral, AWS Bedrock ou équivalent.

  • Data et infrastructure : PostgreSQL, Airflow, Spark, Kafka, Redis, Docker, Kubernetes et CI/CD.

  • Tests et évaluation : Pytest, jeux de référence et métriques de pertinence telles que recall, precision, nDCG et MRR.

Compétences attendues

  • Capacité à concevoir des pipelines robustes de collecte, nettoyage, normalisation et indexation de corpus documentaires massifs.

  • Maîtrise de l'indexation, des embeddings, de la recherche hybride et des techniques de reranking.

  • Capacité à mesurer, analyser et améliorer la pertinence d'un moteur de recherche.

  • Solide culture Data : pipelines reproductibles, qualité, lignage, traçabilité et versioning des datasets et des index.

  • Bonne compréhension du NLP, des embeddings et du fonctionnement des LLM, sans nécessairement être spécialiste de leur serving.

  • Expérience de l'industrialisation et de l'exploitation de systèmes Data ou IA en production.

  • Anglais courant, dans un contexte européen quotidien.

Soft skills

  • Vision Produit : comprendre les enjeux métiers afin de prioriser les fonctionnalités et gérer le moteur de recherche comme un véritable produit utilisé par d'autres équipes.

  • Leadership technique et pédagogie : challenger les choix d'architecture, transmettre son expertise et diffuser les bonnes pratiques Data, Retrieval et IA.

  • Exigence de qualité : porter une attention particulière à la pertinence des résultats, à la sécurité des données et à la fiabilité des services.

  • Esprit d'innovation : assurer une veille active sur les évolutions de l'IA, du NLP et des technologies de recherche.

  • Communication : savoir expliquer et vulgariser des problématiques techniques complexes auprès d'interlocuteurs variés.

Important : cette opportunité s'inscrit dans une démarche de préembauche. Le profil recherché doit souhaiter rejoindre durablement l'entreprise à l'issue d'une mission de six mois maximum.

Infos complémentaires

Salaire selon profil

Publiée le 20/07/2026 - Réf : d21be2b4e900b5adec39df517dd578f0

Postuler
Créez votre compte
Hellowork et postulez

sur le site du partenaire !

Ces offres pourraient aussi
vous intéresser

GutiLab recrutement
Paris - 75
CDI
35 000 - 49 500 € / an
Télétravail occasionnel
Voir l’offre
il y a 8 jours
Klanik recrutement
Paris - 75
CDI
Télétravail partiel
Voir l’offre
il y a 6 jours
Externatic recrutement
Puteaux - 92
CDI
60 000 - 70 000 € / an
Télétravail partiel
Voir l’offre
il y a 17 jours
Voir plus d'offres
Les sites
L'emploi
  • Offres d'emploi par métier
  • Offres d'emploi par ville
  • Offres d'emploi par entreprise
  • Offres d'emploi par mots clés
L'entreprise
  • Qui sommes-nous ?
  • On recrute
  • Accès client
Les apps
Nous suivre sur :
Informations légales CGU Politique de confidentialité Gérer les traceurs Accessibilité : non conforme Aide et contact