Pré Embauche - Tech Lead Expert Data Retrieval Rag H/F
collectivite
- La Courneuve - 93
- Freelance
- 6 mois
- Bac +3, Bac +4
- Bac +5
- Services aux Entreprises
Les compétences pour ce job
- Anglais
- Python
Détail du poste
Information importante
Type de contrat: Freelance
Taux journalier : Salaire selon profil
Localisation : La Courneuve, France
Date de démarrage :
Urgent
Mode de travail : Hybride
Publié le : 20 juillet 2026
Le besoin
Nous recherchons un(e) Expert(e) Data & Information Retrieval pour rejoindre l'équipe AI Service d'un acteur majeur des services numériques et de l'information professionnelle.
Important : cette opportunité s'inscrit dans le cadre d'une préembauche, avec une mission de transition de six mois maximum avant intégration en CDI.
La mission
Vous participerez à la construction du socle Data et Retrieval alimentant plusieurs produits d'intelligence artificielle à l'échelle européenne.
Votre rôle sera de concevoir et d'industrialiser des pipelines capables de collecter, nettoyer, structurer et indexer d'importants corpus documentaires, puis d'exposer une recherche rapide et pertinente combinant recherche lexicale et sémantique.
Vous interviendrez à un moment structurant du projet et pourrez challenger les choix technologiques ainsi que l'architecture cible.
Vos responsabilités
Concevoir les pipelines de collecte, parsing, nettoyage, chunking et normalisation de documents.
Industrialiser la génération d'embeddings et l'alimentation des bases vectorielles.
Garantir la fraîcheur, la traçabilité et le versioning des corpus et des index.
Combiner recherche lexicale et sémantique : BM25, embeddings, filtres et reranking.
Structurer la phase de retrieval alimentant les LLM : contexte, citations, déduplication et fenêtres de contexte.
Construire des jeux de tests et mesurer la pertinence avec des métriques comme recall, precision, nDCG et MRR.
Assurer la scalabilité, l'observabilité et la sécurité des pipelines.
Promouvoir les bonnes pratiques de développement, les tests automatisés et la qualité du code.
Accompagner les équipes et transmettre votre expertise Data, Search et IA.
Profil recherché
Expérience confirmée en Data Engineering et Information Retrieval sur des systèmes en production.
Très bonne maîtrise de Python.
Expertise en indexation, embeddings et recherche hybride.
Expérience des corpus documentaires volumineux et hétérogènes.
Capacité à mesurer, analyser et améliorer la pertinence d'un moteur de recherche.
Connaissance des architectures RAG et bonne compréhension des LLM.
Expérience des pipelines reproductibles, de la qualité des données, du lineage et du versioning.
Capacité à challenger une architecture et à exercer un leadership technique.
Anglais courant, dans un contexte européen quotidien.
Volonté de rejoindre durablement l'entreprise à l'issue de la mission.
Environnement technique cible
Python 3.11+, Go et éventuellement Java.
PostgreSQL, pgvector, Weaviate, Qdrant ou OpenSearch.
BM25, embeddings, sentence-transformers et reranking.
LangChain, OpenAI, Mistral ou AWS Bedrock.
Airflow, Spark, Kafka, Redis.
Docker, Kubernetes et CI/CD.
Pytest et outils d'évaluation du retrieval.
La stack reste ouverte : nous recherchons une personne capable de recommander les solutions les plus adaptées, pas simplement d'appliquer des choix déjà établis.
Pourquoi rejoindre le projet ?
Participer à des décisions d'architecture structurantes.
Construire un socle utilisé par plusieurs produits et équipes européennes.
Travailler sur des corpus documentaires massifs et à forte valeur métier.
Industrialiser des usages IA avec de véritables exigences de pertinence, de traçabilité et de sécurité.
Intégrer durablement une équipe d'experts spécialisée dans l'IA.
Profil recherché
Profil recherché
Formation : Master, diplôme d'ingénieur, PhD ou équivalent.
Expérience : expérience confirmée en Data Engineering et Information Retrieval sur des systèmes à forte volumétrie en production.
Stack cible - ouverte à vos recommandations
Langages : Python 3.11+ indispensable ; Go apprécié ; Java constitue un plus.
Indexation : pgvector, Weaviate, Qdrant, OpenSearch ou technologie équivalente ; recherche hybride et BM25.
Embeddings et NLP : sentence-transformers, modèles d'embeddings, tokenisation, parsing et chunking de documents.
RAG et LLM : architectures RAG, reranking, LangChain, OpenAI, Mistral, AWS Bedrock ou équivalent.
Data et infrastructure : PostgreSQL, Airflow, Spark, Kafka, Redis, Docker, Kubernetes et CI/CD.
Tests et évaluation : Pytest, jeux de référence et métriques de pertinence telles que recall, precision, nDCG et MRR.
Compétences attendues
Capacité à concevoir des pipelines robustes de collecte, nettoyage, normalisation et indexation de corpus documentaires massifs.
Maîtrise de l'indexation, des embeddings, de la recherche hybride et des techniques de reranking.
Capacité à mesurer, analyser et améliorer la pertinence d'un moteur de recherche.
Solide culture Data : pipelines reproductibles, qualité, lignage, traçabilité et versioning des datasets et des index.
Bonne compréhension du NLP, des embeddings et du fonctionnement des LLM, sans nécessairement être spécialiste de leur serving.
Expérience de l'industrialisation et de l'exploitation de systèmes Data ou IA en production.
Anglais courant, dans un contexte européen quotidien.
Soft skills
Vision Produit : comprendre les enjeux métiers afin de prioriser les fonctionnalités et gérer le moteur de recherche comme un véritable produit utilisé par d'autres équipes.
Leadership technique et pédagogie : challenger les choix d'architecture, transmettre son expertise et diffuser les bonnes pratiques Data, Retrieval et IA.
Exigence de qualité : porter une attention particulière à la pertinence des résultats, à la sécurité des données et à la fiabilité des services.
Esprit d'innovation : assurer une veille active sur les évolutions de l'IA, du NLP et des technologies de recherche.
Communication : savoir expliquer et vulgariser des problématiques techniques complexes auprès d'interlocuteurs variés.
Important : cette opportunité s'inscrit dans une démarche de préembauche. Le profil recherché doit souhaiter rejoindre durablement l'entreprise à l'issue d'une mission de six mois maximum.
Infos complémentaires
Publiée le 20/07/2026 - Réf : d21be2b4e900b5adec39df517dd578f0