Stage Recherche sur les Capacités de Raisonnement des Grands Modèles de Langage Génératif H/F Safran
- Châteaufort - 78
- Stage
- 6 mois
- Bac +5
- Industrie Aéronautique • Aérospatial
Les compétences pour ce job
Les missions du poste
En tant que stagiaire au sein de l'unité S.AI.R (IA et traitement des données), vous travaillerez en étroite collaboration avec des ingénieurs recherche pour améliorer les capacités de raisonnement des LLMs ou de systèmes agentiques sur des données internes et publiques. L'objectif principal du stage sera d'étendre les capacités de raisonnement multi-hop des LLMs. Ce type de raisonnement consiste à formuler une conclusion à travers une succession d'étapes logiques, où chaque étape s'appuie sur des informations ou des concepts intermédiaires pouvant provenir de différentes sources [1,2]. Pour atteindre cet objectif le candidat sera amené à explorer différents axes de recherche possibles tels que l'apprentissage par renforcement, le latent reasoning [3, 4], le causal learning [5,6], ou encore des méthodes de raisonnement fondées sur la création et l'exploitation de graphes de connaissance (représentant la mémoire de l'agent ou une base de données externes) [7]. L'étude pourra également s'appuyer sur les capacités de programmation des LLMs [8]. Ce stage allie à la fois des aspects informatiques (programmation) et des aspects mathématiques liés aux LLMs, et il pourra se poursuivre par une thèse CIFRE.
Vos missions pendant le stage consisteront à :
- Conduire des recherches pour améliorer les capacités de raisonnement multi-hop des LLMs.
- Réaliser une recherche bibliographique.
- Implémenter et tester les différentes approches identifiées sur des cas d'usages spécifiques (publics et internes).
- Développer de nouvelles stratégies pour améliorer les capacités de raisonnement multi-hop des LLMs.
- Publier les résultats de recherche dans des journaux/conférences (NeurIPS, ICLR, ICML, ACL, COLM).
Bibliographie :
[1] Yang, Zhilin, et al. "HotpotQA: A dataset for diverse, explainable multi-hop question answering." 2018.
[2] Schnitzler, Julian, et al. "Morehopqa: More than multi-hop reasoning." arXiv preprint arXiv:2406.13397 (2024).
[3] Chen, Xinghao, et al. "Reasoning beyond language: A comprehensive survey on latent chain-of-thought reasoning." arXiv preprint arXiv:2505.16782 (2025).
[4] Yang, Sohee, et al. "Do large language models latently perform multi-hop reasoning?." 2024.
[5] Schölkopf, Bernhard. "Causality for machine learning." Probabilistic and causal inference: The works of Judea Pearl. 2022. 765-804.
[6] Jin, Zhijing. "Causality for natural language processing." arXiv preprint arXiv:2504.14530 (2025).
[7] Chen, Ruirui, et al. "LLM-based multi-hop question answering with knowledge graph integration in evolving environments." EMNLP 2024.
[8] Zhang, Alex L., Tim Kraska, and Omar Khattab. "Recursive language models." arXiv preprint arXiv:2512.24601 (2025).
Le profil recherché
- Niveau d'étude : Master universitaire, Diplôme d'Ingénieur ou équivalent avec formations en Machine Learning, Natural Language Processing (NLP), Large Language Models (LLMs), Mathématiques ou dans un domaine technique pertinent.
- Solides compétences en programmation Python.
- Familiarité avec un ou plusieurs frameworks d'apprentissage profond (Transformers, Pytorch, Tensorflow, etc.).
- Une première expérience recherche dans le NLP et les LLMs serait un plus.
Bienvenue chez Safran
Safran est la 2ème entreprise du secteur aéronautique et défense du classement « World's Best Companies 2025 » du magazine TIME.
Parce que nous sommes persuadés que chaque talent compte, nous valorisons et encourageons les candidatures de personnes en situation de handicap pour nos opportunités d'emploi.
La carte
Rue des jeunes Bois
78117 Châteaufort
Publiée le 24/07/2026 - Réf : 2026-202191-175071