Thèse Locallm Conception de Systèmes Basés sur des Llms Sécurisés Souverains et Respectueux de la Vie Privée Exploitant l'Informatique de Confiance pour Gpu. H/F
Doctorat.Gouv.Fr
- Paris - 75
- CDD
- Bac +5
- Service public d'état
Les compétences pour ce job
- Intelligence artificielle
Détail du poste
Établissement : Université Paris-Saclay GS Informatique et sciences du numérique École doctorale : Sciences et Technologies de l'Information et de la Communication Laboratoire de recherche : Centre INRIA Saclay - Île-de-France Direction de la thèse : Nicolas ANCIAUX Début de la thèse : 2026-10-01 Date limite de candidature : 2026-07-31T23:59:59 Contexte et motivation. L'usage massif des LLMs dans des secteurs de plus en plus variés (assistance juridique, ressources humaines, santé, services publics) met en lumière des enjeux critiques de confidentialité, de souveraineté et de conformité réglementaire. L'interaction avec des assistants en ligne (chatbots) peut exposer des données personnelles, sensibles voire stratégiques, à la fois lors du fine-tuning, du stockage d'historiques de conversation et de l'usage des outils de recherche spécifiques de type RAG. De mêmes les modèles une fois entrainés avec des données sensibles doivent être protégés pour des questions de propriété intellectuelle et de souveraineté.
Les avancées récentes de l'informatique de confiance (Confidential Computing, CC) sur GPU, promues par exemple par NVIDIA avec la famille de GPUs NVIDIA Hopper, ouvrent la voie à des solutions combinant performance et isolation matérielle. Ces environnements nouveaux permettent d'exécuter des modèles d'IA tout en protégeant les données et le code contre un système d'exploitation ou un hyperviseur compromis.
Objectif. Le but principal de la thèse est de concevoir et valider une architecture d'interaction LLM préservant la confidentialité et la souveraineté des données, fondée sur les TEE GPU. Elle combinera (i) des mécanismes de gestion sécurisée du cycle de vie des conversations (création, stockage, reprise, suppression) ainsi que des données utilisées pour le fine-tunng et le support la génération augmentée (RAG), (ii) des algorithmes de contrôle de rétention et de suppression vérifiable et (iii) des contre-mesures face aux fuites de données. Nous suivrons une démarche en 4 étapes investiguées en parallèle. Les étapes sont déclinées ici dans le cas d'un chatbot (les aspects fine-tuning et RAG seront étudiés en suivant une démarche similaire):
1. Mise en place d'une architecture de référence fonctionnant en mode CC-ON. Cette étape consistera à identifier et valider expérimentalement quels composants essentiels d'un chatbot open source peuvent être exécutés correctement en mode confidentiel GPU (CC-ON)
2. Analyse expérimentale de la rétention de données dans les composants. La deuxième étape consistera à vérifier des hypothèses de rétention de données, en observant la présence de données personnelles/PII ou sensibles aux différents niveaux, avec des benchmarks adaptés. Une première hypothèse à vérifier est que les moteurs d'inférence (vLLM, SGLang) conservent des données personnelles dans les caches (KV/page/prefix) après la fin d'une session. Une deuxième hypothèse concerne les frameworks permettant de construire des agents conversationnels (LangChain, LlamaIndex) qui maintiennent potentiellement des historiques sans borne temporelle de suppression.
3. Modélisation et évaluation des attaques exploitant la rétention. La troisième étape consistera à recenser et analyser les attaques existantes capables d'exploiter ces rétentions excessives. Nous monterons notamment certaines attaque de fuite inter-session et simulerons aussi l'impact d'une attaque de type analyse forensique, considérant que l'entièreté de la mémoire enclavée a pu être rendue accessible en clair (compromission complète du TEE). Cette étape permettra d'estimer la quantité et le type de données révélables selon le scénario de menace jusqu'au cas maximum de l'attaque 'ultime'.
4. Conception et validation de mécanismes de réduction et maîtrise de la rétention. Enfin, la dernière étape consistera en la conception et la validation de mécanismes de gestion sécurisée du cycle de vie des conversations (création, stockage, reprise, suppression) ainsi que de contre-mesures. Ces mécanismes combineront des algorithmes de suppression sécurisée et de politiques de rétention bornée. Nous proposerons un service héritant des propriétés de confidentialité et d'attestation, permettant une gestion conforme aux souhaits des utilisateurs (confidentialité, droit à l'oubli) et vérifiable. L'usage massif des LLMs dans des secteurs de plus en plus variés (assistance juridique, ressources humaines, santé, services publics) met en lumière des enjeux critiques de confidentialité, de souveraineté et de conformité réglementaire. L'interaction avec des assistants en ligne (chatbots) peut exposer des données personnelles, sensibles voire stratégiques, à la fois lors du fine-tuning, du stockage d'historiques de conversation et de l'usage des outils de recherche spécifiques de type RAG. De mêmes les modèles une fois entrainés avec des données sensibles doivent être protégés pour des questions de propriété intellectuelle et de souveraineté.
Les avancées récentes de l'informatique de confiance (Confidential Computing, CC) sur GPU, promues par exemple par NVIDIA avec la famille de GPUs NVIDIA Hopper, ouvrent la voie à des solutions combinant performance et isolation matérielle. Ces environnements nouveaux permettent d'exécuter des modèles d'IA tout en protégeant les données et le code contre un système d'exploitation ou un hyperviseur compromis. Le but principal de la thèse est de concevoir et valider une architecture d'interaction LLM préservant la confidentialité et la souveraineté des données, fondée sur les TEE GPU. Elle combinera (i) des mécanismes de gestion sécurisée du cycle de vie des conversations (création, stockage, reprise, suppression) ainsi que des données utilisées pour le fine-tunng et le support la génération augmentée (RAG), (ii) des algorithmes de contrôle de rétention et de suppression vérifiable et (iii) des contre-mesures face aux fuites de données. Nous suivrons une démarche en 4 étapes investiguées en parallèle. Les étapes sont déclinées ici dans le cas d'un chatbot (les aspects fine-tuning et RAG seront étudiés en suivant une démarche similaire):
1. Mise en place d'une architecture de référence fonctionnant en mode CC-ON. Cette étape consistera à identifier et valider expérimentalement quels composants essentiels d'un chatbot open source peuvent être exécutés correctement en mode confidentiel GPU (CC-ON)
2. Analyse expérimentale de la rétention de données dans les composants. La deuxième étape consistera à vérifier des hypothèses de rétention de données, en observant la présence de données personnelles/PII ou sensibles aux différents niveaux, avec des benchmarks adaptés. Une première hypothèse à vérifier est que les moteurs d'inférence (vLLM, SGLang) conservent des données personnelles dans les caches (KV/page/prefix) après la fin d'une session. Une deuxième hypothèse concerne les frameworks permettant de construire des agents conversationnels (LangChain, LlamaIndex) qui maintiennent potentiellement des historiques sans borne temporelle de suppression.
3. Modélisation et évaluation des attaques exploitant la rétention. La troisième étape consistera à recenser et analyser les attaques existantes capables d'exploiter ces rétentions excessives. Nous monterons notamment certaines attaque de fuite inter-session et simulerons aussi l'impact d'une attaque de type analyse forensique, considérant que l'entièreté de la mémoire enclavée a pu être rendue accessible en clair (compromission complète du TEE). Cette étape permettra d'estimer la quantité et le type de données révélables selon le scénario de menace jusqu'au cas maximum de l'attaque 'ultime'.
4. Conception et validation de mécanismes de réduction et maîtrise de la rétention. Enfin, la dernière étape consistera en la conception et la validation de mécanismes de gestion sécurisée du cycle de vie des conversations (création, stockage, reprise, suppression) ainsi que de contre-mesures. Ces mécanismes combineront des algorithmes de suppression sécurisée et de politiques de rétention bornée. Nous proposerons un service héritant des propriétés de confidentialité et d'attestation, permettant une gestion conforme aux souhaits des utilisateurs (confidentialité, droit à l'oubli) et vérifiable.
Le profil recherché
- Confidential Computing and Trusted Execution Environments (TEEs)
- Systems Security, including AI and Cloud Security
- GPU Computing, including CUDA and NVIDIA GPUs
- Large Language Models (LLMs)
- Secure Systems Design and Privacy-Preserving AI
Publiée le 17/07/2026 - Réf : 6c9cde29dedb3d19b5f1a080926eee53