Thèse Identification de la Langue Maternelle dans les Productions en Langue Seconde H/F Doctorat.Gouv.Fr

  • Paris - 75
  • CDD
  • Bac +5
  • Service public d'état
Lire dans l'app

À noter sur ce job

Vous avez ces compétences ? Cliquez dessus pour les ajouter rapidement à votre profil !

Détail du poste

Établissement : Institut Polytechnique de Paris École polytechnique École doctorale : Ecole Doctorale de l'Institut Polytechnique de Paris Laboratoire de recherche : Agence Ministérielle pour l'IA de Défense Direction de la thèse : Jean-François BONASTRE ORCID 0000000177413346 Début de la thèse : 2026-10-01 Date limite de candidature : 2026-12-31T23:59:59 Le terme de « faux drapeau » trouve son origine dans le domaine maritime, où il qualifie l'acte pour un navire d'arborer frauduleusement le pavillon d'une autre nation. Aujourd'hui, ce terme désigne une opération conçue pour imputer la responsabilité de l'action à une entité tierce. À l'ère du numérique, la cyberattaque contre la chaîne francophone TV5 Monde illustre cette tactique. L'opération, consistant à diffuser de la propagande djihadiste, est attribuée dix ans plus tard au service de renseignement militaire russe (GRU). Plus récemment, des collectifs de désinformation à l'instar de Storm-1516 exploitent les nouvelles technologies pour produire massivement des contenus falsifiés, multimodaux et multilingues, confrontant la recherche scientifique à un défi de détection encore peu exploré.
L'identification de la langue maternelle (L1 ) des attaquants à partir de leurs productions en langue seconde (L2 ) apparaît comme un levier défensif pour protéger l'espace informationnel français. Le cadre classique de la tâche d'identification de la langue maternelle, en anglais native language identification (NLI), suppose que l'auteur produit lui-même l'observable. Or, les productions hostiles contemporaines font fréquemment intervenir un intermédiaire entre l'auteur et la production observable, qu'il s'agisse d'un tiers humain, d'un traducteur automatique ou d'un système génératif.
Ce projet de thèse, intitulé « Identification de la langue maternelle dans les productions en langue seconde », consiste à traquer les signaux révélateurs de la langue maternelle présents dans des productions de différentes modalités et de différents scénarios de production linguistique.
Nous ne cherchons pas à identifier ce scénario, mais bien à remonter à l'auteur humain situé en amont.
Ce projet de thèse se situe au croisement du traitement automatique des langues, de la cybersécurité et de la linguistique. Il interroge la persistance de l'empreinte de la langue maternelle à travers les modalités et les scénarios de production linguistique. Les travaux de recherche visent à caractériser les conditions dans lesquelles cette empreinte survit, s'atténue ou se laisse contrefaire. Ils contribueront ainsi à la défense de l'espace informationnel en ouvrant la voie à des outils de forensique capables de remonter à l'auteur humain d'une production hostile. Le déploiement de ce projet de recherche est planifié sur une durée de trente-six mois. Les
directeurs de thèse identifiés à ce jour sont Olivier Boeffard, Jean-François Bonastre et Sonia
Vanier. La thèse est préparée au sein du laboratoire de l'AMIAD (pôle recherche), rattaché à
l'école doctorale de l'Institut Polytechnique de Paris (IP Paris), et bénéficie d'un financement
COFRA. Son avancement fait l'objet d'un suivi annuel par un comité de suivi individuel (CSI).
La thèse bénéficie de ressources de calcul HPC et de stockage fournies par GENCI à l'IDRIS,
grâce à la subvention n° 2026-AD011017021 sur la partition H100 du supercalculateur Jean Zay
et à la subvention n° 2026-R1001016831 sur la partition B200 du supercalculateur DALIA. - RQ1 : Existe-t-il une cohérence inter-modale dans la prédiction de la L1 ?
- RQ2 : L'agrégation de plusieurs contenus multimodaux d'un même auteur renforce-t-elle l'identification de la langue maternelle ?
- RQ3 : Les signaux de la langue maternelle survivent-ils différemment selon la nature de
l'intermédiaire ?
- RQ4 : Quel est l'impact du modèle intermédiaire employé pour la production d'un
contenu en langue seconde ? La langue dominante du corpus d'apprentissage de ce modèle
influence-t-elle les prédictions ?
- RQ5 : Un attaquant peut-il exploiter un intermédiaire pour imiter une langue maternelle
dans une logique de faux drapeau ?
- RQ6 : Peut-on retrouver une langue maternelle individuelle, ou les traces ne sont-elles
cohérentes qu'à l'échelle de regroupements linguistiques, comme les familles de langues ?
- RQ7 : Sous quelles conditions un signal faible survit-il ou disparaît-il ?
- RQ8 : Les résultats, majoritairement établis sur l'anglais L2 , se transposent-ils à une
autre langue cible, comme le français ? Se transposent-ils à des langues peu dotées ?
- RQ9 : Comment constituer des corpus contrôlés par langue maternelle, modalité et scé-
nario de production, sans introduire de contamination entre les données et les modèles ?
- RQ10 : Dans quelle mesure peut-on se fier à la prédiction d'un système de NLI ? Com-
ment ce système peut-il exprimer son degré de certitude et s'abstenir lorsque celui-ci est
insuffisant ?
- RQ11 : Les explications produites correspondent-elles réellement aux traits de transfert
linguistique attestés ?
- RQ12 : Quel compromis entre le coût computationnel des représentations et la préser-
vation du signal de la langue maternelle ? Approche basée sur l'utilisation de LLMs en mode 'embedding extractor'

Le profil recherché

Master ou équivalent en informatique ou mathématiques appliquées.
Compétences confirmées en IA et LLM

Publiée le 06/10/2026 - Réf : 366657c1a920334ae63e55cceb405e58

Postuler
Créez votre compte
Hellowork et postulez

sur le site du partenaire !

Voir plus d'offres
Les sites
L'emploi
  • Offres d'emploi par métier
  • Offres d'emploi par ville
  • Offres d'emploi par entreprise
  • Offres d'emploi par mots clés
L'entreprise
  • Qui sommes-nous ?
  • On recrute
  • Accès client
Les apps
Nous suivre sur :
Informations légales CGU Politique de confidentialité Gérer les traceurs Accessibilité : non conforme Aide et contact