Thèse IA et Changement Mondial Décrypter l'Histoire par l'Exploration des Narrations et des Argumentations H/F Doctorat.Gouv.Fr

  • Toulouse - 31
  • CDD
  • Bac +5
  • Service public d'état
Lire dans l'app

À noter sur ce job

Vous avez ces compétences ? Cliquez dessus pour les ajouter rapidement à votre profil !

Détail du poste

Établissement : Université de Toulouse École doctorale : EDMITT - Ecole Doctorale Mathématiques, Informatique et Télécommunications de Toulouse Laboratoire de recherche : IRIT : Institut de Recherche en Informatique de Toulouse Direction de la thèse : Josiane MOTHE ORCID 0000000192732193 Début de la thèse : 2026-10-01 Date limite de candidature : 2026-11-27T23:59:59 Ce projet de thèse, proposé dans le cadre du programme BEST (MSCA-COFUND) en partenariat entre l'Univ.de Toulouse et l'Univ. du Luxembourg, s'intéresse à une limite fondamentale dans la manière dont les archives historiques numérisées à grande échelle peuvent actuellement être explorées. Malgré des efforts massifs de numérisation couvrant les registres administratifs, la correspondance, les dossiers judiciaires et les archives de presse, l'accès reste largement limité à la recherche par mots-clés et au filtrage par métadonnées, qui renvoient des documents isolés plutôt que les fils narratifs et argumentatifs qui les relient à travers le temps et les collections. Cette lacune a des conséquences tangibles : les analyses comparatives des réponses sociétales à des bouleversements mondiaux - tels que la pandémie de COVID-19 et celle de grippe de 1918-1919 - montrent que les enseignements contenus dans les sources historiques (par ex., les inégalités entre les groupes sociaux) restent souvent inexploités, précisément parce qu'il n'existe pas d'outils permettant d'extraire et de comparer systématiquement ces schémas à travers les archives.

La question centrale qui guide ces travaux est la suivante : Comment détecter, structurer et rendre consultables automatiquement les fils narratifs et le raisonnement sous-jacent dans les archives historiques ?

Pour y répondre, le projet combine deux paradigmes computationnels complémentaires mais rarement intégrés - l'extraction narrative et l'exploration d'arguments - appliqués à des textes historiques bruyants et instables sur le plan diachronique. Trois objectifs de recherche interconnectés structurent ce travail :

1. Extraction d'informations (IE) robuste pour les textes historiques, en développant des méthodes adaptatives d'extraction d'entités, d'événements et de relations causales qui résistent aux erreurs d'OCR/HTR et à la dérive linguistique, parallèlement à la mise en relation d'entités, à la résolution de la coréférence et à la normalisation temporelle entre documents et périodes.

2. Modélisation de la structure narrative entre documents, représentant les entités et événements extraits sous forme de fils narratifs cohérents codés en graphes temporels ou relationnels, avec des méthodes permettant de relier des éléments d'information fragmentés, contradictoires ou incomplets - un problème ouvert identifié dans des études récentes sur l'extraction narrative multi-documents.

3. La recherche d'informations guidée par la narration, enrichie par l'exploration des arguments, allant au-delà de la similarité lexicale ou basée sur les plongements de mots pour s'orienter vers des modèles de pertinence fondés sur la cohérence narrative et en les rattachant aux fils narratifs. La reconstruction du raisonnement implicite est reconnue comme un défi central non résolu.

Sur le plan méthodologique, le projet s'appuie sur quatre domaines complémentaires : l'extraction d'informations, la modélisation de la structure narrative, la recherche d'informations axée sur la narration, et l'exploration d'arguments s'appuyant sur des cadres théoriques tels que les « warrants » de Toulmin et les schémas d'argumentation de Walton. L'ancrage empirique du projet est renforcé par les travaux antérieurs des superviseurs.

Ce projet est intrinsèquement interdisciplinaire : il réunit l'expertise en recherche d'informations et en traitement du langage naturel avec celle de l'histoire numérique et des humanités computationnelles en s'appuyant sur des collaborations déjà établies.

En transformant les archives historiques, qui ne sont plus de simples documents passifs, en ressources exploitables pour comprendre les dynamiques sociétales récurrentes, ce projet soutient directement le thème BEST 'Quantifying and Analysing the Societal Impact of Global Change,', tout en générant des contributions méthodologiques transférables à des domaines connexes. Large-scale digitisation campaigns have made vast collections of historical documents available in digital form (e.g. administrative registers, personal correspondence, judicial records, parish registers, press archives). However, the way this material can be accessed has changed little: most interfaces still restrict users to keyword searches and metadata filters, returning isolated documents rather than the stories they belong to. A methodology and associated tools are missing to systematically detect and reconstruct the narrative and argumentative threads that connect documents across time and collections.

This gap has real-world consequences. For example, a comparative study of the COVID-19 and 1918-19 influenza pandemic responses revealed that while public health strategies had improved, key lessons from the earlier pandemic-such as inequities across social groups-were not fully learned a century later. Similar patterns emerge in other domains, from technological adoption to environmental policies, where recurring societal responses to global disruptions remain hidden in unconnected archives.

These examples illustrate a broader challenge: history often repeats itself not because we lack information, but because we lack the tools to extract its lessons.

This PhD project aims to address that gap by developing the first AI methodology to merge narrative reconstruction with argument mining, enabling researchers to systematically identify and compare societal responses to global disruptions across decades or centuries.
We will provide the methodological means to \emph{quantify and analyse how past societies experienced and responded to global changes}, directly supporting BEST HORIZON-MSCA-COFUND project Theme-2 (Quantifying and Analysing the Societal Impact of Global Change). This transformation turns historical archives from a passive record into an actionable resource for understanding recurring societal dynamics. The central research question is: How can we automatically detect, structure, and make searchable the narrative threads and their underlying reasoning in historical archives?

To adress this research question, we defined three interconnected research objectives:

Objective 1: Robust information extraction for historical texts}. We aim at developing adaptive information extraction (IE) methods to identify entities, events, and causal relations in noisy, diachronically variable historical documents. This includes: addressing OCR/HTR errors and linguistic instability in historical corpora; and resolving entity references across documents and time (entity linking, coreference resolution, temporal normalization). We can build on prior work, including the supervisors' results in named entity recognition and linking for historical newspapers and inquisition trials, location extraction and entity representation in LLMs. The expected outcome is a high-accuracy IE pipeline tailored to historical texts, enabling reliable extraction of entities and events despite noise and variability.

Objective 2: Narrative structure modeling across documents. Design computational models to represent extracted entities and events as coherent narrative threads (e.g., life trajectories, institutional histories, or event chains). This involves: encoding narrative threads as temporal or relational graphs; linking fragmented evidence into coherent threads despite gaps, contradictions, or implicit relations between sources; and exploring LLM-based and graph-based approaches to capture narrative coherence. The expected outcome is a technical framework for narrative structure modeling that enables the reconstruction of multi-document narrative threads, even in the presence of incomplete or conflicting information.

Objective 3: Narrative-driven information retrieval with argument mining. Enable thread-based retrieval and navigation by developing methods that rank and retrieve documents based on narrative coherence (how well a document extends or contributes to an existing thread) rather than purely lexical or semantic similarity. This includes: integrating argument mining to extract and attach argumentative structures (claims, justifications, reasoning patterns) to narrative threads; developing narrative-aware relevance models for retrieval; addressing the challenge of reconstructing implicit reasoning in historical texts, where contested meanings are often implied rather than explicit. The expected outcome is a narrative-driven retrieval system that allows users to query archives by narrative threads and argumentative stances, unlocking new ways to explore historical data. The first year will be dedicated to building the foundations of the project: reviewing the relevant literature, selecting and preparing one or more historical corpora and testing existing information extraction methods needed to identify entities, events, and relations in historical text.
The second year will focus on narrative and argumentative modelling, linking extracted elements into coherent narrative threads and argumentative structures. The third year will be centered on narrative-driven retrieval and evaluated through case studies with end users, plus the PhD submission and defense. We plan to disseminate our results in top tiers conferences and journals (e.g. EMNLP, ACL, SIGIR and ECIR conferences, TOIS and IPM journals).

More specifically, to achieve our goal of making historical archives queryable by narrative and argumentative threads, the project will be organised around three interconnected research axes, supported by a transversal component focused on argument mining.

Information extraction from historical documents. Identify entities (people, places, dates, institutions) and event/causal relations from noisy, historically-situated text, and resolve references across documents and time (entity linking, coreference across sources, temporal normalisation). We can build on our previous work on key-word and location extraction as well as named entity recognition and linking from noisy OCRed documents.

Narrative structure modelling.
Represent extracted entities and events as \textbf{narrative threads}: life trajectories, filiations, institutional histories, or event chains, typically encoded as temporal/relational graphs. This includes methods for linking fragments of evidence into coherent threads despite gaps and contradictions between sources.

Narrative-driven information retrieval
Move beyond keyword search to enable \textbf{thread-based retrieval and navigation}: e.g. ``show me all documents contributing to the story of this person, family, or event.'' Ranking and relevance are based on narrative coherence (how well a document fits and extends an existing thread) rather than purely lexical or semantic similarity.

Transversal component: argument mining for narrative enrichment
Many historical documents (administrative deliberations, correspondence, judicial records, political archives) do not just report events but argue for decisions, actions, or positions. This axis investigates how to extract argumentative structures (claims, justifications, supporting or opposing reasons) and attach them to the corresponding events or actors in the narrative graph. The goal is to enrich narrative threads with an explanatory/argumentative layer, allowing historians to query not only \textit{what happened} but also what reasoning or controversy surrounded it, and to search for documents by argumentative stance.

Le profil recherché

Nous recherchons un.e doctorant.e très motivé.e, titulaire d'un master (ou équivalent) dans un ou plusieurs des domaines suivants : informatique, linguistique compuationnelle, sciences humaines computationnelles, science des données, humanités numériques, intelligence artificielle, recherche d'informations ou toute discipline apparentée.

Compétences techniques :
Solides compétences en programmation (Python) et expérience des bibliothèques de traitement du langage naturel (NLP) et d'apprentissage automatique (ML).
Connaissances en exploration de textes, extraction d'informations ou analyse sémantique.
Une bonne connaissance des transformateurs, des modèles de langage (LLM) ou des textes historiques/bruyants est un atout.

Esprit interdisciplinaire :
Intérêt pour les travaux à la croisée de l'IA et des sciences humaines.
Ouverture d'esprit pour collaborer avec des historiens, des archivistes et des spécialistes en sciences sociales.

Compétences relationnelles :
Capacité à résoudre des problèmes, rigueur dans la recherche et excellente maîtrise de l'anglais (niveau C1).
La maîtrise du français ou d'autres langues est un atout.

Publiée le 04/09/2026 - Réf : b182a5744e47df843c7ae07960a5ab9a

Postuler
Créez votre compte
Hellowork et postulez

sur le site du partenaire !

Ces offres pourraient aussi
vous intéresser

Klanik recrutement
Toulouse - 31
CDI
42 000 - 50 000 € / an
Télétravail partiel
Voir l’offre
il y a 16 jours
FMS - Facylities Multi services recrutement
Voir l’offre
il y a 18 jours
Voir plus d'offres
Les sites
L'emploi
  • Offres d'emploi par métier
  • Offres d'emploi par ville
  • Offres d'emploi par entreprise
  • Offres d'emploi par mots clés
L'entreprise
  • Qui sommes-nous ?
  • On recrute
  • Accès client
Les apps
Nous suivre sur :
Informations légales CGU Politique de confidentialité Gérer les traceurs Accessibilité : non conforme Aide et contact