Thèse Modèles de Distribution Multi-Espèces Fondés sur les Urnes de Pólya Apprentissage Statistique et Validation Prédictive pour l'Étude des Communautés Écologiques H/F Doctorat.Gouv.Fr
- Montpellier - 34
- CDD
- Bac +5
- Service public d'état
À noter sur ce job
Vous avez ces compétences ? Cliquez dessus pour les ajouter rapidement à votre profil !
Détail du poste
Établissement : Université de Montpellier École doctorale : I2S - Information, Structures, Systèmes Laboratoire de recherche : IMAG - Institut Montpelliérain Alexander Grothendieck Direction de la thèse : Jean PEYHARDI ORCID 0000000174326802 Début de la thèse : 2026-10-01 Date limite de candidature : 2026-09-25T23:59:59 Le projet s'inscrit à l'interface entre l'écologie quantitative et l'apprentissage statistique. Il associe les compétences du CEFE en écologie des communautés et modèles de distribution d'espèces à celles de l'IMAG en probabilités, apprentissage statistique et validation de modèles. Ce projet relève de l'IA statistique car il développe des méthodes d'apprentissage de modèles par optimisation et des procédures de validation prédictive permettant d'évaluer leur capacité de généralisation sur de nouvelles données.
Les approches actuelles reposent principalement sur des modèles Poisson log-normaux (PLN) à variables latentes gaussiennes, dans lesquels les dépendances observées entre espèces sont interprétées directement comme des interactions écologiques. Ces modèles sont flexibles mais leur inférence est coûteuse due à l'absence de vraisemblance analytique. De plus, des travaux récents mettent en lumière des problèmes de prédiction de ces modèles, notamment pour des valeurs environnementales extrêmes.
Le projet propose une famille alternative de modèles de régression fondés sur les urnes de Pólya. Ces modèles respectent la théorie neutre de la biodiversité, en décrivant des communautés écologiques comme l'état stationnaire de processus démographiques simples de naissance-mort sans hypothèse d'interactions entre espèces. Ils possèdent une vraisemblance explicite permettant une estimation efficace par optimisation de gradient, qu'il s'agira de formaliser, ainsi que des propriétés de stabilité.
Un des objectifs est de déterminer dans quelle mesure les corrélations observées entre espèces traduisent de véritables interactions écologiques ou résultent des mécanismes démographiques sous-jacents. Le projet développera également des méthodes de validation prédictive par data thinning, exploitant les propriétés probabilistes de stabilité de ces modèles. Cela permettra de comparer les performances prédictives et la robustesse des modèles, notamment face à des valeurs environnementales extrêmes. L'écologie des communautés s'appuie de plus en plus sur des données d'abondance multi-espèces associées à des variables environnementales. L'objectif est de comprendre comment les espèces répondent à leur environnement et d'identifier les mécanismes responsables des structures observées au sein des communautés biologiques. Les modèles de distribution jointe d'espèces (Joint Species Distribution Models, JSDM) constituent aujourd'hui un cadre d'apprentissage statistique de référence pour l'analyse de ces données.
Parmi les approches existantes, les modèles Poisson log-normaux (PLN) sont largement utilisés pour modéliser simultanément plusieurs espèces. Les dépendances estimées dans ces modèles sont généralement interprétées comme la signature d'interactions écologiques entre espèces. Cependant, ces modèles reposent sur des variables latentes gaussiennes dont la vraisemblance ne possède pas d'expression analytique explicite, conduisant à des procédures d'inférence complexes et coûteuses. De plus, des travaux récents mettent en évidence des erreurs de prédictions élevées lorsque les variables environnementales prennent des valeurs éloignées de celles observées lors de l'apprentissage.
Par ailleurs, des travaux récents ont montré qu'une nouvelle famille de modèles de régression pour données de comptages multivariés, appelée modèles Pólya splitting, permet d'établir un lien entre les modèles statistiques utilisés en écologie et la théorie neutre de la biodiversité. Introduite par Hubbell, cette théorie décrit les communautés écologiques à partir de mécanismes stochastiques simples de naissance, mort, immigration et spéciation. Les modèles Pólya splitting offrent ainsi un cadre probabiliste original permettant d'intégrer ces mécanismes démographiques dans des modèles de régression proches de la famille des modèles linéaires généralisés. Enfin, ils permettent de générer des structures de dépendance entre abondances d'espèces sans supposer explicitement l'existence d'interactions biologiques. Le projet vise à développer les fondements probabilistes, statistiques et computationnels de cette famille récente de modèles selon deux axes complémentaires.
Axe 1 : objectif explicatif. Il s'agira de mieux comprendre l'origine des dépendances observées entre abondances d'espèces et de déterminer dans quelle mesure elles traduisent de véritables interactions écologiques. Pour cela, un cadre unifié de régression sera développé pour les modèles Pólya splitting (fonctions de lien, intégration des covariables environnementales, estimation des paramètres). Les propriétés de vraisemblance explicite de ces modèles seront exploitées afin de construire des procédures d'inférence par maximum de vraisemblance reposant sur des algorithmes d'optimisation de gradient. Une comparaison formelle entre modèles neutres de type Pólya et modèles PLN sera ensuite menée afin de construire un cadre de test statistique de tester l'hypothèse nulle d'absence d'interactions biotiques.
Axe 2 : objectif prédictif. Le second objectif consiste à développer des modèles plus robustes pour la prédiction des abondances en contexte de changement climatique, notamment lorsque les covariables environnementales prennent des valeurs extrêmes. Le projet développera pour cela des méthodes modernes de validation prédictive issues de l'apprentissage statistique, fondées sur le data thinning. Grâce aux propriétés de stabilité de l'opérateur de dégradation de Pólya (Pólya thinning), il sera possible de construire des jeux d'apprentissage et de validation cohérents avec la structure probabiliste des données de comptage. Ces méthodes permettront d'évaluer rigoureusement les capacités de généralisation des modèles et de comparer leurs performances prédictives à celles des approches concurrentes. Le projet reposera sur une approche combinant probabilités, statistique computationnelle, apprentissage statistique et analyse de données écologiques.
Les méthodes d'inférence seront développées dans le cadre du maximum de vraisemblance en s'appuyant sur des algorithmes d'optimisation de type Newton-Raphson. Une attention particulière sera portée aux contraintes structurelles imposées par les modèles stables par somme.
Un volet méthodologique important concernera le développement de procédures de validation prédictive par data thinning, interprétées comme des schémas de séparation apprentissage / validation adaptés aux modèles de comptage. Les propriétés de stabilité des modèles Pólya splitting permettront de généraliser ces approches à une large famille de modèles et d'en étudier les propriétés théoriques et pratiques. Les méthodes proposées seront validées sur données simulées puis appliquées à des jeux de données écologiques réels issus de l'écologie des communautés.
L'ensemble des développements méthodologiques fera l'objet d'une implémentation logicielle sous R afin de faciliter leur diffusion auprès des communautés statistique, écologique et de l'apprentissage statistique.
Le profil recherché
Publiée le 22/09/2026 - Réf : 9843a0969679fc74fdb66bead4739742