Thèse Apprentissage Multimodal Distribué pour la Localisation et la Classification Coopératives de Sources Acoustiques H/F Doctorat.Gouv.Fr
- Paris - 75
- CDD
- Bac +5
- Service public d'état
À noter sur ce job
Vous avez ces compétences ? Cliquez dessus pour les ajouter rapidement à votre profil !
Détail du poste
Établissement : Université Paris-Saclay GS Informatique et sciences du numérique École doctorale : Sciences et Technologies de l'Information et de la Communication Laboratoire de recherche : CEA /LIST - Laboratoire d'intégration de systèmes et de technologies Direction de la thèse : Antoine SOULOUMIAC Début de la thèse : 2026-11-02 Date limite de candidature : 2026-09-30T23:59:59 Les systèmes autonomes déployés dans des environnements complexes, tels que les sites industriels, les bâtiments sinistrés ou les espaces publics, doivent être capables de détecter, localiser et identifier des événements sonores d'intérêt (chutes, alarmes, tirs, défaillances mécaniques, etc.). Les approches actuelles reposent principalement sur des réseaux de microphones de géométrie fixe ou sur des plateformes individuelles, dont les capacités restent limitées par leur point de vue unique et leur vulnérabilité aux occultations.
Cette thèse propose de développer un cadre d'apprentissage multimodal distribué permettant à plusieurs plateformes mobiles équipées de capteurs audio et vidéo de coopérer afin de localiser et classifier des sources acoustiques en trois dimensions. Chaque plateforme exploite localement ses observations audio-visuelles pour estimer la direction d'arrivée des sons, puis partage des informations compactes avec les autres plateformes afin de construire une perception collective de l'environnement.
Le principal verrou scientifique réside dans l'absence de connaissance a priori de la géométrie relative des plateformes. La thèse étudiera des méthodes permettant d'estimer conjointement la configuration spatiale du réseau, la position tridimensionnelle des sources sonores et leur classification, sans infrastructure externe telle que le GPS ou des balises de référence.
Les travaux s'articuleront autour de trois axes complémentaires : (i) la calibration géométrique distribuée des plateformes à partir d'observations audio-visuelles communes, (ii) la fusion coopérative des estimations de direction pour reconstruire la position 3D des sources acoustiques, et (iii) la classification coopérative d'événements sonores à partir de représentations multimodales distribuées. Les développements seront validés en simulation puis sur une flotte de plateformes mobiles équipées de caméras et de réseaux de microphones.
Les résultats attendus contribueront au développement de systèmes de perception coopérative robustes, capables de fonctionner en environnement non contrôlé malgré les occultations, le bruit ou les défaillances partielles des capteurs. Les applications visées concernent notamment la robotique autonome, la sécurité civile, la surveillance industrielle et les systèmes de défense. La localisation et la classification d'événements sonores constituent des fonctions essentielles pour les systèmes autonomes opérant dans des environnements non contrôlés, tels que les sites industriels, les bâtiments sinistrés ou les espaces publics. Les applications concernent notamment la robotique d'intervention, la surveillance industrielle, la sécurité civile et les systèmes de défense.
Les approches actuelles reposent principalement sur des réseaux de microphones de géométrie connue ou sur des plateformes individuelles. Les premières offrent d'excellentes performances dans des environnements contrôlés mais nécessitent une infrastructure fixe, tandis que les secondes restent limitées par leur point de vue unique et leur sensibilité aux occultations ou aux conditions acoustiques locales. En parallèle, les méthodes de SLAM collaboratif permettent à plusieurs robots de partager des informations visuelles pour estimer leur position relative, mais n'intègrent généralement pas la modalité acoustique.
Dans ce contexte, l'émergence de plateformes mobiles autonomes équipées simultanément de caméras et de réseaux de microphones ouvre la voie à une perception coopérative multimodale distribuée. Les travaux poursuivront trois objectifs scientifiques principaux :
1) développer une méthode de calibration géométrique distribuée permettant d'estimer automatiquement la configuration spatiale relative des plateformes sans infrastructure externe ;
2) concevoir des algorithmes de fusion coopérative des estimations de direction afin de reconstruire la position tridimensionnelle des sources acoustiques de manière robuste ;
3) développer une approche de classification coopérative d'événements sonores fondée sur des représentations multimodales distribuées, exploitant conjointement les informations audio et visuelles issues de plusieurs plateformes.
Le profil recherché
Publiée le 09/09/2026 - Réf : 50cc22ef80c291af1d18a1ffe3acef60