Ingénieur d'Études en Développement Orienté IA H/F
Service Public
- Paris - 75
- CDD
- Bac +2
- Bac +3, Bac +4
- Bac +5
- Service public d'état
À noter sur ce job
Vous avez ces compétences ? Cliquez dessus pour les ajouter rapidement à votre profil !
Les missions du poste
Dans le cadre de cette dernière séquence du projet de recherche, l'ingénieur d'études, sous la responsabilité d'un expert responsable du projet, sera en charge de l'industrialisation du prototype dans l'écosystème technique de la BnF. Pour cela, l'ingénieur d'études :
- Contribue au déploiement des modèles constituant le prototype / pipeline sur les systèmes informatiques de la BnF ;
- Modélise les flux de fichiers entrants et sortants du pipeline ;
- Conçoit et implémente une architecture dédiée, et package le code selon une approche pré-production ;
- Met en place les tests nécessaires ;
- Travaille sur la conversion des exports (JSON) du pipeline en fichiers ALTO et METS, qui sont les formats traditionnellement exploités et archivés par la BnF ;
- Développe des outils de contrôle qualité du workflow mis en place, et évalue la pertinence des informations générées par les modèles ;
- Rédige la documentation technique afférente au prototype (manuel d'installation, DAT,...) ;
- Rédige un rapport final, à destination de l'ANR et du consortium du projet, sur l'utilisabilité du pipeline à l'échelle de collections variées et massives.
Le profil recherché
- Excellentes pratiques du développement Python (objet, fonctionnel, scripting, API, workflows) appliquées au traitement de données documentaires et modèles de machine learning ;
- Expériences significatives dans le domaine du traitement de données documentaires massives (JSON, XML, formats et protocoles spécifiques, segmentation/océrisation, ALTO, METS), idéalement dans le domaine de la presse ;
- Maîtrise des environnements systèmes (Linux/Windows) et langages shell (bash) ;
- Capacité à tester et sécuriser son code ;
- Capacité à conceptualiser une architecture de traitement et la documenter dans des documentations spécifiques (DAT, schémas d'architecture,...) ;
- Capacité à documenter son code et ses environnements ;
- Connaissances théoriques sur le machine learning (principes de base);
- Capacités rédactionnelles, rigueur scientifique et esprit de synthèse ;
- Aisance relationnelle ;
- Capacité à rendre compte de son travail.
Compétences souhaitées
- Connaissances en ingénierie des modèles de machine learning (packaging et modularisation, FastAPI, OpenAPI,...), gestion des services, serveurs et infrastructures associés (vLLM, Ollama), logiques d'orchestration de jobs (Apache Airflow) ;
- Connaissances sur le monitoring (MLFlow) et la télémétrie spécifique de modèles de machine learning;
- Capacité à anticiper et apporter des solutions aux problématiques techniques (problème de charge, estimation de ressources de calcul, parallélisation et mise à l'échelle des ressources...) ;
- Capacité à concevoir, implémenter et améliorer des politiques d'évaluation qualitatives et quantitatives de modèles (mesures, comparatifs quantifiés de modèles et pipelines techniques) ;
- Pratiques éprouvées de la mise en production (CI/CD, versionnage de code selon des standards industriels, gestion des montées de version, release management) ;
- Connaissance des enjeux numériques des institutions patrimoniales.
Bienvenue chez Service Public
Lauréat en 2023 de l'Appel à projets « Thématiques Spécifiques en Intelligence Artificielle » (TSIA) de l'Agence Nationale de la Recherche (ANR), le projet de recherche FINLAM (Foundation INtegrated models for Libraries Archives and Museums) vise à améliorer l'accès aux collections patrimoniales numérisées en développant des méthodes d'extraction des structures logiques de fascicules de presse. Il réunit un laboratoire de recherche (le Litis, de l'université de Rouen), la société Teklia, et la BnF. Il se propose de développer des modèles pour l'extraction d'informations de documents numérisés ou nés numériques. Eu égard aux formidables volumes des collections de presse numérisée de la BnF (8 millions de documents numérisés à date) et à l'intérêt toujours plus vif des chercheurs pour le matériau riche, mais encore difficilement accessible, que ces documents constituent, le projet FINLAM revêt une importance particulière pour la BnF.
Commencé en septembre 2023, d'une durée de 49 mois (fin fixée au 31 octobre 2027), ce projet abordera bientôt sa dernière séquence : l'industrialisation du prototype créé par le consortium du projet. Ce prototype est un pipeline permettant la segmentation et la transcription textuelle de fascicules de presse, puis l'extraction de leur structure logique (segmentation des articles) grâce à un chaînage de modèles d'IA. L'ambition est de mettre en production le pipeline de traitement des fascicules, et de le tester sur un ensemble conséquent de docum
Infos complémentaires
Publiée le 03/09/2026 - Réf : 2026-2380852