Data Scientist Nlp Ocr - Nucléaire H/F
AlgoviA
- France
- CDI
- Bac +5
- Services aux Entreprises
Les compétences pour ce job
Vous vous reconnaissez dans ces compétences ? Cliquez dessus pour les ajouter rapidement à votre profil !
Détail du poste
Le besoin
Contexte
Le travail s'effectue au sein de l'équipe DataScience du département informatique de notre client du domaine nucléaire. Cette équipe est constituée d'une quinzaine de personnes, dont le manager, 3-4 data scientists et un data-ingénieur internes, quelques chefs de projet, 3 alternants et stagiaires, ainsi que des data scientists et chefs de projet externes en renfort.
L'équipe DataScience de Framatome centralise tous les besoins en intelligence artificielle de l'entreprise. Pour chaque projet, après une phase de cadrage (calcul ROI, ...), un POC est réalisé (selon complexité) puis une mise en production est attendue (application, déploiement sur serveurs internes, ...). L'équipe gère également une plateforme GenIA à destination de l'entreprise (RAG, chatbot, ...).
La collaboration s'effectue aussi avec l'équipe cybersécurité et l'équipe développement sur les sujets de sécurité, de mise en production, d'infrastructure et de déploiement.
Missions
L'équipe travaille autour de trois axes principaux :
Projets NLP / GenAI : traitement de documents complexes (OCR, multimodalité, ...), amélioration des chatbots (RAG), pouvant aller jusqu'au fine-tuning/pre-training de modèles d'embeddings spécialisés pour le secteur nucléaire.
Projets Deep Learning : exploitation de données issues de capteurs de terrain (caméra, mesures temporelles, ...). Les tâches incluent la détection d'anomalies, la classification/prédiction, ainsi que la recherche de variables d'importance.
Développement de librairies internes hors projet : création d'utilitaires réutilisables dans différents contextes.
Outils & Environnement
GenAI / Machine Learning
R&D - Traitements documentaires complexes
Séries temporelles / Jumeaux numériques
Stack technique :
Développement : Python, Gitlab, Docker, CI/CD, uvicorn
Deep Learning : PyTorch, HuggingFace
Cloud et infrastructure : Azure, GPU
IA Générative : Azure Open AI, vllm, ollama, langchain
Datascience : pandas, numpy, OpenCV, PyPDF (ou fitz), ...
Le profil recherché
Profil recherché
Contexte
Le travail s'effectue au sein de l'équipe DataScience du département informatique de notre client du domaine nucléaire. Cette équipe est constituée d'une quinzaine de personnes, dont le manager, 3-4 data scientists et un data-ingénieur internes, quelques chefs de projet, 3 alternants et stagiaires, ainsi que des data scientists et chefs de projet externes en renfort.
L'équipe DataScience de Framatome centralise tous les besoins en intelligence artificielle de l'entreprise. Pour chaque projet, après une phase de cadrage (calcul ROI, ...), un POC est réalisé (selon complexité) puis une mise en production est attendue (application, déploiement sur serveurs internes, ...). L'équipe gère également une plateforme GenIA à destination de l'entreprise (RAG, chatbot, ...).
La collaboration s'effectue aussi avec l'équipe cybersécurité et l'équipe développement sur les sujets de sécurité, de mise en production, d'infrastructure et de déploiement.
Missions
L'équipe travaille autour de trois axes principaux :
Projets NLP / GenAI : traitement de documents complexes (OCR, multimodalité, ...), amélioration des chatbots (RAG), pouvant aller jusqu'au fine-tuning/pre-training de modèles d'embeddings spécialisés pour le secteur nucléaire.
Projets Deep Learning : exploitation de données issues de capteurs de terrain (caméra, mesures temporelles, ...). Les tâches incluent la détection d'anomalies, la classification/prédiction, ainsi que la recherche de variables d'importance.
Développement de librairies internes hors projet : création d'utilitaires réutilisables dans différents contextes.
Outils & Environnement
GenAI / Machine Learning
R&D - Traitements documentaires complexes
Séries temporelles / Jumeaux numériques
Stack technique :
Développement : Python, Gitlab, Docker, CI/CD, uvicorn
Deep Learning : PyTorch, HuggingFace
Cloud et infrastructure : Azure, GPU
IA Générative : Azure Open AI, vllm, ollama, langchain
Datascience : pandas, numpy, OpenCV, PyPDF (ou fitz), ...
2 jour / semaine sur site
Infos complémentaires
Publiée le 18/08/2026 - Réf : aac6c0336849dae6eab9d9f5d0108d69