Research Engineer Llm H/F OVHai LLM
- Paris - 75
- CDI
- Bac +5
- Service public des collectivités territoriales
À noter sur ce job
Vous avez ces compétences ? Cliquez dessus pour les ajouter rapidement à votre profil !
Détail du poste
3 postes à pourvoir
Il s'agit d'un poste junior pour une personne qui vient de terminer ses études (diplôme universitaire ou master en informatique) et qui souhaite travailler sur l'entraînement de LLM de pointe. Vous travaillerez directement avec des ingénieurs seniors et devrez avoir une solide compréhension des concepts de deep learning ainsi qu'une expérience pratique de l'entraînement de LLM à petite échelle.
Vous pourrez être amené(e) à intervenir sur une ou plusieurs étapes de la pipeline, ce qui comprend les données, l'entraînement, le post-entraînement et l'évaluation. Votre périmètre exact sera déterminé pendant le processus d'entretien, selon votre profil et les besoins de l'équipe.
Ce que vous ferez
Préparer et analyser les données d'entraînement : écrire des scripts de filtrage et de déduplication, inspecter des échantillons de donnée, concevoir de petits classifieurs de qualité, générer et valider des données synthétiques.
Fine-tuner des modèles (SFT, DPO, RL) sur des données spécifiques et mesurer l'impact.
Exécuter et étendre notre suite d'évaluation : ajouter des benchmarks, construire de petits ensembles de test spécifiques à un domaine, analyser les échecs.
Aider à opérer les runs d'entraînement sur le cluster : lancer des jobs, surveiller les métriques, repérer les problèmes, écrire les outils nécessaires pour les corriger.
Reproduire les résultats d'articles de recherche sur de petits modèles et rendre compte de ce qui est transposable ou non.
Contribuer aux outils internes, aux tableaux de bord et à la documentation.
Ce que nous recherchons
Un Master (ou équivalent) en informatique, machine learning, mathématiques appliquées ou domaine connexe ; les doctorants en fin de thèse sont les bienvenus.
De solides compétences en Python. Vous écrivez du code que d'autres peuvent lire, et vous savez utiliser git, rédiger des tests.
Une expérience pratique de PyTorch et de l'écosystème Hugging Face (transformers, datasets, tokenizers, trl ou peft) acquise au travers des cours, stages ou projets personnels. Vous avez fine-tuné au moins un modèle vous-même et pouvez expliquer ce qu'il s'est passé.
Une bonne compréhension du fonctionnement des transformers (attention, encodages positionnels, tokenisation, objectifs d'entraînement) et du cycle de vie de base de l'entraînement des LLM (pretraining, SFT, RLHF/DPO, RLVR).
Être à l'aise avec Linux, les lignes de commandes et le travail sur des machines distantes.
De la curiosité, de la rigueur dans l'analyse des données, et être capable de dire « je ne sais pas, je vais vérifier ».
Anglais et français courants (écrit et oral).
Les atouts appréciables
Un stage ou une thèse en NLP, LLM ou systèmes de ML.
Avoir lancé un job sur un cluster GPU (Slurm) ou utilisé l'entraînement multi-GPU, même à petite échelle.
Une familiarité avec les outils d'évaluation (lm-eval-harness) ou avec vLLM pour l'inférence rapide.
Une certaine exposition au RL (un cours, un projet, un notebook RLHF/GRPO).
Une expérience du traitement de données à grande échelle (Spark, Ray, datatrove, DuckDB, gestion de fichiers volumineux).
Un intérêt pour les architectures efficientes, le contexte long ou les modèles non-Transformer.
Un GitHub, un article de blog ou un profil Kaggle / Hugging Face montrant ce que vous aimez construire.
Le profil recherché
Compétences: Adaptation des IA aux besoins spécifiques,Evaluation de modèles d'IA,Intelligence artificielle,Développer des modèles prédictifs pour l'analyse de données,Documenter les processus et les architectures d'IA,Optimiser les performances des systèmes d'IA,Adapter les modèles d'IA aux changements de données ou de contexte,Analyser les tendances du marché pour anticiper les évolutions de l'IA,Assurer la maintenance et l'actualisation des systèmes d'IA,Collaborer avec des experts en éthique pour évaluer les projets d'IA,Communiquer clairement les concepts d'IA aux parties prenantes non techniques,Concevoir des algorithmes d'apprentissage automatique,Développer des algorithmes pour l'analyse de données,Exploiter des solutions de Data Science ou d'Intelligence Artificielle,Faciliter l'intégration de solutions d'intelligence artificielle dans les projets existants,Respecter les normes éthiques dans le développement de l'IA,Tester rigoureusement les modèles d'IA avant déploiement
Langues: Anglais exigé,Français exigé
Qualification: Cadre
Secteur d'activité: Traduction et interprétation
Liste des qualités professionnelles:
Organiser son travail selon les priorités et les objectifs : Capacité à planifier, prioriser, anticiper des actions, en tenant compte des moyens, des ressources, des objectifs et du calendrier pour les réaliser.
Faire preuve de rigueur et de précision : Capacité à réaliser des tâches en suivant avec exactitude les règles, les procédures, les instructions qui ont été fournies, sans réaliser d'erreur et à transmettre clairement des informations. Se montrer ponctuel et respectueux des règles de savoir-vivre usuelles.
Avoir l'esprit d'équipe : Capacité à travailler et à se coordonner avec les autres au sein de l'entreprise pour réaliser les objectifs fixés.
Publiée le 25/09/2026 - Réf : 214JMMK