OVHCloud emploi
OVHCloud recrutement

Infrastructure Engineer - Inference Serving Training & Data de Production - N H/F OVHCloud

  • Lyon - 69
  • CDI
  • Bac +2
  • Bac +3, Bac +4
  • Bac +5
  • Secteur informatique • ESN
Lire dans l'app

Détail du poste

Au sein de votre équipe #OneTeam

- Intégrer l'équipe AI Infrastructure & Data au sein de la BU AI. Votre mission sera de concevoir, déployer, superviser et maintenir en conditions opérationnelles l'infrastructure dédiée à l'entraînement (training) et à l'inférence des modèles d'intelligence artificielle pour nos besoins internes.
- Fournir aux équipes Data Science, ML Engineering et produits internes une plateforme IA performante, disponible, sécurisée et efficiente en coûts et en énergie, en s'appuyant sur nos datacenters et notre savoir-faire industriel. Ces utilisateurs, vos futurs collègues, exploiteront notre infrastructure GPU, de stockage et réseau afin d'utiliser une plateforme hautement automatisée en self-service, du dataset au modèle en production.

Vos principales responsabilités

- Concevoir, déployer et opérer notre plateforme d'inférence interne (vLLM, Triton, autoscaling, batching, multi-tenancy, haute disponibilité)
- Optimiser la latence, le débit et le coût de l'inférence (quantization, placement des modèles, dimensionnement des ressources GPU)
- Assurer l'exploitation des workloads de training et de fine-tuning sur le socle de calcul opéré par l'équipe
- Porter la continuité de la chaîne training vers inférence en industrialisant le passage du checkpoint au modèle servi en production
- Être responsable des données du cycle de vie des modèles (registre, versioning, traçabilité dataset-entraînement-modèle-déploiement)
- Être responsable des données de production de l'inférence (logging, anonymisation, rétention) Mettre à disposition les données de feedback pour le réentraînement et le fine-tuning des modèles
- Définir avec les équipes clientes les standards de mise en production des modèles
- Participer à l'astreinte, rédiger les runbooks, contribuer aux post-mortems et automatiser la remédiation
- Remettre constamment en question ce qui existe et explorer ce qui doit évoluer pour répondre aux besoins internes Appliquer les aspects de sécurité matériel, logiciel et data sur toute la chaîne de valeur
- Travailler en étroite collaboration avec les équipes OVHcloud France et à l'International

Votre futur impact

Dans 6 mois

- Vous aurez pris vos marques au sein de l'équipe AI Infrastructure & Data et de la BU AI.
- Vous comprendrez l'infrastructure existante, les défis d'optimisation du serving de modèles et les besoins des équipes internes.
- Vous aurez participé au déploiement et à l'optimisation de la stack d'inférence (vLLM, Triton), apportant votre expertise pour réduire la latence et maximiser le débit des modèles en production.
- Vous aurez établi des relations avec les équipes Data Science et ML Engineering, recueillant leurs retours sur l'ordonnancement des jobs de training et le cycle de vie des checkpoints.
- Vous aurez exploré l'industrialisation du passage du training à l'inférence afin de fluidifier la mise en production des modèles.

Et dans 1 an

- Vous aurez joué un rôle clé dans la construction de la boucle de feedback complète, permettant la réinjection des données d'inférence vers le réentraînement et le fine-tuning.
- Vous aurez fiabilisé et sécurisé l'ensemble du registre de modèles et la traçabilité des données de production de l'inférence.
- Vous aurez partagé vos bonnes pratiques et vos standards de mise en production avec les équipes clientes, renforçant l'autonomie des utilisateurs sur la plateforme self-service.

C

Le profil recherché

Compétences requises:
- Vous possédez plus de 5 ans d'expérience dans l'ingénierie de plateformes ou l'exploitation de services à grande échelle en production.
- Vous maîtrisez le déploiement de services de serving de modèles ML/LLM (vLLM, Triton, TGI, KServe) ainsi que les approches d'optimisation (quantization, ONNX, TensorRT).
- Vous avez une expérience concrète de l'exploitation de workloads de training et d'ordonnancement de jobs (Slurm, Kueue, Volcano).
- Vous disposez de solides connaissances de Kubernetes, des patterns de scalabilité, du développement (Python, Go, Bash) et des pratiques CI/CD / GitOps. Vous maîtrisez la gestion des données de production (logging, anonymisation, conformité).
- Vous êtes autonome, reconnu pour être un facilitateur, curieux et capable d'évoluer dans un environnement international (anglais courant).

C'est un +

- Vous maîtrisez les frameworks d'entraînement distribué (PyTorch DDP/FSDP) ou les outils MLOps (MLflow, Weights & Biases).

AI Infrastructure Engineer - Inference, Serving, Training & Data de production H/F/N

Les avantages

  • Une politique de télétravail flexible
  • Un plan d'actionnariat salarié
  • Un programme de reconnaissance de l'ancienneté
  • Des subventions vacances et sport
  • Des équipes multi-culturelles
  • Une plateforme de développement de compétences ouverte à tous
  • Un engagement fort dans le développement durable
  • Des plateformes d'accompagnement en ligne pour vous et votre famille

Les étapes de recrutement

Les étapes de recrutement peuvent varier selon l'offre à laquelle vous postulez.

  • Entretien téléphonique avec l'équipe recrutement

  • Entretien physique ou en visio avec un recruteur

  • Test technique si le poste l'exige

  • Entretien manager et rencontre avec l'équipe

  • Debriefing avec le recruteur et proposition d'embauche le cas échéant

Publiée le 19/08/2026 - Réf : d0d8e2a03cd3209013e6e028b93059f7

Postuler
Créez votre compte
Hellowork et postulez

sur le site du recruteur !

Ces offres pourraient aussi
vous intéresser

ARC Europe recrutement
ARC Europe recrutement
Voir l’offre
il y a 11 jours
ARMEE DE L'AIR ET DE L'ESPACE recrutement
ARMEE DE L'AIR ET DE L'ESPACE recrutement
Lyon - 69
CDI
1 628 - 2 932 € / mois
Voir l’offre
il y a 24 jours
Voir plus d'offres
Les sites
L'emploi
  • Offres d'emploi par métier
  • Offres d'emploi par ville
  • Offres d'emploi par entreprise
  • Offres d'emploi par mots clés
L'entreprise
  • Qui sommes-nous ?
  • On recrute
  • Accès client
Les apps
Nous suivre sur :
Informations légales CGU Politique de confidentialité Gérer les traceurs Accessibilité : non conforme Aide et contact