Freelance Senior Machine Learning Engineer - Llm Fine-Tuning & Inference H/F

Data indep

  • Paris - 75
  • Indépendant
  • Télétravail partiel
  • Bac +5
  • Services aux Entreprises
  • Exp. 5 ans min.
Lire dans l'app

Les compétences pour ce job

Détail du poste

Le besoin

Nous recherchons un Senior Machine Learning Engineer spécialisé en LLM pour accompagner un acteur majeur de la tech et des services digitaux grand public.

Vous rejoindrez une équipe de Machine Learning Engineers expérimentés travaillant sur une plateforme LLM à très grande échelle, avec plus de 500 000 générations de textes par jour.

L'enjeu principal de la mission sera de faire évoluer un système de génération de contenus afin d'intégrer davantage de personnalisation utilisateur, tout en maintenant un haut niveau de qualité, de factualité et de performance.

Les modèles sont open-weights et exécutés sur une infrastructure GPU auto-hébergée.

Vos principales responsabilités :

  • Concevoir et mettre en oeuvre des stratégies de fine-tuning sur des modèles open-weights de type Qwen

  • Travailler sur les approches LoRA / QLoRA et l'optimisation des datasets d'entraînement

  • Améliorer la personnalisation et la factualité des générations

  • Construire et industrialiser des protocoles d'évaluation LLM

  • Mettre en place des approches de type LLM-as-a-Judge

  • Optimiser les performances d'inférence : latence, TTFT, throughput et consommation GPU

  • Travailler sur la quantification, l'optimisation mémoire et le scheduling des requêtes

  • Participer à l'évolution de la plateforme de serving sur Kubernetes

  • Contribuer aux choix d'architecture et à l'industrialisation des modèles en production

Stack principale : Python, PyTorch, Qwen, LoRA / QLoRA, TRL, Unsloth, vLLM, Kubernetes, KServe, AWS, FastAPI, MLflow, Kubeflow, Airflow, GPU NVIDIA.

Localisation : Paris
Organisation : 3 jours sur site / 2 jours en télétravail
Contrat : Freelance

Le profil recherché

Profil recherché

Nous recherchons un profil Senior disposant d'au moins 5 années d'expérience en Machine Learning, avec une expérience significative sur des systèmes LLM déployés en production.

Compétences indispensables :

  • Excellente maîtrise de Python et PyTorch

  • Expérience concrète en fine-tuning de LLM open-weights

  • Maîtrise de LoRA / QLoRA, TRL, Unsloth ou solutions équivalentes

  • Expérience sur des modèles de type Qwen ou architectures similaires

  • Solide expérience de l'évaluation de LLM et des approches LLM-as-a-Judge

  • Bonne maîtrise de vLLM et des problématiques de serving

  • Expérience en optimisation des performances GPU et de l'inférence

  • Connaissance des techniques de quantification telles que AWQ ou FP8

  • Maîtrise de Kubernetes et idéalement KServe

  • Expérience AWS

  • Capacité à travailler sur des systèmes ML à forte volumétrie et en production

Une expérience avec TensorRT-LLM, SGLang, FlashInfer, DeepSpeed, Ray, Braintrust, LangSmith, Phoenix, Kubeflow ou MLflow constituera un plus.

Le profil recherché doit être autonome, capable de challenger les choix techniques existants et d'intervenir aussi bien sur l'entraînement des modèles que sur leur industrialisation et leur optimisation en production.

Infos complémentaires

Taux journalier :Salaire selon profil

Publiée le 10/08/2026 - Réf : f05b3731349390c044963cb2f0946bf0

Postuler
Créez votre compte
Hellowork et postulez

sur le site du partenaire !

Voir plus d'offres
Les sites
L'emploi
  • Offres d'emploi par métier
  • Offres d'emploi par ville
  • Offres d'emploi par entreprise
  • Offres d'emploi par mots clés
L'entreprise
  • Qui sommes-nous ?
  • On recrute
  • Accès client
Les apps
Nous suivre sur :
Informations légales CGU Politique de confidentialité Gérer les traceurs Accessibilité : non conforme Aide et contact