Freelance Senior Machine Learning Engineer - Llm Fine-Tuning & Inference H/F
Data indep
- Paris - 75
- Indépendant
- Télétravail partiel
- Bac +5
- Services aux Entreprises
- Exp. 5 ans min.
Les compétences pour ce job
Détail du poste
Le besoin
Nous recherchons un Senior Machine Learning Engineer spécialisé en LLM pour accompagner un acteur majeur de la tech et des services digitaux grand public.
Vous rejoindrez une équipe de Machine Learning Engineers expérimentés travaillant sur une plateforme LLM à très grande échelle, avec plus de 500 000 générations de textes par jour.
L'enjeu principal de la mission sera de faire évoluer un système de génération de contenus afin d'intégrer davantage de personnalisation utilisateur, tout en maintenant un haut niveau de qualité, de factualité et de performance.
Les modèles sont open-weights et exécutés sur une infrastructure GPU auto-hébergée.
Vos principales responsabilités :
Concevoir et mettre en oeuvre des stratégies de fine-tuning sur des modèles open-weights de type Qwen
Travailler sur les approches LoRA / QLoRA et l'optimisation des datasets d'entraînement
Améliorer la personnalisation et la factualité des générations
Construire et industrialiser des protocoles d'évaluation LLM
Mettre en place des approches de type LLM-as-a-Judge
Optimiser les performances d'inférence : latence, TTFT, throughput et consommation GPU
Travailler sur la quantification, l'optimisation mémoire et le scheduling des requêtes
Participer à l'évolution de la plateforme de serving sur Kubernetes
Contribuer aux choix d'architecture et à l'industrialisation des modèles en production
Stack principale : Python, PyTorch, Qwen, LoRA / QLoRA, TRL, Unsloth, vLLM, Kubernetes, KServe, AWS, FastAPI, MLflow, Kubeflow, Airflow, GPU NVIDIA.
Localisation : Paris
Organisation : 3 jours sur site / 2 jours en télétravail
Contrat : Freelance
Le profil recherché
Profil recherché
Nous recherchons un profil Senior disposant d'au moins 5 années d'expérience en Machine Learning, avec une expérience significative sur des systèmes LLM déployés en production.
Compétences indispensables :
Excellente maîtrise de Python et PyTorch
Expérience concrète en fine-tuning de LLM open-weights
Maîtrise de LoRA / QLoRA, TRL, Unsloth ou solutions équivalentes
Expérience sur des modèles de type Qwen ou architectures similaires
Solide expérience de l'évaluation de LLM et des approches LLM-as-a-Judge
Bonne maîtrise de vLLM et des problématiques de serving
Expérience en optimisation des performances GPU et de l'inférence
Connaissance des techniques de quantification telles que AWQ ou FP8
Maîtrise de Kubernetes et idéalement KServe
Expérience AWS
Capacité à travailler sur des systèmes ML à forte volumétrie et en production
Une expérience avec TensorRT-LLM, SGLang, FlashInfer, DeepSpeed, Ray, Braintrust, LangSmith, Phoenix, Kubeflow ou MLflow constituera un plus.
Le profil recherché doit être autonome, capable de challenger les choix techniques existants et d'intervenir aussi bien sur l'entraînement des modèles que sur leur industrialisation et leur optimisation en production.
Infos complémentaires
Publiée le 10/08/2026 - Réf : f05b3731349390c044963cb2f0946bf0