Ingénieur de Production - Confirmé H/F
Cherrypick
- Braye - 02
- Indépendant
- Bac +5
- Services aux Entreprises
Détail du poste
Le besoin
Notre client, acteur majeur de la protection sociale complémentaire, renforce le pôle Observabilité et Fiabilité de sa Direction Relation Client et Production. Ce pôle garantit la disponibilité, la performance, la résilience et l'observabilité d'un SI de 8 000 serveurs et 160 applications Java, réparties sur deux salles informatiques et un site de secours. La mission s'inscrit dans un dispositif de production 24/7 avec astreinte.
Missions
Assurer le maintien en conditions opérationnelles des services, infrastructures et plateformes selon les objectifs de disponibilité et de qualité de service
Surveiller et analyser les événements, alertes et incidents de production : diagnostic, traitement et coordination avec les équipes concernées
Réaliser les analyses post-incidents, identifier les causes racines et piloter les plans d'actions de fiabilisation
Anticiper les incidents par l'analyse des tendances, des capacités, des signaux faibles et des risques identifiés sur les plateformes
Maintenir et faire évoluer les tableaux de bord, indicateurs et alertes d'observabilité (Prometheus, Grafana, Centreon, Splunk, Tempo)
Réduire le bruit opérationnel : optimisation des règles d'alerting et réduction du volume d'alertes non pertinentes
Participer aux cellules d'incident, de crise et aux démarches d'amélioration continue de la production
Contribuer à l'automatisation, l'industrialisation et la simplification des activités d'exploitation
Maintenir et enrichir la documentation, les procédures et les référentiels de l'activité
Le profil recherché
Profil recherché
Au minimum 3 ans d'expérience en tant qu'ingénieur de production
Titulaire d'un Bac +5.
Compétences techniques - niveau maîtrise attendu (autonomie complète en contexte multiplateforme) :
Concepts et pratiques Site Reliability Engineering
Outils de supervision, monitoring, gestion des logs, traces, métriques et alerting : Prometheus, Grafana, Splunk (Centreon et Tempo présents sur le périmètre)
Environnements conteneurisés et orchestrés : Kubernetes, Docker
Systèmes Linux et Windows
Scripting Python et Shell Linux
SGBD : PostgreSQL, MariaDB
Socle applicatif JBoss / Spring Boot
Architectures distribuées, microservices, infrastructures Cloud/hybrides
Environnements virtualisés VMware
Automatisation et pratiques DevOps
Gestion des événements, incidents et problèmes (ITIL / SRE)
Niveau expert attendu :
Gestion de crise et incidents majeurs
Capacités rédactionnelles : documentation technique, cahier des charges, comptes rendus
Capacités relationnelles écrites et orales : écoute, conduite de réunion, négociation
Autonomie, travail collaboratif et partage de connaissances
Force de proposition et amélioration continue
Soft skills : capacité à diagnostiquer et résoudre des incidents complexes, aptitude à travailler en coordination avec plusieurs équipes techniques, obligation de conseil dans son domaine d'expertise.
Infos complémentaires
Publiée le 03/08/2026 - Réf : 50e61e1f4e172fc3a130fa6c358059d4