Sre Forte Expertise Kub et Aiops H/F ClubSec
- Courbevoie - 92
- Freelance
- Bac +5
- Services aux Entreprises
À noter sur ce job
Vous avez ces compétences ? Cliquez dessus pour les ajouter rapidement à votre profil !
Détail du poste
Le besoin
Contexte de la mission
Nous recherchons une expertise en DevOps et Site Reliability Engineering (SRE) afin de contribuer à la construction et à l'exploitation d'une plateforme sécurisée, réglementée et hautement disponible dédiée aux instruments financiers tokenisés.
Nous développons une nouvelle capacité dédiée aux actifs numériques, destinée à prendre en charge la tokenisation, les technologies de registres distribués et la prochaine génération d'infrastructures des marchés financiers.
Nous recherchons une expertise en Infrastructure as Code, Kubernetes, plateformes de conteneurs et pipelines CI/CD, afin d'établir des fondations évolutives et de permettre des déploiements contrôlés, sans interruption de service.
Une observabilité complète est requise sur les métriques, les logs, les traces, les alertes, les objectifs de niveau de service et les budgets d'erreur, afin de soutenir un service opérationnel 24h/24 et 7j/7. Nous recherchons également un accompagnement opérationnel couvrant la gestion des astreintes, la réponse aux incidents, la rédaction de runbooks exploitables, les analyses post-incident et le maintien de la stabilité de la plateforme pendant les phases d'évolution rapide des produits et des technologies.
La mission devra intégrer des pratiques d'infrastructure sécurisées et auditables, adaptées aux environnements réglementés. Elle impliquera notamment une collaboration avec les parties prenantes de la sécurité ainsi que la mise en place de contrôles rigoureux autour de l'ingénierie assistée par l'IA.
Nous recherchons également une expertise dans l'application de l'AIOps pour la détection des anomalies, le triage des alertes, la synthèse des incidents ainsi que la supervision, l'exploitation et le retour arrière des services IA/ML intégrés aux produits.
Objectifs et livrables
Nous recherchons une expertise spécialisée en DevOps et Site Reliability Engineering afin d'établir une base opérationnelle résiliente pour une plateforme réglementée dédiée aux actifs numériques et de garantir une fourniture de services fiable et évolutive.
Concevoir et mettre en oeuvre une Infrastructure as Code maintenable, notamment à l'aide de Terraform, ainsi qu'une configuration versionnée et contrôlée.
Construire et optimiser des pipelines CI/CD sécurisés, prenant en charge l'intégration continue, le déploiement continu, les validations automatisées, les processus d'approbation, l'auditabilité et les mises en production sans interruption de service.
Concevoir et exploiter des workloads conteneurisés avec Kubernetes et les technologies d'orchestration associées.
Mettre en oeuvre une solution d'observabilité de bout en bout couvrant les métriques, la centralisation des logs, le traçage distribué, les tableaux de bord, les alertes et les indicateurs de santé opérationnelle.
Définir et rendre opérationnels les objectifs de niveau de service, les indicateurs de niveau de service et les pratiques de budget d'erreur, en cohérence avec les exigences de fiabilité de la plateforme.
Mettre en place un modèle opérationnel d'astreinte efficace 24h/24 et 7j/7, incluant les procédures d'escalade, les workflows de gestion des incidents, les règles de responsabilisation et les pratiques de continuité de service.
Produire et maintenir des runbooks clairs et exploitables pour les tâches opérationnelles récurrentes, les scénarios de défaillance, les déploiements, les reprises de service et la réponse aux incidents.
Renforcer la sécurité de l'infrastructure grâce au durcissement des systèmes, à la gestion des accès selon le principe du moindre privilège, à la gestion des secrets, à la remédiation des vulnérabilités, aux contrôles de conformité et à une gestion auditable des changements.
Appliquer des outils d'ingénierie assistée par l'IA à la conception de l'Infrastructure as Code et à la rédaction des pipelines, avec une revue humaine documentée et des contrôles d'approbation avant déploiement.
Mettre en oeuvre des capacités AIOps pour la détection des anomalies, le triage des alertes, la synthèse des incidents et la préparation des analyses post-incident.
Déployer, superviser, exploiter et, si nécessaire, effectuer un retour arrière sécurisé des services IA/ML intégrés aux produits, en assurant notamment le suivi de leurs performances, de leur disponibilité et de leur fonctionnement opérationnel.
Fournir la documentation technique, les décisions d'architecture, les procédures opérationnelles, les indicateurs de fiabilité et les recommandations d'amélioration continue.
Garantir la stabilité et la disponibilité de la plateforme pendant les phases d'évolution rapide des produits, tout en maintenant les standards applicables aux workloads réglementés et les objectifs de déploiement sans interruption de service.
Le profil recherché
Profil recherché
Compétences demandées
Docker / Kubernetes Expert
Infrastructure as Code, Terraform et Ansible Expert
Langues
Anglais Bilingue
Infos complémentaires
La carte
48 Rue de Colombes
92400 Courbevoie
Publiée le 03/09/2026 - Réf : 64297896772528bff77065b5bf8321fe