LEAD SRE (F/H)
Clichy, 92110
CDI
01/10/2026
Description
Nexpublica est un acteur historique de l’édition de logiciels pour le secteur public, parapublic, et privé. L’entreprise accompagne plus de 4 000 organismes publics et 1 200 entreprises privées.
Nous concevons des logiciels performants, fluides et sécurisés, avec une mission : mettre l’innovation technologique au service du mieux-vivre ensemble.
Tous nos postes sont ouverts aux personnes en situation de handicap
Missions
Dans le cadre du développement et de la montée en puissance de notre plateforme Cloud, nous recherchons un(e) Lead Site Reliability Engineer (SRE).
Véritable référent(e) de la fiabilité de la plateforme, vous êtes garant(e) de la disponibilité, de la performance et de la résilience des services hébergés. Vous accompagnez l'équipe SRE au quotidien, définissez les bonnes pratiques et assurez une collaboration étroite avec les équipes Produit, Infrastructure et Sécurité afin d'améliorer en continu l'expérience de nos utilisateurs.
Missions et activités principales
Assurer la fiabilité et l'observabilité de la plateforme
Définir, suivre et faire évoluer les indicateurs SLI, SLO et SLA des produits.
Concevoir et maintenir les tableaux de bord, métriques et mécanismes d'alerte.
Garantir un niveau d'observabilité adapté sur l'ensemble des services.
Anticiper les problématiques de capacité, de performance et de montée en charge.
Améliorer continuellement la disponibilité et la résilience de la plateforme.
Piloter la gestion des incidents
Coordonner la gestion des incidents majeurs et animer les cellules de crise.
Mobiliser et accompagner les différentes équipes jusqu'au retour à la normale.
Organiser les analyses post-incidents et assurer le suivi des plans d'actions.
Améliorer les procédures d'exploitation, les runbooks et les mécanismes d'alerte.
Participer à l'organisation et à l'amélioration du dispositif d'astreinte.
Accompagner les projets et les mises en production
Intervenir en amont des projets pour intégrer les exigences de fiabilité et d'exploitabilité.
Participer au dimensionnement des infrastructures et à l'estimation des coûts associés.
Valider la préparation opérationnelle des produits avant leur passage en production.
Fiabiliser les pipelines CI/CD et les déploiements GitOps.
Automatiser les tâches récurrentes et optimiser les opérations de production.
Garantir le maintien en conditions opérationnelles et la sécurité
Assurer le suivi des sauvegardes, correctifs et montées de version.
Participer à la définition, aux tests et à l'amélioration des PCA/PRA.
Collaborer avec les équipes Infrastructure et Sécurité dans le suivi des vulnérabilités.
Veiller au respect des standards techniques et des bonnes pratiques de la plateforme.
Contribuer à l'optimisation des coûts Cloud
Suivre la consommation des ressources Cloud.
Identifier les écarts, dérives et leviers d'optimisation.
Rechercher le meilleur équilibre entre performance, fiabilité et maîtrise des coûts.
Animer et faire grandir l'équipe SRE
Définir les priorités et contribuer à la feuille de route SRE.
Accompagner les ingénieurs SRE dans leur montée en compétences.
Apporter un support sur les problématiques techniques complexes.
Faire évoluer la documentation, les standards et les processus d'onboarding.
Promouvoir la culture SRE auprès des différentes équipes.
Être l'interlocuteur privilégié sur les sujets liés à la fiabilité des services.
Compétences requises
Techniques
Excellente maîtrise des environnements Cloud et des architectures distribuées.
Solide expertise Kubernetes et des écosystèmes conteneurisés.
Expérience avancée des outils d'observabilité et de monitoring.
Maîtrise des pratiques Infrastructure as Code et GitOps.
Bonne connaissance des pipelines CI/CD et de l'automatisation.
Compréhension des enjeux de sécurité applicative et infrastructure.
Sensibilité aux problématiques FinOps et optimisation des ressources Cloud.
Comportementales
Leadership technique et capacité à fédérer les équipes.
Excellent sens de l'analyse et de la résolution de problèmes.
Capacité à prendre des décisions dans des contextes critiques.
Esprit de coopération et aisance dans les environnements transverses.
Excellentes compétences en communication et en vulgarisation technique.
Rigueur, autonomie et sens des responsabilités.
Environnement technique
Notre plateforme s'appuie principalement sur les technologies suivantes :
Kubernetes
Terraform
Argo CD
GitLab
Prometheus
Thanos
Grafana
Loki
Vault
Kyverno
Profil
Formation supérieure en informatique, systèmes ou infrastructures.
Expérience significative en Site Reliability Engineering, plateforme Cloud ou exploitation à grande échelle.
Expertise avérée des environnements Kubernetes et des architectures distribuées.
Expérience concrète de la gestion d'incidents critiques et des dispositifs d'astreinte.
Maîtrise des pratiques d'observabilité, d'automatisation et de CI/CD.
Expérience en tant que Lead, référent technique ou accompagnement d'équipe.
Capacité à travailler dans un environnement exigeant, collaboratif et orienté amélioration continue.
Pourquoi nous rejoindre ?
Participer à la construction et à l'évolution d'une plateforme Cloud stratégique.
Relever des défis techniques à fort impact.
Évoluer dans un environnement favorisant l'autonomie, la collaboration et l'innovation.
Contribuer activement à la diffusion des bonnes pratiques SRE et à l'amélioration continue des services.
