Description
Ce que nous allons accomplir ensemble : Rejoignez nos équipes et intervenez chez un acteur majeur du retail, dans un contexte de transformation digitale et de développement de ses plateformes e-commerce. En qualité de SRE (Site Reliability Engineer) vous garantirez la fiabilité, la disponibilité et la performance de ses systèmes dans un environnement à fort trafic et à forte exigence métier. Votre mission (…si vous l’acceptez !) : • Garantir la disponibilité, la fiabilité et la performance des plateformes digitales (e-commerce, applicatifs métiers) • Définir et suivre des SLO / SLA / SLI afin de piloter la qualité de service • Mettre en place des solutions de monitoring, logging et alerting (ex : Prometheus, Grafana, Cloud Monitoring, CloudWatch) • Automatiser les opérations et fiabiliser les systèmes via des scripts et outils (Python, Bash, Terraform) • Participer à la gestion des incidents de production (diagnostic, résolution, post-mortem, amélioration continue) • Optimiser la résilience et la scalabilité des architectures (multi-zones, haute disponibilité, auto-scaling) • Collaborer avec les équipes Dev, Cloud et Sécurité pour améliorer la robustesse des applications • Contribuer à la mise en place et à l’amélioration des pipelines CI/CD • Réduire la dette technique et améliorer la maintenabilité des systèmes • Mettre en œuvre les bonnes pratiques SRE (gestion des error budgets, réduction du toil, culture d’automatisation)
Profils recherchés
Vous : • Vous justifiez d’une expérience significative (5 ans minimum) en tant que SRE, DevOps ou Ingénieur Production dans des environnements critiques • Vous maîtrisez les environnements cloud AWS et/ou GCP ainsi que leurs services principaux • Vous avez une solide expérience en monitoring et observabilité (Prometheus, Grafana, CloudWatch, Cloud Monitoring) • Vous possédez de bonnes compétences en automatisation et scripting (Python, Bash, Terraform) • Vous êtes à l’aise avec les architectures conteneurs et Kubernetes (EKS / GKE) • Vous avez une bonne connaissance des concepts SRE (SLO, SLA, SLI, error budgets) • Vous comprenez les enjeux de haute disponibilité, performance et résilience dans des environnements à fort trafic • Vous avez déjà participé à la gestion d’incidents en production et à l’amélioration continue (post-mortem, fiabilisation) • Vous êtes autonome, rigoureux(se) et orienté(e) résolution de problèmes • Vous appréciez le travail en équipe et la collaboration avec les équipes développement, cloud et sécurité • Une ou plusieurs certifications cloud (AWS / GCP) sont un plus
