RIDCHA DATA

Ingénieur de Production / Site Reliability Engineering (SRE)

Sophia Antipolis, Provence-Alpes-Côte d'Azur · Posted Jul 28

salary not listedcontract
AnsibleDockerMySQLLinuxGitLab CIGitOpsBashKubernetesZabbixGrafanaOpenSearchRedisRundeckRancherNGINXVaultMorpheus CMPS3Airflow

Job Description

Contexte de la mission Dans le cadre de l exploitation d une prestation critique hébergée sur un Cloud privé, nous recherchons un Ingénieur de Production / Site Reliability Engineering (SRE) afin d intégrer une équipe de 5 ingénieurs en charge du maintien en conditions opérationnelles (MCO) d une plateforme stratégique pilotée par un ministère. Vous contribuerez à garantir la disponibilité, la fiabilité et la performance des applications en production tout en accompagnant la transformation vers un modèle SRE et Cloud. Vos missions Assurer le MCO des applications et infrastructures en environnement Cloud privé. Garantir le respect des SLA et le traitement des tickets Jira. Superviser les plateformes, assurer le monitoring et l observabilité des systèmes. Analyser les incidents, identifier les causes racines et mettre en œuvre des actions correctives durables. Automatiser les opérations d exploitation via Ansible, scripts Bash et outils DevOps. Participer aux déploiements applicatifs et infrastructures (CI/CD, GitOps). Gérer les environnements Recette, Préproduction et Production. Administrer les plateformes Docker et Kubernetes. Optimiser les performances, la disponibilité et la résilience des services. Maintenir et enrichir la documentation d exploitation. Collaborer avec les équipes de développement, infrastructure et Service Delivery. Compétences indispensables Ansible Docker MySQL Observabilité / Monitoring Linux GitLab CI / GitOps Bash / scripting Kubernetes Gestion des incidents de production Français courant Compétences appréciées Zabbix Grafana OpenSearch Redis Rundeck Rancher RKE2 NGINX Vault Morpheus CMP S3 Airflow Réseau (LAN/WAN, routage, Load Balancer, TLS, PKI) ITIL ISO 27001 / ISO 9001 Soft Skills Excellente capacité d analyse et de résolution d incidents. Résistance au stress et gestion des priorités. Esprit d équipe et sens du service. Forte autonomie. Bonnes capacités de communication. Force de proposition et démarche d amélioration continue. Capacité à évoluer dans un environnement critique. Livrables Respect des SLA et traitement des tickets Jira. Documentation d exploitation. Automatisation des procédures. Mise en production des évolutions. Suivi de la disponibilité et des performances des plateformes.