Site Reliability Engineer - N H/F - OVHCloud
- Paris 17e - 75
- CDI
- OVHCloud
Les missions du poste
Au sein de votre équipe #OneTeam
- Rejoindre le département IT, Technology & Product, qui conçoit, développe et opère les produits, les services et les infrastructures d'OVHcloud.
- Intégrer l'équipe Delivery & Operations dans le Sovereign Group, en charge de la livraison industrialisée et de l'exploitation en production de trois plateformes souveraines (SNC Cloud Platform, OPCP, BMPOD SNC).
Vos principales responsabilités
- Industrialiser et fiabiliser la livraison des plateformes (provisioning, configuration, GitOps avec FluxCD, Ansible, Terraform).
- Maintenir et faire évoluer le socle Kubernetes ainsi que les opérateurs gérant le cycle de vie des plateformes.
- Garantir la disponibilité, la performance et la sécurité en production en pilotant les SLI/SLO et les budgets d'erreur.
- Déttecter, diagnostiquer et corriger les anomalies via Prometheus, Grafana et OpenTelemetry.
- Traiter la cause racine des incidents, automatiser le BAU et participer à la rotation d'astreinte.
- Assurer le durcissement (hardening), le patch management et participer aux audits de conformité (SecNumCloud).
- Rédiger et versionner la documentation technique et les runbooks.
- Intégrer et opérer avec des briques d'IA (copilotes de diagnostic, agents, RAG, triage d'alertes) pour augmenter l'équipe au quotidien.
Votre futur impact
Dans 6 mois
- Vous maîtriserez le périmètre d'exploitation des plateformes souveraines et participerez en autonomie à la rotation d'astreinte.
- Vous aurez contribué à l'industrialisation des livraisons d'infrastructure via nos pipelines GitOps et d'IaC.
- Vous commencerez à utiliser et enrichir nos copilotes et outils d'IA d'exploitation au quotidien.
Et dans 1 an
- Vous jouerez un rôle clé dans l'architecture et la fiabilité à long terme des plateformes cloud souveraines.
- Vous serez autonome pour concevoir et déployer des agents ou workflows IA complexes améliorant l'observabilité et le self-healing.
- Vous contribuerez activement aux démarches d'audit et de qualification de haut niveau de sécurité (SecNumCloud).
C
Le profil recherché
Compétences requises:
- Vous maîtrisez les fondamentaux de Linux, du réseau (TCP/IP, DNS) et l'écosystème cloud-native.
- Vous avez une expérience solide en gestion d'orchestrateurs de conteneurs en production (idéalement Kubernetes) et en pratiques SRE (SLI/SLO, astreintes, gestion d'incidents).
- Vous maîtrisez les outils de CI/CD en mode GitOps (FluxCD, ArgoCD) ainsi que l'IaC et l'automatisation (Terraform, Ansible, Git).
- Vous développez en Python et/ou en Go pour créer des outils et services robustes.
- Vous avez des notions de durcissement d'infrastructure (hardening) et connaissez les mécanismes de sécurité réseau et système.
- Vous utilisez au quotidien des outils d'IA pour optimiser vos opérations.
- Vous êtes à l'aise en anglais pour évoluer dans un environnement international.
- Vous êtes proactif, responsable, exigeant sur la qualité, team player et doté d'un esprit critique face aux résultats produits par l'IA.
C'est un +
- Vous avez une expérience dans l'intégration de modèles de langage (RAG, prompt engineering, frameworks d'agents, MCP) ou le déploiement OpenStack / Bare Metal.
- Vous connaissez les normes de qualification ou certification : SecNumCloud, PCI DSS, ISO 27001, HDS.
- Vous avez opéré des charges GPU / serveurs d'inférence (vLLM, Triton) ou participé à des projets Open Source.
Site Reliability Engineer (F/H/N)
- Vous maîtrisez les fondamentaux de Linux, du réseau (TCP/IP, DNS) et l'écosystème cloud-native.
- Vous avez une expérience solide en gestion d'orchestrateurs de conteneurs en production (idéalement Kubernetes) et en pratiques SRE (SLI/SLO, astreintes, gestion d'incidents).
- Vous maîtrisez les outils de CI/CD en mode GitOps (FluxCD, ArgoCD) ainsi que l'IaC et l'automatisation (Terraform, Ansible, Git).
- Vous développez en Python et/ou en Go pour créer des outils et services robustes.
- Vous avez des notions de durcissement d'infrastructure (hardening) et connaissez les mécanismes de sécurité réseau et système.
- Vous utilisez au quotidien des outils d'IA pour optimiser vos opérations.
- Vous êtes à l'aise en anglais pour évoluer dans un environnement international.
- Vous êtes proactif, responsable, exigeant sur la qualité, team player et doté d'un esprit critique face aux résultats produits par l'IA.
C'est un +
- Vous avez une expérience dans l'intégration de modèles de langage (RAG, prompt engineering, frameworks d'agents, MCP) ou le déploiement OpenStack / Bare Metal.
- Vous connaissez les normes de qualification ou certification : SecNumCloud, PCI DSS, ISO 27001, HDS.
- Vous avez opéré des charges GPU / serveurs d'inférence (vLLM, Triton) ou participé à des projets Open Source.
Site Reliability Engineer (F/H/N)