Recrutement 3DS Outscale

Ingénieur DevOps Confirmé H/F - 3DS Outscale

  • Saint-Cloud - 92
  • CDI
  • 3DS Outscale
Publié le 5 octobre 2026
Postuler sur le site du recruteur

Les missions du poste


Nous recrutons un(e) ingénieur(e) DevOps confirmé(e) afin de renforcer notre équipe AI Factory.

OUTSCALE, marque de Dassault Systèmes, est un opérateur souverain et durable de l'Expérience en tant que Service qui offre à ses clients des environnements technologiques de confiance.

Nous offrons des expériences uniques grâce au savoir-faire de nos équipes passionnées, qui se reflète notamment par la création de solutions de Business Expériences, le développement de notre propre orchestrateur Cloud, TINA OS, ou encore l'obtention de la qualification SecNumCloud.

L'AI Factory de Dassault Systèmes conçoit et opère la plateforme d'intelligence artificielle du groupe, de l'infrastructure matérielle jusqu'aux services PaaS exposés aux équipes produits.

Notre salle héberge des racks NVIDIA GB200/300NVL72, sur lesquels tournent des workloads d'entraînement, d'inférence LLM et des environnements de développement pour les équipes data science. À cette échelle, la valeur de la plateforme dépend directement de sa capacité àêtre déployée, mise à jour et exploitée de façon reproductible : clusters Kubernetes, GPU, chaîne de livraison des services, supervision de bout en bout, diagnostic rapide lorsqu'un workload ne démarre pas ou ne tient pas ses performances.

Nous recherchons un(e) ingénieur(e) DevOps confirmé(e) pour prendre en charge l'industrialisation et l'exploitation de cette plateforme,puis pour accompagner son intégration avec l'infrastructure IaaS du groupe.

Missions

Rattaché(e) au responsable de l'AI Factory, vous serez en charge de :

  • L'exploitation des clusters Kubernetes GPU : le maintien en condition opérationnelle des clusters (montées de version Kubernetes, GPU Operator,drivers et CUDA, ordonnanceur GPU), la gestion de la capacité et des node pools, les quotas et priorités entre équipes, la définition et le suivi des SLO de laplateforme.
  • La chaîne de livraison et GitOps : la mise en place et le maintien des pipelines CI/CD et du déploiement continu (Argo CD ou Flux) pour les composants de la plateforme, la gestion des versions et de leur compatibilité, l'environnements de tests et de pré-production, stratégies de rollout et de rollback.
  • L'Infrastructure as Code : provisionnement et configuration de l'infrastructure (Terraform, Ansible, Helm), la gestion des registres d'images et des artefacts, la construction d'images multi-architecture (arm64, amd64), pinning et le scan desdépendances.
  • Le diagnostic et la résolution d'incidents : la prise en charge des problèmes de bout en bout, de l'end point exposé jusqu'au pod GPU (ordonnancement, stockage, réseau, images, communication inter-noeuds) ; reproduction des incidents, rootcause analysis, rédaction de post-mortems et de runbooks.
  • La supervision et l'observabilité : la mise en place et l'enrichissement de la supervision de la plateforme (Prometheus/Grafana, métriques GPU via DCGM, la centralisation des logs, alerting), tableaux de bord par équipe, sonde ssynthétiques et outillage de debug.
  • Le support des workloads IA : accompagnement des équipes data science et MLOps dans le déploiement de leurs entraînements et de leurs serveurs d'inférence (gestion des poids de modèles, stockage partagé, exposition des API), maintien des templates et exemples de référence, support de niveau 3.
  • L'intégration AI Factory / IaaS : la participation à l'étude et à la conception de l'intégration de la plateforme avec l'infrastructure IaaS du groupe (provisionnement, identités, exposition des services), en vue d'une offre intégrée avec le reste des produits.
  • La performance des modèles déployés : la participation à l'élaboration des processus d'amélioration des performances des modèles spécifiques et des LLM en production (campagnes de benchmark de débit et de latence, mesure de l'utilisation GPU, tuning des paramètres de serving tels que batching, quantification, parallélisme, cache KV, choix des tailles d'instances), définition des indicateurs de performance, suivis dans la supervision et boucle de retour vers les équipes data science.

Stack technique

  • Matériel : racks NVIDIA GB200/300 NVL72, fabric haute performance, stockage partagé
  • Plateforme : Kubernetes, NVIDIA GPU Operator, ordonnanceur GPU, opérateurs et CRD, Gateway API / ingress, serveurs d'inférence LLM (vLLM ou équivalent), PyTorch
  • Livraison et outillage : Git, GitLab CI ou GitHub Actions, Argo CD ou Flux,Helm, Kustomize, Terraform, Ansible, containerd/Docker, registre d'images, Python, bash
  • Observabilité : Prometheus/Grafana, DCGM exporter, Loki ou ELK, alerting
  • Pratiques : GitOps, Infrastructure as Code, gestion d'incidents et de changements, post-mortems

Votre profil

  • Diplômé(e) d'une école d'ingénieurs ou équivalent, vous avez 3 ans minimum d'expérience post-diplôme en exploitation de plateformes Kubernetes en production ou d'infrastructures à fort enjeu.
  • Vous avez une expertise avérée de Kubernetes et de troubleshooting de niveau 3 : vous savez remonter d'un service exposé à un pod, d'un pod à un noeud, et isoler un problème complexe qui traverse plusieurs couches (ordonnanceur, stockage, réseau, image).
  • Vous maitrisez GitOps et l'Infrastructure as Code (Argo CD ou Flux,Helm, Terraform) c'est la compétence structurante du poste, qui vous permettra de faire passer la plateforme en mode produit et d'accompagner le chantier d'intégration AI Factory / IaaS.
  • Vous avez une expérience des workloads GPU ou HPC (GPU Operator, ordonnanceurs GPU,NCCL, MIG) ou du serving de LLM.

    A défaut, vous avez une solide expérience sur Kubernetes et l'envie de monter sur ces technologies.

  • Vous maitrisez l'automatisation (Python, bash, Ansible) et vous êtes à l'aise avec un environnement Linux.
  • Vous avez une bonne compréhension des opérateurs Kubernetes et des CRD.
  • Une expérience de développement en Go est un plus, pas un prérequis.
  • Vous êtes rigoureux et appréciez communiquer avec des interlocuteurs variés (data scientists, infrastructure, sécurité, réseau).
  • Anglais courant à l'écrit (documentation constructeur, support NVIDIA, communautés Kubernetes).
  • Astreinte possible selon organisation de l'équipe

Nous rejoindre c'est aussi

  • Intégrer une entreprise scientifique au coeur de l'innovation technologique, portée par une forte croissance depuis plus de 40 ans
  • Vous souhaitez en savoir plus ? N'hésitez pas à nous suivre sur Linkedin et découvrez nos dernières offres et actus.

Principaux avantages et bénéfices :

  • Environnement multiculturel
  • Cadre de travail convivial axé sur le bien-être et la santé
  • Engagement en faveur de la diversité et de l'inclusion
  • Politique dynamique de développement de carrière : plan de formation, mobilités internes, etc.

Déclaration de diversité

Dassault Systèmes, avant-gardiste en matière de technologie et d'innovation durable, s'efforce de créer des équipes toujours plus inclusives et diverses à travers le monde. Nous avons la forte conviction que nos employés sont notre atout numéro 1 et nous voulons que tous, se sentent libres d'être pleinement qui ils sont vraiment. Notre objectif est qu'ils ressentent fierté et sentiment d'appartenance. En tant qu'entreprise à la pointe du changement, il nous incombe de favoriser l'inclusion de tous et participer à création du monde de demain.

Postuler sur le site du recruteur

Ces offres pourraient aussi vous correspondre.

Parcourir plus d'offres d'emploi