À propos de l’entreprise
Au sein de votre équipe #OneTeamOpenStack est le socle de notre Public Cloud : compute, réseau, stockage et identité. L’ensemble des services consommés par nos clients repose sur cette plateforme, déployée à grande échelle dans nos différentes régions.
VOTRE MISSION
SDE / SRE – OpenStack Platform
Vous rejoindrez la squad responsable de maintenir, moderniser et faire évoluer cette plateforme. Les principaux enjeux portent notamment sur la montée de version des composants OpenStack, la réduction de la dette technique et l’industrialisation des opérations de mise à jour, afin de les rendre régulières, prévisibles et avec un impact minimal pour nos clients. En tant que SDE / SRE à dominante plateforme et systèmes distribués, vous interviendrez sur l’ensemble du cycle de vie de la plateforme : exploitation, fiabilisation, automatisation, évolution et mise à niveau. Le poste combine run et engineering. Vous participerez au maintien en conditions opérationnelles de la plateforme au quotidien supervision, traitement des incidents et analyse des causes racines tout en prenant en charge des chantiers structurants liés aux upgrades, à l’automatisation, à l’observabilité et à la réduction de la dette technique. Vous monterez progressivement en autonomie sur des périmètres de plus en plus larges, accompagné par les membres seniors de l’équipe. Le poste est fortement transverse : OpenStack étant au cœur de nombreux services Public Cloud, vous collaborerez régulièrement avec les autres équipes d’OVHcloud, notamment les Product Owners, Tech Leads, Architectes et SRE. Vous évoluerez également dans un contexte d’intégration croissante de l’intelligence artificielle dans les opérations et les processus d’ingénierie, tout en vous familiarisant avec l’écosystème OpenStack upstream.
Responsabilités
- Vos principales responsabilités
- Participer à la définition de la stratégie de montée de version de la plateforme OpenStack : séquencement des composants, plans de bascule et de rollback, gestion des incompatibilités, en collaboration avec les Architectes et Tech Leads.
- Préparer et exécuter les opérations de mise à jour sur les différentes régions, de la qualification en environnement de test jusqu’au déploiement en production.
- Automatiser et industrialiser les opérations de mise à jour afin de les rendre répétables, sûres et à faible impact client : outillage de déploiement, tests de non-régression et validations pré et post-upgrade.
- Garantir la fiabilité, la performance, la sécurité et la disponibilité de la plateforme en production.
- Mettre en place et améliorer l’observabilité de la plateforme : métriques, logs, alerting et SLI/SLO.
- Réduire la dette technique du socle : alignement des versions, suppression des divergences entre régions et rapprochement de l’upstream afin de limiter les patchs locaux.
- Collaborer avec les équipes consommatrices d’OpenStack afin d’anticiper les impacts des montées de version et de coordonner les opérations.
- Identifier et mettre en œuvre des opportunités d’automatisation et d’optimisation, notamment via des workflows agentiques basés sur l’IA.
- Maintenir les standards DevOps de la squad : qualité du code, tests, documentation, runbooks et automatisation.
- Opérer et maintenir la plateforme en production dans la durée : run, gestion des incidents, analyse des causes racines, performance, sécurité et amélioration continue.
- Suivre les évolutions de l’écosystème OpenStack upstream : cycles de release, remontées de bugs et, lorsque pertinent, contributions.
- Contribuer activement à la feuille de route technique et challenger les choix afin d’améliorer continuellement la plateforme.
Responsabilités
- Dans les 6 mois
- Maîtrise du périmètre : comprendre l’architecture de notre plateforme OpenStack, ses spécificités par rapport à l’upstream et l’état du parc région par région.
- Collaboration : avoir établi des relations de confiance avec les Product Owners, Tech Leads, Architectes, SRE et équipes consommatrices de la plateforme.
- Run : être autonome dans la gestion d’incidents de production et être capable de les mener de bout en bout jusqu’à l’identification de la cause racine.
- Upgrades : avoir participé concrètement à une opération de montée de version en production et contribué à l’amélioration de son outillage.
- Fiabilisation : avoir contribué à améliorer l’observabilité, la résilience et la stabilité de la plateforme.
- IA : avoir identifié et initié des cas d’usage concrets de l’intelligence artificielle dans votre travail, notamment en diagnostic, tests, automatisation, observabilité ou documentation.
- Dans 1 an
- Industrialisation : piloter la montée de version d’un périmètre défini, de sa préparation jusqu’à sa mise en production, avec les SLO associés.
- Automatisation : avoir rendu les opérations de mise à jour significativement plus automatisées, prévisibles et moins coûteuses, avec des gains mesurables en durée, taux d’échec ou impact client.
- Expertise : être reconnu comme un contributeur de référence sur votre périmètre OpenStack au sein de Public Cloud Infrastructure.
- Transformation : avoir activement contribué aux transformations structurantes du périmètre et être capable de proposer et challenger les évolutions d’architecture.
- Standards : avoir fait progresser les pratiques de la squad grâce à la documentation, aux runbooks, au partage de connaissances et à l’accompagnement des nouveaux arrivants.
- IA & automatisation : avoir industrialisé des usages de l’IA sur votre périmètre avec des gains mesurables en efficacité, fiabilité ou qualité.
- Évolution : une mobilité vers d’autres squads PCI est possible et encouragée afin de poursuivre votre développement au sein de l’organisation.
Qualifications
Non spécifiées.
Compétences requises
- Bonne maîtrise d’OpenStack :