**Note: French version below / La version française se trouve ci-dessous**
About the Role
Join the Operations Technology team to design, automate, deploy, and support reliable application platforms and CI/CD capabilities. You'll work closely with development, infrastructure, network, security, and production support teams to improve software delivery, platform stability, and operational resilience. The role requires strong hands-on experience with Kubernetes, Docker/Podman, Linux, CI/CD pipelines, GitHub, Python, and shell scripting, along with a solid grasp of modern DevOps and SRE practices. The ideal candidate is passionate about automation and reliability, and thrives on troubleshooting complex issues and driving continuous improvement.
Key Responsibilities
- Design, build, and maintain CI/CD pipelines and supporting deployment infrastructure
- Develop automated deployment solutions for Kubernetes and containerized environments, including Helm charts and YAML configurations
- Partner with development teams to improve build, test, and release processes
- Support deployments, configuration changes, and platform upgrades across environments
- Develop automation using Python and Linux shell scripting
- Manage GitHub repositories, branching strategies, and pull-request workflows
- Integrate automated testing, security scanning, and code-quality checks into CI/CD pipelines
- Troubleshoot application, container, Kubernetes, and network issues; investigate production incidents and implement corrective solutions
- Apply SRE principles to improve reliability, availability, and observability
- Define monitoring, alerting, and operational metrics
- Collaborate with infrastructure, network, database, security, and application teams
- Maintain technical documentation, runbooks, and troubleshooting guides
- Participate in design reviews, incident reviews, and an after-hours on-call rotation when required
Required Skills
- 5+ years of relevant experience in DevOps, SRE, platform, or infrastructure engineering
- Strong hands-on experience with Kubernetes (deployment, scaling, services, ingress, secrets)
- Strong experience with Docker/Podman and containerized environments
- Strong Linux/UNIX administration and shell scripting (Bash or KornShell)
- Hands-on automation experience with Python
- Strong understanding of CI/CD concepts and deployment strategies, with hands-on experience using tools like Jenkins and Artifactory
- Experience with Git/GitHub, including branching and release workflows
- Experience with YAML, Ansible, or equivalent automation frameworks
- Strong networking knowledge (DNS, TCP/IP, HTTP/HTTPS, TLS, proxies, load balancing)
- Understanding of SRE practices: monitoring, incident response, root-cause analysis
- Experience in Agile environments using tools like Jira
- Strong communication skills and ability to collaborate with globally distributed teams
- Ability to manage multiple priorities with limited supervision and participate in on-call rotation
_________________________
Ingénieur(e) DevOps, Kubernetes et fiabilité des systèmes (SRE)
À propos du poste
Rejoignez l'équipe Operations Technology pour concevoir, automatiser, déployer et soutenir des plateformes applicatives fiables ainsi que des capacités CI/CD. Vous collaborerez étroitement avec les équipes de développement, d'infrastructure, de réseau, de sécurité et de soutien à la production afin d'améliorer la livraison logicielle, la stabilité des plateformes et la résilience opérationnelle. Le rôle exige une solide expérience pratique avec Kubernetes, Docker/Podman, Linux, les pipelines CI/CD, GitHub, Python et le scripting shell, ainsi qu'une bonne compréhension des pratiques DevOps et SRE modernes. Le/la candidat(e) idéal(e) est passionné(e) par l'automatisation et la fiabilité, et aime résoudre des problèmes complexes tout en favorisant l'amélioration continue.
Principales responsabilités
- Concevoir, construire et maintenir les pipelines CI/CD et l'infrastructure de déploiement
- Développer des solutions de déploiement automatisées pour Kubernetes et les environnements conteneurisés, incluant les Helm charts et configurations YAML
- Collaborer avec les équipes de développement pour améliorer les processus de build, test et livraison
- Soutenir les déploiements, changements de configuration et mises à niveau de plateforme
- Développer de l'automatisation avec Python et le scripting shell Linux
- Gérer les dépôts GitHub, les stratégies de branchement et les flux de pull requests
- Intégrer les tests automatisés, l'analyse de sécurité et les contrôles de qualité de code dans les pipelines CI/CD
- Dépanner les problèmes applicatifs, de conteneurs, Kubernetes et réseau; investiguer les incidents de production et mettre en œuvre des solutions correctives
- Appliquer les principes SRE pour améliorer la fiabilité, la disponibilité et l'observabilité
- Définir la surveillance, les alertes et les métriques opérationnelles
- Collaborer avec les équipes d'infrastructure, réseau, base de données, sécurité et applications
- Maintenir la documentation technique, les runbooks et les guides de dépannage
- Participer aux revues de conception, revues d'incidents et à la rotation de garde après les heures, au besoin
Compétences requises
- 5 ans et plus d'expérience pertinente en DevOps, SRE, ingénierie de plateforme ou d'infrastructure
- Solide expérience pratique avec Kubernetes (déploiement, mise à l'échelle, services, ingress, secrets)
- Solide expérience avec Docker/Podman et les environnements conteneurisés
- Solides compétences en administration Linux/UNIX et en scripting shell (Bash ou KornShell)
- Expérience pratique en automatisation avec Python
- Solide compréhension des concepts CI/CD et des stratégies de déploiement, avec expérience pratique d'outils comme Jenkins et Artifactory
- Expérience avec Git/GitHub, incluant les stratégies de branchement et de livraison
- Expérience avec YAML, Ansible ou frameworks d'automatisation équivalents
- Solides connaissances réseau (DNS, TCP/IP, HTTP/HTTPS, TLS, proxys, équilibrage de charge)
- Compréhension des pratiques SRE : surveillance, réponse aux incidents, analyse des causes profondes
- Expérience en environnement Agile avec des outils comme Jira
- Solides compétences en communication et capacité à collaborer avec des équipes réparties mondialement
- Capacité à gérer plusieurs priorités avec supervision limitée et à participer à la rotation de garde