Responsable DevOps
Save this job and keep your search organized
Create a free account to save jobs, create alerts and return to this listing from your dashboard.
By continuing, you agree to our Terms & Privacy Policy.
Chez Web Hosting Canada (WHC), nous sommes passionnés par le fait d’aider les Canadiens à réussir en ligne grâce à des services d’hébergement web fiables et axés sur le marché local. Depuis 2003, nous aidons les entreprises et les particuliers à réussir grâce à des solutions de qualité en matière de sites web, de domaines et de courriel.
L’occasion
WHC est à la recherche d’un ou d’une Responsable DevOps, pratique et techniquement chevronné(e), pour prendre en charge la performance, la fiabilité et la santé opérationnelle de notre parc de serveurs. Relevant du directeur ou de la directrice de la technologie, vous garderez nos serveurs rapides et disponibles, mettrez de l’ordre et de la cohérence dans notre façon d’exploiter le parc, et veillerez à ce que l’automatisation, la sécurité et les sauvegardes soient solides afin que les problèmes cessent de se répéter. Il s’agit d’un rôle axé sur l’exécution : un opérateur ou une opératrice qui mène par l’exemple et établit les standards par la pratique, et non un ou une gestionnaire qui dirige à distance. Vous établirez les standards pour une petite équipe d’ingénieurs DevOps et d’administration système, mais le quotidien repose sur la propriété technique, et non sur la gestion d’effectifs. Ce n’est pas un rôle de garde; nos administrateurs système sont les premiers intervenants 24 heures sur 24, 7 jours sur 7, et vous êtes le niveau supérieur.
Ce que vous ferez
- Garder nos serveurs rapides et disponibles : planifier la croissance, puis repérer et résoudre les problèmes de performance (processeur, disque, bases de données, serveurs web) avant qu’ils ne deviennent des incidents.
- Amener le parc à un état connu et cohérent : réduire les configurations uniques, combler les écarts et faire de « à quoi devrait ressembler un serveur WHC » une référence claire à laquelle toute l’équipe peut se fier.
- Traiter Git comme la source unique de vérité pour la configuration des serveurs; automatiser le travail routinier afin que les changements soient sûrs et reproductibles, et ajouter des vérifications qui signalent lorsqu’un serveur s’écarte de son état attendu.
- Garder nos serveurs renforcés et obtenir de vraies réponses sur l’efficacité réelle de nos outils actuels, et soutenir nos travaux liés à PCI DSS et SOC 2.
- Veiller à ce que les sauvegardes soient fiables et à ce que nous puissions reconstruire un serveur complet dans notre délai de reprise cible, y compris une capacité de migration de serveur reproductible et documentée. Testez la restauration; ne vous fiez pas au document.
- Bâtir et maintenir une solide bibliothèque de runbooks opérationnels, en gardant nos procédures à jour et fiables afin que l’équipe dispose toujours d’une bonne documentation.
- Être le principal point de contact opérationnel au quotidien pour nos fournisseurs d’infrastructure : soutien, escalades et enjeux opérationnels.
- Chercher des façons plus simples, plus sûres et plus efficaces d’exploiter nos systèmes, y compris l’utilisation prudente et pratique de l’IA dans le travail opérationnel.
- Encadrer les ingénieurs autour de vous, établir des attentes claires et bien collaborer avec le Développement et l’Administration système. Diriger en assumant les résultats, et non en comptant les heures.
Ce que vous apportez
- De solides compétences Linux pratiques sur un parc de serveurs, et pas seulement dans des environnements infonuagiques ou de conteneurs. Vous êtes à l’aise d’exploiter plusieurs machines à la fois et de les rendre cohérentes.
- De solides compétences en script et en automatisation (Bash, plus Python ou Perl), et une réelle expérience de la gestion de la configuration des serveurs dans Git et de l’automatisation sécuritaire des changements.
- MySQL/MariaDB en production : réplication, optimisation, sauvegarde et restauration.
- De l’expérience en sauvegardes et en reprise après sinistre, y compris le respect d’un délai de reprise défini.
- Un état d’esprit axé sur la surveillance et la performance : vous trouvez le goulot d’étranglement plutôt que d’attendre le billet.
- Des réflexes de sécurité par défaut pour le renforcement et l’exploitation des serveurs.
- Excellent anglais parlé et écrit; vous communiquerez clairement avec notre équipe et nos fournisseurs.
- Un sens de la propriété : vous menez un problème jusqu’au bout, vous documentez votre travail et vous ne devenez pas le goulot d’étranglement des autres.
- Une communication claire et calme : vous savez rassurer une équipe pendant un incident et expliquer un enjeu technique en langage simple.
- Une expérience substantielle dans des rôles en systèmes ou en opérations Linux, y compris une certaine expérience dans l’établissement de standards ou la direction d’une petite équipe. L’étendue compte plus que le nombre d’années.