Ingénieur.e de plateforme

3 days ago

Montréal QC, Montreal Regional Municipality, QC; Montréal region; Québec Province, Canada LoiZéro Full-time

LoiZéro est une organisation à but non lucratif, fondée par Yoshua Bengio, axée sur la sécurité de l'IA. En charge de la technologie, le département informatique supervise la cybersécurité, le support aux utilisateur.trices finaux et la gestion de l'environnement de calcul utilisé pour atteindre notre mission.

Vous serez responsable de la couche de plateforme qui se situe entre nos employé.e.s et l'infrastructure GPU : les pipelines CI/CD, les clusters Kubernetes, les environnements infonuagiques et les normes qui les maintiennent cohérents et sécurisés. Il s'agit d'un rôle technique au sein d'une petite équipe, avec une large surface et beaucoup de marge pour façonner la façon dont les choses sont construits.

Responsabilités principales

  • Concevoir, déployer et exécuter des clusters Kubernetes pour les charges de travail de recherche, l'auto-mise à l'échelle, les politiques de réseau et l'isolation des charges de travail, à la fois sur site et dans des environnements infonuagiques.
  • Définir, communiquer et appliquer les meilleures pratiques pour les pipelines CI/CD : builds automatisées, tests, création d'images de conteneurs et déploiements, avec l'analyse de sécurité et la provenance intégrées dans le pipeline.
  • Mettre en œuvre et gérer des services internes soutenant nos équipes de recherche et de données, en leur fournissant une plateforme fiable et sécurisée. Par exemple des dépôts d'artefacts, des registres de conteneurs, etc.
  • Gérer nos environnements cloud sous forme de code (Terraform ou équivalent) : comptes, réseau, identité, secrets et visibilité des coûts.
  • Définir et défendre les normes de plateforme: images de base, modèles de déploiement, promotion de l'environnement afin que les chercheur.se.s et les ingénieur.e.s livrent sans réinventer la roue à chaque nouveau déploiement.
  • Travailler à la frontière entre Kubernetes et notre cluster HPC : flux de travail conteneurisés qui doivent s’interfacer avec ceux roulant sous Slurm, accès au stockage partagé et mise en place d’outils qui rendent les deux environnements cohérents pour un chercheur.se.s
  • Intégrer l'observabilité dans la plateforme : métriques, journaux, traces et alertes qui rendent les pannes évidentes et le débogage rapide. Nous utilisons actuellement Prometheus et Grafana.
  • Intégrer des contrôles de sécurité dans tout ce qui précède : IAM à privilège minimum, gestion des secrets, intégrité de la chaîne d'approvisionnement pour les dépendances et les images, segmentation du réseau et pistes d'audit.
  • Documenter ce que vous construisez et automatiser ce que vous répétez. Réduire le nombre de choses qui ne fonctionnent que parce qu'une seule personne se souvient comment faire.
  • Participer à la réponse aux incidents pour les services de plateforme et au travail post-incident qui empêche le même problème de se reproduire.

Compétences et qualifications

  • 3 à 5 ans dans l'ingénierie de plateforme, DevOps, SRE, ou un rôle d'infrastructure étroitement lié.
  • Expérience de production avec Kubernetes. Non seulement le déploiement, mais aussi son exploitation : mises à jour, RBAC, réseau, stockage, dépannage d'un cluster qui se comporte mal.
  • Solide expérience CI/CD avec des outils modernes (GitHub Actions, GitLab CI, Jenkins ou similaire), y compris la construction de pipelines à partir de zéro.
  • L'expérience de l'architecture, du déploiement et de la maintenance d'un flux de travail GitOps est un atout.
  • Expérience pratique avec au moins un fournisseur d