Talent.com
TobogganLabs
Ingénieur·e en fiabilité des sites - Site Reliability EngineerTobogganLabs • Montreal (administrative region), Quebec, CA
Ingénieur·e en fiabilité des sites - Site Reliability Engineer

Ingénieur·e en fiabilité des sites - Site Reliability Engineer

TobogganLabs • Montreal (administrative region), Quebec, CA
30+ days ago
Job type
  • Full-time
Job description

Ingénieur·e en fiabilité des sites - Site Reliability Engineer

Montréal, Quebec, Canada

La version anglaise suivra – English version will follow

Ingénieur·e en fiabilité des sites

Toboggan Labs est une firme-conseil boutique qui œuvre à l'intersection de l'IA et de la santé. Nous résolvons des problèmes humains complexes en appliquant des technologies de pointe combinées à une solide compréhension du domaine.

À propos du poste

Nous sommes à la recherche d'un·e ingénieur·e en fiabilité des sites (SRE) pour aider nos clients à concevoir et exploiter des systèmes de production fiables, observables et sécurisés.

Dans ce rôle, vous travaillerez aux côtés des équipes d'ingénierie et d'exploitation de nos clients pour améliorer la fiabilité des systèmes, réduire les tâches manuelles répétitives et bâtir les fondations opérationnelles — pipelines de déploiement, surveillance, gestion des incidents, infrastructure — qui maintiennent les systèmes en production en bonne santé.

Veuillez noter que, bien que nous soyons spécialisés dans le secteur de la santé et les industries réglementées, tous nos projets ne relèvent pas de ces domaines. Vous pourriez donc être amené·e à travailler sur des projets variés dans différents secteurs, selon les besoins.

Vos responsabilités quotidiennes

  • Ingénierie d'infrastructure et de sécurité — Concevoir et maintenir des infrastructures infonuagiques résilientes et sécurisées à l'aide d'outils d'infrastructure-as-code; implanter des contrôles de sécurité, des standards de durcissement et des guardrails de conformité dans les environnements clients.
  • Observabilité et fiabilité — Concevoir et implanter des systèmes de surveillance, d'alertes et de journalisation; piloter les processus de réponse aux incidents et de post-mortems; définir et suivre les SLO/SLI.
  • Automatisation et opérations de plateforme — Automatiser les pipelines de déploiement, le provisionnement d'infrastructure et les runbooks opérationnels pour réduire les tâches manuelles et améliorer la résilience des systèmes.
  • Sur certains mandats, leadership technique — Piloter le volet fiabilité et infrastructure, guider les équipes clients sur les pratiques SRE et contribuer aux décisions architecturales.
  • Soutien à l'équipe — Partager votre expertise en fiabilité et opérations, contribuer aux outils et à la documentation internes, mentorer des collègues et participer à la communauté Toboggan.

Nous recherchons des personnes ayant un solide historique en infrastructure infonuagique, DevOps et ingénierie de la fiabilité, qui abordent tout ce qu'elles construisent avec un souci de la sécurité. La majorité de nos clients utilisent AWS, Terraform, GitHub Actions ou des outils CI/CD similaires. Vous devez être à l'aise pour travailler à la frontière entre la fiabilité, la sécurité et les opérations TI.

Quand nous parlons de fiabilité des systèmes, nous cherchons quelqu'un qui traite la fiabilité comme une fonctionnalité à part entière, et non comme une réflexion après-coup — quelqu'un qui écrit du code pour éliminer les tâches répétitives, pense en termes de systèmes et construit des infrastructures aussi sécurisées qu'observables.

Nous vous encourageons à postuler si vous :

  • Avez 5 ans ou plus d'expérience en infrastructure, DevOps ou ingénierie de la fiabilité des sites.
  • Avez une expérience pratique avec des infrastructures AWS ou Azure et des outils d'infrastructure-as-code (Terraform, CloudFormation ou équivalents).
  • Avez une solide expérience avec les pipelines CI/CD (GitHub Actions, ArgoCD, Jenkins ou équivalents) et l'automatisation des déploiements.
  • Avez de l'expérience avec des outils d'observabilité (Prometheus, Grafana, Datadog, CloudWatch ou équivalents) et les processus de gestion des incidents.
  • Êtes familier·ère avec les bonnes pratiques de sécurité pour l'infrastructure infonuagique, incluant la sécurité réseau, l'IAM, le chiffrement et la gestion des vulnérabilités.
  • Possédez d'excellentes compétences en communication et êtes capable d'expliquer des concepts d'infrastructure et de fiabilité à des parties prenantes variées.
  • Êtes adaptable, autonome et à l'aise dans des environnements clients dynamiques.
  • Savez expliquer les compromis entre fiabilité et sécurité et les relier aux besoins d'affaires.

Atouts supplémentaires

  • Expérience dans des rôles orientés client (consultation, ingénierie d'implantation, services-conseils).
  • Expérience dans le secteur de la santé ou d'autres industries fortement réglementées.
  • Expérience en développement logiciel au-delà du simple scripting (développement de fonctionnalités, d'API ou d'applications).
  • Expérience avec l'orchestration de conteneurs (Kubernetes, ECS) et les outils de sécurité cloud-native.
  • Expérience en automatisation d'infrastructure à l'aide de scripts (Python, Bash) ou d'outils de workflow.
  • Détention de certifications pertinentes (AWS DevOps Professional, AWS Solutions Architect, CKA ou équivalentes).

Ce que nous offrons

  • Budget pour le bureau à domicile et la technologie.
  • Budget annuel de développement professionnel.
  • REER avec contribution de l'employeur après 1 an.
  • Dès le premier jour : Assurance santé et dentaire payée à 100 % par l'employeur, incluant un montant annuel pour les soins complémentaires (acupuncture, ostéopathie, massothérapie, naturopathie, psychologie, etc.).
  • Assurance vie et assurance invalidité de courte et de longue durée.
  • Complément de congé parental (8 semaines), disponible pour les employés ayant plus d'un an d'ancienneté, quel que soit le chemin vers la parentalité.

Bonus points if you:

  • Mettre en place une alerte emploi
#J-18808-Ljbffr
Create a job alert for this search

Ingénieur·e en fiabilité des sites - Site Reliability Engineer • Montreal (administrative region), Quebec, CA

Similar jobs

Ingénieur Sénior – Conception avancée/Senior Advanced Design Engineer

EVIOmontreal (administrative region), qc, Canada
Full-time

Ingénieur Sénior – Conception avancée.Type de poste : Ingénierie – Structures et conception.EVIO est à l’avant-garde de la prochaine génération de l’aviation régionale durable.Nous concevons un aér... Show more

 • Promoted

Responsable de l'ingénierie des systèmes d'exploitation (OSE)

L3Harris TechnologiesMontreal
Full-time

Responsable de l'ingénierie des systèmes d'exploitation (OSE).Échelle salariale : $100,500 - $150,500 CDN par an.Stratégie technique et planification des tests.Élaborer des plans de tests complets ... Show more

 • Promoted

Ingénieure ou Ingénieur intermédiaire en réhabilitation sans-tranchée des réseaux souterrains

CIMA+Terrebonne, Lanaudière, CA
Full-time

Ingénieure ou Ingénieur intermédiaire en réhabilitation sans-tranchée des réseaux souterrains.Bienvenue là où l’humain est au cœur de tout.Bienvenue aux gens qui ont une vision d’avenir inspirante ... Show more

 • Promoted

Senior Site Reliability Engineer Focused on Kubernetes Infrastructure

Chainlink LabsMontreal (administrative region), QC, CA
Full-time

Elevate decentralized architecture as a Senior Site Reliability Engineer.Spearhead Kubernetes-based infrastructure for decentralized applications, driving scalability, security, and operational eff... Show more

 • Promoted

Ingénieur/Spécialiste en maintenance & fiabilité - Maintenance & Reliability Engineer / Specialist

GrifolsMontreal (administrative region), QC, CA
Full-time

Ingénieur/Spécialiste en maintenance et fiabilité.Gestionnaire Principal de la Maintenance de production.Dans le cadre de nos activités de fabrication de produits dérivés du plasma stériles, l'ingé... Show more

 • Promoted

Senior Site Reliability Engineer (Remote-First)

VySystemsMontreal (administrative region), QC, CA
Remote
Full-time

A leading technology company is seeking a Senior Site Reliability Engineer with robust Kubernetes knowledge to work remotely.Ideal candidates have over 6 years of experience in IT disciplines, prof... Show more

 • Promoted

Intact Hybrid Site Reliability Engineer

IntactMontreal
Full-time

Join Intact as a Site Reliability Engineer and elevate operational reliability across cloud platforms.This hands-on role employs Azure, AWS, and GCP expertise to manage incidents effectively.The SR... Show more

 • Promoted

Ingénieur(e) en réhabilitation de bâtiments

RJC EngineersMontreal (administrative region), QC, CA
Full-time

Concepteur(trice) en science du bâtiment et restauration structurale.L'équipe de RJC Ingénierie à Montréal s'agrandit à nouveau.Il s'agit d'une opportunité exceptionnelle de se joindre à une équipe... Show more

 • Promoted

Ingénieur SLI Sénior - Optimisation & Maintenabilité

LGMMontreal, Montreal (administrative region), CA
Full-time

Une entreprise spécialisée en ingénierie recherche un Ingénieur Soutien Logistique Intégré (SLI) Sénior à Montréal.Ce rôle exige une solide expérience en maintenance et une capacité à collaborer av... Show more

 • Promoted

Senior Site Reliability Engineer

ThinkificMontreal (administrative region), QC, CA
Full-time

Senior Site Reliability Engineer.Senior Site Reliability Engineer.Are you an experienced Site Reliability Engineer looking for a new challenge?.Senior Site Reliability Engineer.Senior Site Reliabil... Show more

 • Promoted

Specialist Site Reliability Engineer

Global Talent Alliance, CanadaMontreal (administrative region), QC, CA
Full-time

About the job Specialist Site Reliability Engineer.The role of the Specialist Site Reliability Engineer (SRE) is to execute RAM analysis and engineering in support of the I&T solutions.The overall ... Show more

 • Promoted

Ingénieur en systèmes de propulsion

Altitude AerospaceMontreal (administrative region), QC, CA
Full-time

Cherchez-vous à contribuer au domaine aérospatial? Rejoignez notre équipe comme Ingénieur en systèmes de propulsion à Montréal et participez à des projets innovants.En tant que membre clé de l'équi... Show more

 • Promoted

Site Reliability Engineer

TELUS DigitalMontreal (administrative region), QC, CA
Full-time

Welcome to TELUS Digital — where innovation drives impact at a global scale.As an award-winning digital product consultancy and the digital division of TELUS, one of Canada’s largest telecommunicat... Show more

 • Promoted

Senior Site Reliability Engineer- Remote

ClickHouseMontreal (administrative region), QC, CA
Remote
Full-time

Senior Site Reliability Engineer- Remote.Recognized on the 2025 Forbes Cloud 100 list, ClickHouse is one of the most innovative and fast-growing private cloud companies.With more than 3,000 custome... Show more

 • Promoted

Senior Site Reliability Engineer

SecurityScorecardmontreal (administrative region), qc, Canada
Full-time

SecurityScorecard is the global leader in cybersecurity ratings, with over 12 million companies continuously rated, operating in 64 countries.Founded in 2013 by security and risk experts Dr.Alex Ya... Show more

 • Promoted

Ingénieur de projets – Optimisation des procédés (secteur laitier)

AgropurMontreal (administrative region), QC, CA
Permanent

Nous croyons que les meilleurs résultats viennent de la collaboration, du partage de points de vue et du travail en équipe.Agropur est à la recherche d’un Ingénieur de projets – Optimisation des pr... Show more

 • Promoted

Ingénieur de Navigabilité Senior chez Bombardier

Bombardier Transportation GmbHDorval, QC, CA
Full-time

Participez au développement aéronautique en tant qu'Ingénieur de Navigabilité Senior chez Bombardier à Dorval, QC, dans un environnement de travail hybride.Ce rôle implique des compétences avancées... Show more

 • Promoted

Développeur senior en ingénierie et fiabilités des sites SRE

National Bank of CanadaMontreal (administrative region), QC, CA
Full-time

Une carrière en tant que développeuse ou développeur senior en ingénierie, fiabilités des sites (SRE) dans l’équipe du secteur Livraison TI, Gestion de Patrimoine, à la Banque Nationale, c’est agir... Show more

 • Promoted

Site Reliability Engineer - Tech Talent International

Tech Talent InternationalMontreal
Full-time

Join Tech Talent International as a Senior Site Reliability Engineer, specializing in Automation & Observability, located in Montreal.This hybrid role focuses on enhancing production efficiency and... Show more

 • Promoted

Site Reliability Engineer

MaintainXMontreal
Full-time

MaintainX is the world's leading AI-powered maintenance and asset management platform, serving 13,000+ customers including Duracell, Shell, Cintas, and Brenntag.We raised $150M in Series D funding ... Show more