Talent.com
CIRA
Manager, Platform & Site ReliabilityCIRA • Ottawa, Ontario, Canada
Manager, Platform & Site Reliability

Manager, Platform & Site Reliability

CIRA • Ottawa, Ontario, Canada
30+ days ago
Salary
CA$135,000.00 yearly
Job type
  • Full-time
Job description

Join the team that is building a trusted internet for Canadians! CIRA may be best known for managing domain but our impact reaches far beyond that. Were at the forefront of advancing cybersecurity technologies and leading projects that improve the digital experience for users across Canada and the world. Our broad scope of activities is driven by one central goal: to strengthen and secure Canadas digital landscape.


By working with the CIRA registry team youll play a part in advancing the CIRA Registry Platform which supports a wide range of domains globally. Help us drive innovation and maintain the high standards of stability and security that our platform is known for. Join us in advancing digital identity and technology in Canada and beyond.


Who you are:


You are a people-first technology leader who thrives at the intersection of reliability platform engineering and operational excellence. You enjoy building high-performing teams creating clarity in complex environments and empowering engineers to do their best work. You balance strategic thinking with technical depth helping teams deliver resilient scalable services while continuously improving processes tooling and ways of working. Most importantly youre motivated by solving meaningful challenges and contributing to infrastructure that Canadians and organizations around the world rely on every day.


What youll do:


  • Lead coach and develop a high-performing team of SRE and Platform Specialists responsible for the reliability scalability security and operational excellence of CIRAs registry platforms and supporting technology services.
  • Define and execute the platform and site reliability strategy aligning priorities and investments with organizational objectives and customer needs.
  • Define and mature SRE practices including Service Level Objectives (SLOs) Service Level Indicators (SLIs) error budgets production readiness standards and operational acceptance criteria for mission-critical registry services.
  • Drive the design operation and continuous improvement of scalable resilient cloud-native platforms using public cloud technologies such as AWS.
  • Champion automation infrastructure as code GitOps CI/CD and self-service platform capabilities to reduce manual effort operational toil and engineering bottlenecks.
  • Establish and continuously improve observability monitoring alerting and dashboarding practices to provide clear visibility into platform health service reliability and customer-impacting issues.
  • Lead incident management for high-severity events providing incident command stakeholder communication root cause analysis and driving follow-up actions that strengthen long-term platform resilience.
  • Collaborate with engineering security support compliance and business stakeholders to establish priorities balance risk and deliver platform improvements that support registry operations and organizational goals.
  • Drive performance engineering capacity planning disaster recovery testing and resilience validation to ensure the ongoing reliability and availability of critical registry platforms and related services.
  • Foster a culture of ownership accountability continuous learning operational excellence and psychological safety that empowers the team to innovate and perform at their best.

What you bring:

  • 7 years of progressive experience in Site Reliability Engineering (SRE) platform engineering DevOps infrastructure or cloud operations including hands-on experience with public cloud platforms such as AWS.
  • 3 years of experience leading coaching and developing technical teams in SRE platform engineering DevOps infrastructure or cloud operations.
  • Demonstrated success building and developing high-performing engineering teams through mentoring coaching performance management and fostering a culture of continuous learning and accountability.
  • Experience defining technical strategy influencing cross-functional stakeholders and balancing reliability security operational excellence and business priorities.
  • Strong hands-on background with public cloud platforms preferably AWS including cloud-native architecture networking security resilience scalability and cost-aware operations.
  • Experience leading teams that implement and operate infrastructure as code (IaC) GitOps and automation practices to manage cloud infrastructure platform services and deployment workflows.
  • Strong understanding of CI/CD principles release automation and modern software delivery practices.
  • Experience with containerization and orchestration technologies such as Docker and Kubernetes.
  • Experience with observability platforms monitoring frameworks incident management practices and operational analytics tools.
  • Demonstrated experience defining and implementing SLOs SLIs error budgets production readiness standards and incident response processes.
  • Strong understanding of disaster recovery business continuity backup and recovery strategies and resilience testing.
  • Experience supporting highly available mission-critical or regulated technology platforms where reliability security and operational discipline are essential.
  • Exceptional communication collaboration and stakeholder management skills with the ability to translate complex technical concepts into clear business outcomes for both technical and non-technical audiences.

Who we are:


At CIRA were driven by a passion to make a positive impact on Canadas digital future. Were not just asking What more can we dowere actively exploring new frontiers to enhance and secure the internet for all Canadians. Our recognition as one of the National Capital Regions Top Employers for ten years is a testament to our vibrant culture. We believe in fostering an environment where collaboration and candour are second nature and where diverse perspectives are integral to our success because we know that great ideas come from everywhere. If youre passionate about innovation and ready to make a difference in a dynamic field join us and help shape the future of the internet!


CIRA embraces a blend of remote and IRL in-office work to keep our team connected and engaged. Our Ottawa headquarters is a hub for regular events and social activities that bring our team together encouraging a strong sense of community within our organization. No matter where you work from youll always feel part of our vibrant team and our shared mission.


At CIRA people remain at the centre of our recruitment process. While CIRA uses recruitment platforms that include artificial intelligence-enabled features which may be used to support administrative processes or skills-based assessments these features are intended to assist our recruitment activities and do not replace human judgment. All applicant screenings interviews evaluations and selection decisions are conducted by our staff. Artificial intelligence is not used to make autonomous or final hiring decisions.


This posting is for an existing vacancy. CIRA is committed to fair inclusive and accessible recruitment practices. Accommodations are available upon request throughout the recruitment assessment and selection process. If you require any assistance or accommodation please contact us at .


*******************


Joignez-vous à léquipe qui bâtit un Internet fiable pour la population canadienne! CIRA est peut-être mieux connue pour sa gestion du mais son impact ne sarrête pas là. Nous sommes à lavant-garde des technologies de cybersécurité et des projets de pointe qui améliorent lexpérience numérique pour les utilisateurrices partout au Canada et à travers le monde. Notre large éventail dactivités est guidé par un objectif central: renforcer et sécuriser le paysage numérique du Canada.


En travaillant avec léquipe du registre de CIRA vous contribuerez à faire progresser la plateforme de registre de CIRA qui appuie une vaste gamme de domaines à léchelle mondiale. Aidez-nous à favoriser linnovation et à maintenir les normes élevées de stabilité et de sécurité qui font la réputation de notre plateforme. Joignez-vous à nous pour faire progresser lidentité et la technologie numériques au Canada et au-delà de nos frontières.


Votre profil:


Vous êtes une cheffe de file du domaine des technologies pour qui les personnes passent avant tout et qui sépanouit là où convergent la fiabilité lingénierie des plateformes et lexcellence opérationnelle. Vous aimez construire des équipes hautement performantes apporter de la clarté aux environnements complexes et donner aux ingénieures les moyens de travailler au meilleur de leurs capacités. Vous savez trouver le juste équilibre entre la réflexion stratégique et la profondeur technique. Vous aidez les équipes à fournir des services résilients et évolutifs tout en améliorant continuellement les processus loutillage et les méthodes de travail. Et surtout vous êtes motivé à résoudre des défis significatifs et à contribuer à linfrastructure sur laquelle la population canadienne et des organisations du monde entier comptent chaque jour.


Vos tâches:


  • Diriger encadrer et développer une équipe hautement performante de spécialistes de lingénierie de la fiabilité des sites et de spécialistes des plateformes responsables de la fiabilité de lévolutivité de la sécurité et de lexcellence opérationnelle des plateformes de registre de CIRA et des services technologiques qui les soutiennent.
  • Définir et mettre en œuvre la stratégie de fiabilité de la plateforme et des sites en alignant les priorités et les investissements sur les objectifs organisationnels et les besoins des clientes.
  • Définir et faire évoluer les pratiques dingénierie de la fiabilité des sites y compris les objectifs de niveau de service (ONS) les indicateurs de niveau de service la pondération des erreurs les normes de préparation à la production et les critères dacceptation opérationnelle pour la plateforme denregistrement essentielle à la mission.
  • Diriger la conception lexploitation et lamélioration continue des plateformes évolutives résilientes et infonuagiques natives en faisant appel à des technologies infonuagiques publiques comme AWS.
  • Promouvoir lautomatisation linfrastructure en tant que code GitOps lintégration continue/le déploiement continu et les capacités de plateforme libre-service afin de réduire les efforts manuels la charge opérationnelle et les goulots détranglement dingénierie.
  • Établir et améliorer continuellement les pratiques dobservabilité de surveillance dalerte et de compilation des informations sous forme de tableau de bord afin de fournir une visibilité claire sur la santé de la plateforme la fiabilité du service et les problèmes ayant une incidence sur la clientèle.
  • Diriger la gestion des incidents pour les événements de gravité élevée en assurant le commandement dincident les communications avec les parties prenantes et lanalyse des causes profondes ainsi quen pilotant des mesures de suivi qui renforcent la résilience à long terme de la plateforme.
  • Collaborer avec les parties prenantes en matière dingénierie de sécurité dassistance de conformité et dexploitation afin de définir les priorités déquilibrer les risques et dapporter des améliorations à la plateforme de façon à soutenir les activités du registre et les objectifs organisationnels.
  • Favoriser lingénierie du rendement la planification de la capacité les essais de reprise après sinistre et la validation de la résilience pour assurer la fiabilité et la disponibilité continues des plateformes de registre critiques et des services connexes.
  • Favoriser une culture dengagement de responsabilité dapprentissage continu dexcellence opérationnelle et de sécurité psychologique qui permet à léquipe dinnover et de donner le meilleur delle-même.

Vos antécédents:


  • Au moins sept ans dexpérience progressive en ingénierie de la fiabilité des sites en ingénierie de plateforme en développement et exploitation en infrastructure ou en exploitation infonuagique y compris une expérience pratique de plateformes infonuagiques publiques comme AWS.
  • Au moins trois ans dexpérience à diriger encadrer et développer des équipes techniques en ingénierie de la fiabilité des sites en ingénierie des plateformes en développement et exploitation en infrastructure ou en exploitation infonuagique.
  • Succès avéré dans la création et le développement déquipes dingénierie hautement performantes grâce au mentorat à lencadrement à la gestion du rendement et à la promotion dune culture de lapprentissage et de la responsabilité continus.
  • Expérience dans la définition de stratégies techniques à influencer les intervenantes interfonctionnelles et à équilibrer la fiabilité la sécurité lexcellence opérationnelle et les priorités commerciales.
  • Solide expérience pratique des plateformes infonuagiques publiques de préférence AWS y compris larchitecture infonuagique native le réseautage la sécurité la résilience lévolutivité et les opérations sensibles aux coûts.
  • Expérience en gestion déquipes qui mettent en œuvre et exploitent linfrastructure en tant que code (IaC) GitOps et des pratiques dautomatisation pour gérer linfrastructure infonuagique les services de plateforme et les flux de travail de déploiement.
  • Solide compréhension des principes dintégration continue/de déploiement continu de lautomatisation des versions et des pratiques modernes de livraison de logiciels.
  • Expérience des technologies de conteneurisation et dorchestration comme Docker et Kubernetes.
  • Expérience des plateformes dobservabilité des cadres de surveillance des pratiques de gestion des incidents et des outils danalyse opérationnelle.
  • Expérience avérée dans la définition et la mise en œuvre dobjectifs de niveau de service dindicateurs de niveau de service de la pondération des erreurs de normes de préparation à la production et de processus dintervention en cas dincident.
  • Solide compréhension de la reprise après sinistre de la continuité des activités des stratégies de sauvegarde et de reprise et des essais de résilience.
  • Expérience en soutien de plateformes technologiques hautement disponibles essentielles à la mission ou réglementées où la fiabilité la sécurité et la discipline opérationnelle sont essentielles.
  • Aptitudes exceptionnelles pour la communication la collaboration et la gestion des intervenants et capacité de traduire des concepts techniques complexes en résultats commerciaux compréhensibles pour les auditoires techniques et non techniques.


À propos de nous:


Chez CIRA nous sommes motivées par la passion davoir un impact positif sur lavenir numérique du Canada. Nous ne nous contentons pas de demander: Que pouvons-nous faire de plus Nous explorons activement de nouvelles frontières afin daméliorer et de sécuriser Internet pour la population canadienne. CIRA est reconnue comme lun des meilleurs employeurs de la région de la capitale nationale depuis dixans ce qui témoigne de notre culture dynamique. Nous croyons quil est important de favoriser un environnement où la collaboration et la franchise sont une seconde nature et où la diversité des points de vue fait partie intégrante de notre succès car nous savons que les grandes idées viennent de partout. Si vous êtes passionnée par linnovation et prête à faire une différence dans un domaine dynamique joignez-vous à nous et contribuez à façonner lavenir dInternet!


CIRA favorise un mélange de travail à distance et de travail au bureau pour que notre équipe reste connectée et engagée. Situé à Ottawa notre siège social est un carrefour pour les événements réguliers et les activités sociales qui rassemblent les membres de notre équipe favorisant un fort sentiment dappartenance au sein de notre entreprise. Peu importe où vous travaillez vous aurez toujours le sentiment de faire partie de notre équipe dynamique et de partager notre mission commune.


Chez CIRA les personnes restent au cœur de notre processus de recrutement. Bien que CIRA utilise des plateformes de recrutement dotées de fonctionnalités basées sur lintelligence artificielle qui peuvent être utilisées pour faciliter les processus administratifs ou les évaluations basées sur les compétences ces fonctionnalités ont pour but daider nos activités de recrutement et ne remplacent pas le jugement humain. Toutes les présélections les entrevues les évaluations et les décisions de sélection sont effectuées par notre personnel. Lintelligence artificielle nest pas utilisée pour prendre des décisions autonomes ou définitives en matière dembauche.


Cette offre demploi concerne un poste actuellement vacant. CIRA sengage à adopter des pratiques de recrutement équitables inclusives et accessibles. Des mesures dadaptation sont disponibles sur demande tout au long du processus de recrutement dévaluation et de sélection. Si vous avez besoin daide ou de mesures dadaptation veuillez communiquer avec nous à ladresse.


Required Experience:

Manager


Employment Type : Full-Time
Experience: years
Vacancy: 1
Monthly Salary Salary: 135000 - 150000
Create a job alert for this search

Manager, Platform & Site Reliability • Ottawa, Ontario, Canada

Similar jobs

Site Reliability Engineer

Vertex Elite LLCottawa, on, Canada
Full-time

Monitoring / Observability tools - Dynatrace, ELK etc.Platform/ cloud Observability - OpenShift, Prometheus / Azure Cloud etc.Collaborate with various Infrastructure, Applications, platforms, and c... Show more

 • Promoted

Lead Platform Engineer Enhancing DevOps and System Reliability

Lillio (formerly HiMama)Ottawa, ON, CA
Full-time

Transform early childhood education as a Senior Platform Engineer focused on system performance and collaborative tooling.Drive key initiatives for scalable, reliable digital platforms.In this pivo... Show more

 • Promoted

Senior Ii Site Reliability Engineer

Akamai TechnologiesOttawa, Canada
Full-time

Job DescriptionJoin our SRE team! Our team uses large datasets to analyze and measure the performance and reliability of our platform.We are networking data scientists: we combine our knowledge of ... Show more

 • Promoted

Senior Site Reliability Engineer- Remote

ClickHouseOttawa, ON, CA
Remote
Full-time

Senior Site Reliability Engineer- Remote.Recognized on the 2025 Forbes Cloud 100 list, ClickHouse is one of the most innovative and fast-growing private cloud companies.With more than 3,000 custome... Show more

 • Promoted

Senior Site Reliability Engineer (Remote-First)

VySystemsOttawa, ON, CA
Remote
Full-time

A leading technology company is seeking a Senior Site Reliability Engineer with robust Kubernetes knowledge to work remotely.Ideal candidates have over 6 years of experience in IT disciplines, prof... Show more

 • Promoted

Senior Platform Engineer - Remote, Scale & Reliability

Lillio (formerly HiMama)Ottawa, ON, CA
Remote
Full-time

A leading EdTech company in Canada is seeking a Senior Platform Engineer to enhance system reliability and performance while contributing to impactful software solutions.The role involves making te... Show more

 • Promoted

Senior Infrastructure Reliability Engineer

ShippoOttawa, ON, CA
Full-time

Enhance shipping solutions as a Senior Site Reliability Engineer in a remote setting.Focus on infrastructure integrity, scalability, and performance in a collaborative environment.This position inv... Show more

 • Promoted

Senior Site Reliability Engineer, Node Platform

Chainlink LabsOttawa, ON, CA
Full-time

Chainlink is the industry-standard oracle platform bringing the capital markets onchain and powering the majority of decentralized finance (DeFi).The Chainlink stack provides the essential data, in... Show more

 • Promoted

Remote Referral Partnerships Lead

Micro1Cantley, Quebec, CA
CA$30.00 hourly
Remote
Full-time

AI data lab for training frontier models and evaluating AI agents.Experts contribute their diverse subject matter knowledge across domains such as finance, healthcare, STEM engineering, and more.AI... Show more

 • Promoted

Booking Platform Engineering Manager

Jane AppOttawa, ON, CA
Full-time

A healthcare technology firm is seeking a Software Development Manager to lead its Booking engineering team.This role focuses on enhancing patient scheduling and communication with a commitment to ... Show more

 • Promoted

Senior Site Reliability Engineer

ThinkificOttawa, ON, CA
Full-time

Senior Site Reliability Engineer.Senior Site Reliability Engineer.Are you an experienced Site Reliability Engineer looking for a new challenge?.Senior Site Reliability Engineer.Senior Site Reliabil... Show more

 • Promoted

Remote Management Consultant

Micro1Cantley, Quebec, CA
CA$50.00 hourly
Remote
Full-time

Management Consultant / Business Strategy Specialist.AI data lab for training frontier models and evaluating AI agents.Experts contribute their diverse subject matter knowledge across domains such ... Show more

 • Promoted

Remote Disability Case Manager Supporting Employee Well-Being and Return

TELUS HealthOttawa, ON, CA
Remote
Full-time

Become a vital Disability Case Manager, helping employees navigate health-related work absences.Utilize your expertise in case management and communication to drive effective return-to-work strateg... Show more

 • Promoted

Senior Full-Stack Engineer - Accessibility & Inclusive Tech (Remote)

Accessibility Partners CanadaOttawa, ON, CA
Remote
Full-time

A leader in accessible technology is seeking a Senior Full-Stack Developer to create equitable and accessible digital systems.This role involves developing both front-end and back-end systems, focu... Show more

 • Promoted

Site Reliability Engineer

TELUS DigitalOttawa, ON, CA
Full-time

Welcome to TELUS Digital — where innovation drives impact at a global scale.As an award-winning digital product consultancy and the digital division of TELUS, one of Canada’s largest telecommunicat... Show more

 • Promoted

Site Reliability Engineer

QlikOttawa
Full-time

A Gartner® Magic Quadrant™ Leader for 15 years in a row, Qlik transforms complex data landscapes into actionable insights, driving strategic business outcomes.Serving over 40,000 global customers, ... Show more

 • Promoted

Site Support & Facility Transition Lead

SkyAlyneOttawa, ON, CA
Full-time

A Canadian defense and training company is seeking a Site Support and Facility Manager in Ottawa.The role involves planning and managing the transition and establishment of support services across ... Show more

 • Promoted

Director of Engineering — Platform & Reliability (Remote)

CliniaOttawa, ON, CA
Remote
Full-time

A tech-driven health company in Canada is seeking a Director of Engineering to lead an engineering team of 25.You will manage delivery, ensure platform reliability, and set engineering standards wh... Show more

 • Promoted

Site Reliability Engineer for Cloud Infrastructure Management

NewtonOttawa, ON, CA
Full-time

Be a pivotal Site Reliability Engineer focused on improving infrastructure resilience and reliability.Collaborate remotely to drive operational success and enhance system performance in a dynamic e... Show more

 • Promoted

Manager, Platform & Site Reliability

CIRAOttawa, ON, CA
Full-time

Join the team that is building a trusted internet for Canadians! CIRA may be best known for managing the.CA domain but our impact reaches far beyond that.We’re at the forefront of advancing cyberse... Show more