Subscribe to the latest remote jobs:

Manager, Platform & Site Reliability

🇹🇩 Canada

Tableau

Management

Vue

Docker

Kubernetes

AWS

Design

Cybersecurity

Recruitment

Devops

Analyst

Testing

$135,000.000 - $150,000.000

Manager, Platform & Site Reliability

from 🇹🇩 Canada

$135,000.000 - $150,000.000

Join the team that is building a trusted internet for Canadians! CIRA may be best known for managing the .CA domain but our impact reaches far beyond that. We’re at the forefront of advancing cybersecurity technologies and leading projects that improve the digital experience for users across Canada and the world. Our broad scope of activities is driven by one central goal: to strengthen and secure Canada’s digital landscape.   


By working with the CIRA registry team, you’ll play a part in advancing the CIRA Registry Platform, which supports a wide range of domains globally. Help us drive innovation and maintain the high standards of stability and security that our platform is known for. Join us in advancing digital identity and technology in Canada and beyond.   


Who you are: 


You are a people-first technology leader who thrives at the intersection of reliability, platform engineering, and operational excellence. You enjoy building high-performing teams, creating clarity in complex environments, and empowering engineers to do their best work. You balance strategic thinking with technical depth, helping teams deliver resilient, scalable services while continuously improving processes, tooling, and ways of working. Most importantly, you're motivated by solving meaningful challenges and contributing to infrastructure that Canadians and organizations around the world rely on every day. 


What you'll do:  


  • Lead, coach, and develop a high-performing team of SRE and Platform Specialists responsible for the reliability, scalability, security, and operational excellence of CIRA's registry platforms and supporting technology services.
  • Define and execute the platform and site reliability strategy, aligning priorities and investments with organizational objectives and customer needs.
  • Define and mature SRE practices, including Service Level Objectives (SLOs), Service Level Indicators (SLIs), error budgets, production readiness standards, and operational acceptance criteria for mission-critical registry services.
  • Drive the design, operation, and continuous improvement of scalable, resilient, cloud-native platforms using public cloud technologies such as AWS.
  • Champion automation, infrastructure as code, GitOps, CI/CD, and self-service platform capabilities to reduce manual effort, operational toil, and engineering bottlenecks.
  • Establish and continuously improve observability, monitoring, alerting, and dashboarding practices to provide clear visibility into platform health, service reliability, and customer-impacting issues.
  • Lead incident management for high-severity events, providing incident command, stakeholder communication, root cause analysis, and driving follow-up actions that strengthen long-term platform resilience.
  • Collaborate with engineering, security, support, compliance, and business stakeholders to establish priorities, balance risk, and deliver platform improvements that support registry operations and organizational goals.
  • Drive performance engineering, capacity planning, disaster recovery testing, and resilience validation to ensure the ongoing reliability and availability of critical registry platforms and related services.
  • Foster a culture of ownership, accountability, continuous learning, operational excellence, and psychological safety that empowers the team to innovate and perform at their best. 

 

What you bring: 

  

  • 7+ years of progressive experience in Site Reliability Engineering (SRE), platform engineering, DevOps, infrastructure, or cloud operations, including hands-on experience with public cloud platforms such as AWS.
  • 3+ years of experience leading, coaching, and developing technical teams in SRE, platform engineering, DevOps, infrastructure, or cloud operations.
  • Demonstrated success building and developing high-performing engineering teams through mentoring, coaching, performance management, and fostering a culture of continuous learning and accountability.
  • Experience defining technical strategy, influencing cross-functional stakeholders, and balancing reliability, security, operational excellence, and business priorities.
  • Strong hands-on background with public cloud platforms, preferably AWS, including cloud-native architecture, networking, security, resilience, scalability, and cost-aware operations.
  • Experience leading teams that implement and operate infrastructure as code (IaC), GitOps, and automation practices to manage cloud infrastructure, platform services, and deployment workflows.
  • Strong understanding of CI/CD principles, release automation, and modern software delivery practices.
  • Experience with containerization and orchestration technologies such as Docker and Kubernetes.
  • Experience with observability platforms, monitoring frameworks, incident management practices, and operational analytics tools.
  • Demonstrated experience defining and implementing SLOs, SLIs, error budgets, production readiness standards, and incident response processes.
  • Strong understanding of disaster recovery, business continuity, backup and recovery strategies, and resilience testing.
  • Experience supporting highly available, mission-critical, or regulated technology platforms where reliability, security, and operational discipline are essential.
  • Exceptional communication, collaboration, and stakeholder management skills, with the ability to translate complex technical concepts into clear business outcomes for both technical and non-technical audiences. 

 

Who we are:     


At CIRA, we’re driven by a passion to make a positive impact on Canada’s digital future. We’re not just asking, ‘What more can we do?’—we’re actively exploring new frontiers to enhance and secure the internet for all Canadians. Our recognition as one of the National Capital Region’s Top Employers for ten years is a testament to our vibrant culture. We believe in fostering an environment where collaboration and candour are second nature and where diverse perspectives are integral to our success, because we know that great ideas come from everywhere. If you’re passionate about innovation and ready to make a difference in a dynamic field, join us and help shape the future of the internet! 


CIRA embraces a blend of remote and IRL in-office work to keep our team connected and engaged. Our Ottawa headquarters is a hub for regular events and social activities that bring our team together, encouraging a strong sense of community within our organization. No matter where you work from, you'll always feel part of our vibrant team and our shared mission. 

 
At CIRA, people remain at the centre of our recruitment process. While CIRA uses recruitment platforms that include artificial intelligence-enabled features, which may be used to support administrative processes or skills-based assessments, these features are intended to assist our recruitment activities and do not replace human judgment. All applicant screenings, interviews, evaluations and selection decisions are conducted by our staff. Artificial intelligence is not used to make autonomous or final hiring decisions. 


This posting is for an existing vacancy. CIRA is committed to fair, inclusive and accessible recruitment practices. Accommodations are available upon request throughout the recruitment, assessment and selection process. If you require any assistance or accommodation, please contact us atpeopleandculture@cira.ca.


*******************


Joignez-vous Ă  l’équipe qui bĂątit un Internet fiable pour la population canadienne! CIRA est peut-ĂȘtre mieux connue pour sa gestion du domaine .CA, mais son impact ne s’arrĂȘte pas lĂ . Nous sommes Ă  l’avant-garde des technologies de cybersĂ©curitĂ© et des projets de pointe qui amĂ©liorent l’expĂ©rience numĂ©rique pour les utilisateur·rices partout au Canada et Ă  travers le monde. Notre large Ă©ventail d’activitĂ©s est guidĂ© par un objectif central : renforcer et sĂ©curiser le paysage numĂ©rique du Canada.


En travaillant avec l’équipe du registre de CIRA, vous contribuerez Ă  faire progresser la plateforme de registre de CIRA, qui appuie une vaste gamme de domaines Ă  l’échelle mondiale. Aidez-nous Ă  favoriser l’innovation et Ă  maintenir les normes Ă©levĂ©es de stabilitĂ© et de sĂ©curitĂ© qui font la rĂ©putation de notre plateforme. Joignez-vous Ă  nous pour faire progresser l’identitĂ© et la technologie numĂ©riques au Canada et au-delĂ  de nos frontiĂšres.


Votre profil : 


Vous ĂȘtes un·e chef·fe de file du domaine des technologies pour qui les personnes passent avant tout, et qui s’épanouit lĂ  oĂč convergent la fiabilitĂ©, l’ingĂ©nierie des plateformes et l’excellence opĂ©rationnelle. Vous aimez construire des Ă©quipes hautement performantes, apporter de la clartĂ© aux environnements complexes et donner aux ingĂ©nieur·es les moyens de travailler au meilleur de leurs capacitĂ©s. Vous savez trouver le juste Ă©quilibre entre la rĂ©flexion stratĂ©gique et la profondeur technique. Vous aidez les Ă©quipes Ă  fournir des services rĂ©silients et Ă©volutifs tout en amĂ©liorant continuellement les processus, l’outillage et les mĂ©thodes de travail. Et surtout, vous ĂȘtes motivĂ© Ă  rĂ©soudre des dĂ©fis significatifs et Ă  contribuer Ă  l’infrastructure sur laquelle la population canadienne et des organisations du monde entier comptent chaque jour.


Vos tùches :


  • Diriger, encadrer et dĂ©velopper une Ă©quipe hautement performante de spĂ©cialistes de l’ingĂ©nierie de la fiabilitĂ© des sites et de spĂ©cialistes des plateformes, responsables de la fiabilitĂ©, de l’évolutivitĂ©, de la sĂ©curitĂ© et de l’excellence opĂ©rationnelle des plateformes de registre de CIRA et des services technologiques qui les soutiennent.
  • DĂ©finir et mettre en Ɠuvre la stratĂ©gie de fiabilitĂ© de la plateforme et des sites, en alignant les prioritĂ©s et les investissements sur les objectifs organisationnels et les besoins des client·es.
  • DĂ©finir et faire Ă©voluer les pratiques d’ingĂ©nierie de la fiabilitĂ© des sites, y compris les objectifs de niveau de service (ONS), les indicateurs de niveau de service, la pondĂ©ration des erreurs, les normes de prĂ©paration Ă  la production et les critĂšres d’acceptation opĂ©rationnelle pour la plateforme d’enregistrement essentielle Ă  la mission.
  • Diriger la conception, l’exploitation et l’amĂ©lioration continue des plateformes Ă©volutives, rĂ©silientes et infonuagiques natives en faisant appel Ă  des technologies infonuagiques publiques comme AWS.
  • Promouvoir l’automatisation, l’infrastructure en tant que code, GitOps, l’intĂ©gration continue/le dĂ©ploiement continu et les capacitĂ©s de plateforme libre-service afin de rĂ©duire les efforts manuels, la charge opĂ©rationnelle et les goulots d’étranglement d’ingĂ©nierie.
  • Établir et amĂ©liorer continuellement les pratiques d’observabilitĂ©, de surveillance, d’alerte et de compilation des informations sous forme de tableau de bord afin de fournir une visibilitĂ© claire sur la santĂ© de la plateforme, la fiabilitĂ© du service et les problĂšmes ayant une incidence sur la clientĂšle.
  • Diriger la gestion des incidents pour les Ă©vĂ©nements de gravitĂ© Ă©levĂ©e, en assurant le commandement d’incident, les communications avec les parties prenantes et l’analyse des causes profondes, ainsi qu’en pilotant des mesures de suivi qui renforcent la rĂ©silience Ă  long terme de la plateforme.
  • Collaborer avec les parties prenantes en matiĂšre d’ingĂ©nierie, de sĂ©curitĂ©, d’assistance, de conformitĂ© et d’exploitation afin de dĂ©finir les prioritĂ©s, d’équilibrer les risques et d’apporter des amĂ©liorations Ă  la plateforme de façon Ă  soutenir les activitĂ©s du registre et les objectifs organisationnels.
  • Favoriser l’ingĂ©nierie du rendement, la planification de la capacitĂ©, les essais de reprise aprĂšs sinistre et la validation de la rĂ©silience pour assurer la fiabilitĂ© et la disponibilitĂ© continues des plateformes de registre critiques et des services connexes.
  • Favoriser une culture d’engagement, de responsabilitĂ©, d’apprentissage continu, d’excellence opĂ©rationnelle et de sĂ©curitĂ© psychologique qui permet Ă  l’équipe d’innover et de donner le meilleur d’elle-mĂȘme.

 

Vos antécédents :


  • Au moins sept ans d’expĂ©rience progressive en ingĂ©nierie de la fiabilitĂ© des sites, en ingĂ©nierie de plateforme, en dĂ©veloppement et exploitation, en infrastructure ou en exploitation infonuagique, y compris une expĂ©rience pratique de plateformes infonuagiques publiques comme AWS.
  • Au moins trois ans d’expĂ©rience Ă  diriger, encadrer et dĂ©velopper des Ă©quipes techniques en ingĂ©nierie de la fiabilitĂ© des sites, en ingĂ©nierie des plateformes, en dĂ©veloppement et exploitation, en infrastructure ou en exploitation infonuagique.
  • SuccĂšs avĂ©rĂ© dans la crĂ©ation et le dĂ©veloppement d’équipes d’ingĂ©nierie hautement performantes grĂące au mentorat, Ă  l’encadrement, Ă  la gestion du rendement et Ă  la promotion d’une culture de l’apprentissage et de la responsabilitĂ© continus.
  • ExpĂ©rience dans la dĂ©finition de stratĂ©gies techniques, Ă  influencer les intervenant·es interfonctionnel·les et Ă  Ă©quilibrer la fiabilitĂ©, la sĂ©curitĂ©, l’excellence opĂ©rationnelle et les prioritĂ©s commerciales.
  • Solide expĂ©rience pratique des plateformes infonuagiques publiques, de prĂ©fĂ©rence AWS, y compris l’architecture infonuagique native, le rĂ©seautage, la sĂ©curitĂ©, la rĂ©silience, l’évolutivitĂ© et les opĂ©rations sensibles aux coĂ»ts.
  • ExpĂ©rience en gestion d’équipes qui mettent en Ɠuvre et exploitent l’infrastructure en tant que code (IaC), GitOps et des pratiques d’automatisation pour gĂ©rer l’infrastructure infonuagique, les services de plateforme et les flux de travail de dĂ©ploiement.
  • Solide comprĂ©hension des principes d’intĂ©gration continue/de dĂ©ploiement continu, de l’automatisation des versions et des pratiques modernes de livraison de logiciels.
  • ExpĂ©rience des technologies de conteneurisation et d’orchestration comme Docker et Kubernetes.
  • ExpĂ©rience des plateformes d’observabilitĂ©, des cadres de surveillance, des pratiques de gestion des incidents et des outils d’analyse opĂ©rationnelle.
  • ExpĂ©rience avĂ©rĂ©e dans la dĂ©finition et la mise en Ɠuvre d’objectifs de niveau de service, d’indicateurs de niveau de service, de la pondĂ©ration des erreurs, de normes de prĂ©paration Ă  la production et de processus d’intervention en cas d’incident.
  • Solide comprĂ©hension de la reprise aprĂšs sinistre, de la continuitĂ© des activitĂ©s, des stratĂ©gies de sauvegarde et de reprise et des essais de rĂ©silience.
  • ExpĂ©rience en soutien de plateformes technologiques hautement disponibles, essentielles Ă  la mission ou rĂ©glementĂ©es oĂč la fiabilitĂ©, la sĂ©curitĂ© et la discipline opĂ©rationnelle sont essentielles.
  • Aptitudes exceptionnelles pour la communication, la collaboration et la gestion des intervenants, et capacitĂ© de traduire des concepts techniques complexes en rĂ©sultats commerciaux comprĂ©hensibles pour les auditoires techniques et non techniques.


À propos de nous :


Chez CIRA, nous sommes motivé·es par la passion d’avoir un impact positif sur l’avenir numĂ©rique du Canada. Nous ne nous contentons pas de demander : « Que pouvons-nous faire de plus? » Nous explorons activement de nouvelles frontiĂšres afin d’amĂ©liorer et de sĂ©curiser Internet pour la population canadienne. CIRA est reconnue comme l’un des meilleurs employeurs de la rĂ©gion de la capitale nationale depuis dix ans, ce qui tĂ©moigne de notre culture dynamique. Nous croyons qu’il est important de favoriser un environnement oĂč la collaboration et la franchise sont une seconde nature et oĂč la diversitĂ© des points de vue fait partie intĂ©grante de notre succĂšs, car nous savons que les grandes idĂ©es viennent de partout. Si vous ĂȘtes passionné·e par l’innovation et prĂȘt·e Ă  faire une diffĂ©rence dans un domaine dynamique, joignez-vous Ă  nous et contribuez Ă  façonner l’avenir d’Internet!


CIRA favorise un mĂ©lange de travail Ă  distance et de travail au bureau pour que notre Ă©quipe reste connectĂ©e et engagĂ©e. SituĂ© Ă  Ottawa, notre siĂšge social est un carrefour pour les Ă©vĂ©nements rĂ©guliers et les activitĂ©s sociales qui rassemblent les membres de notre Ă©quipe, favorisant un fort sentiment d’appartenance au sein de notre entreprise. Peu importe oĂč vous travaillez, vous aurez toujours le sentiment de faire partie de notre Ă©quipe dynamique et de partager notre mission commune.


Chez CIRA, les personnes restent au cƓur de notre processus de recrutement. Bien que CIRA utilise des plateformes de recrutement dotĂ©es de fonctionnalitĂ©s basĂ©es sur l’intelligence artificielle, qui peuvent ĂȘtre utilisĂ©es pour faciliter les processus administratifs ou les Ă©valuations basĂ©es sur les compĂ©tences, ces fonctionnalitĂ©s ont pour but d’aider nos activitĂ©s de recrutement et ne remplacent pas le jugement humain. Toutes les prĂ©sĂ©lections, les entrevues, les Ă©valuations et les dĂ©cisions de sĂ©lection sont effectuĂ©es par notre personnel. L’intelligence artificielle n’est pas utilisĂ©e pour prendre des dĂ©cisions autonomes ou dĂ©finitives en matiĂšre d’embauche.


Cette offre d’emploi concerne un poste actuellement vacant. CIRA s’engage Ă  adopter des pratiques de recrutement Ă©quitables, inclusives et accessibles. Des mesures d’adaptation sont disponibles sur demande tout au long du processus de recrutement, d’évaluation et de sĂ©lection. Si vous avez besoin d’aide ou de mesures d’adaptation, veuillez communiquer avec nous Ă  l’adresse peopleandculture@cira.ca.

by @maxrusakovic