Manager, Platform & Site Reliability
đšđŠ Canada
Tableau
Management
Vue
Docker
Kubernetes
AWS
Design
Cybersecurity
Recruitment
Devops
Analyst
Testing
$135,000.000 - $150,000.000
Manager, Platform & Site Reliability
from đšđŠ Canada
$135,000.000 - $150,000.000
Join the team that is building a trusted internet for Canadians! CIRA may be best known for managing the .CA domain but our impact reaches far beyond that. Weâre at the forefront of advancing cybersecurity technologies and leading projects that improve the digital experience for users across Canada and the world. Our broad scope of activities is driven by one central goal: to strengthen and secure Canadaâs digital landscape.âŻâŻÂ
By working with the CIRA registry team, youâll play a part in advancing the CIRA Registry Platform, which supports a wide range of domains globally. Help us drive innovation and maintain the high standards of stability and security that our platform is known for. Join us in advancing digital identity and technology in Canada and beyond.âŻâŻÂ
Who you are:Â
You are a people-first technology leader who thrives at the intersection of reliability, platform engineering, and operational excellence. You enjoy building high-performing teams, creating clarity in complex environments, and empowering engineers to do their best work. You balance strategic thinking with technical depth, helping teams deliver resilient, scalable services while continuously improving processes, tooling, and ways of working. Most importantly, you're motivated by solving meaningful challenges and contributing to infrastructure that Canadians and organizations around the world rely on every day.Â
What you'll do:âŻÂ
- Lead, coach, and develop a high-performing team of SRE and Platform Specialists responsible for the reliability, scalability, security, and operational excellence of CIRA's registry platforms and supporting technology services.
- Define and execute the platform and site reliability strategy, aligning priorities and investments with organizational objectives and customer needs.
- Define and mature SRE practices, including Service Level Objectives (SLOs), Service Level Indicators (SLIs), error budgets, production readiness standards, and operational acceptance criteria for mission-critical registry services.
- Drive the design, operation, and continuous improvement of scalable, resilient, cloud-native platforms using public cloud technologies such as AWS.
- Champion automation, infrastructure as code, GitOps, CI/CD, and self-service platform capabilities to reduce manual effort, operational toil, and engineering bottlenecks.
- Establish and continuously improve observability, monitoring, alerting, and dashboarding practices to provide clear visibility into platform health, service reliability, and customer-impacting issues.
- Lead incident management for high-severity events, providing incident command, stakeholder communication, root cause analysis, and driving follow-up actions that strengthen long-term platform resilience.
- Collaborate with engineering, security, support, compliance, and business stakeholders to establish priorities, balance risk, and deliver platform improvements that support registry operations and organizational goals.
- Drive performance engineering, capacity planning, disaster recovery testing, and resilience validation to ensure the ongoing reliability and availability of critical registry platforms and related services.
- Foster a culture of ownership, accountability, continuous learning, operational excellence, and psychological safety that empowers the team to innovate and perform at their best.Â
Â
What you bring:Â
âŻÂ
- 7+ years of progressive experience in Site Reliability Engineering (SRE), platform engineering, DevOps, infrastructure, or cloud operations, including hands-on experience with public cloud platforms such as AWS.
- 3+ years of experience leading, coaching, and developing technical teams in SRE, platform engineering, DevOps, infrastructure, or cloud operations.
- Demonstrated success building and developing high-performing engineering teams through mentoring, coaching, performance management, and fostering a culture of continuous learning and accountability.
- Experience defining technical strategy, influencing cross-functional stakeholders, and balancing reliability, security, operational excellence, and business priorities.
- Strong hands-on background with public cloud platforms, preferably AWS, including cloud-native architecture, networking, security, resilience, scalability, and cost-aware operations.
- Experience leading teams that implement and operate infrastructure as code (IaC), GitOps, and automation practices to manage cloud infrastructure, platform services, and deployment workflows.
- Strong understanding of CI/CD principles, release automation, and modern software delivery practices.
- Experience with containerization and orchestration technologies such as Docker and Kubernetes.
- Experience with observability platforms, monitoring frameworks, incident management practices, and operational analytics tools.
- Demonstrated experience defining and implementing SLOs, SLIs, error budgets, production readiness standards, and incident response processes.
- Strong understanding of disaster recovery, business continuity, backup and recovery strategies, and resilience testing.
- Experience supporting highly available, mission-critical, or regulated technology platforms where reliability, security, and operational discipline are essential.
- Exceptional communication, collaboration, and stakeholder management skills, with the ability to translate complex technical concepts into clear business outcomes for both technical and non-technical audiences.Â
Â
Who we are: ⯠âŻÂ
At CIRA, weâre driven by a passion to make a positive impact on Canadaâs digital future. Weâre not just asking, âWhat more can we do?ââweâre actively exploring new frontiers to enhance and secure the internet for all Canadians. Our recognition as one of the National Capital Regionâs Top Employers for ten years is a testament to our vibrant culture. We believe in fostering an environment where collaboration and candour are second nature and where diverse perspectives are integral to our success, because we know that great ideas come from everywhere. If youâre passionate about innovation and ready to make a difference in a dynamic field, join us and help shape the future of the internet!Â
CIRA embraces a blend of remote and IRL in-office work to keep our team connected and engaged. Our Ottawa headquarters is a hub for regular events and social activities that bring our team together, encouraging a strong sense of community within our organization. No matter where you work from, you'll always feel part of our vibrant team and our shared mission.Â
Â
At CIRA, people remain at the centre of our recruitment process. While CIRA uses recruitment platforms that include artificial intelligence-enabled features, which may be used to support administrative processes or skills-based assessments, these features are intended to assist our recruitment activities and do not replace human judgment. All applicant screenings, interviews, evaluations and selection decisions are conducted by our staff. Artificial intelligence is not used to make autonomous or final hiring decisions.Â
This posting is for an existing vacancy. CIRA is committed to fair, inclusive and accessible recruitment practices. Accommodations are available upon request throughout the recruitment, assessment and selection process. If you require any assistance or accommodation, please contact us atpeopleandculture@cira.ca.
*******************
Joignez-vous Ă lâĂ©quipe qui bĂątit un Internet fiable pour la population canadienne! CIRA est peut-ĂȘtre mieux connue pour sa gestion du domaine .CA, mais son impact ne sâarrĂȘte pas lĂ . Nous sommes Ă lâavant-garde des technologies de cybersĂ©curitĂ© et des projets de pointe qui amĂ©liorent lâexpĂ©rience numĂ©rique pour les utilisateur·rices partout au Canada et Ă travers le monde. Notre large Ă©ventail dâactivitĂ©s est guidĂ© par un objectif central : renforcer et sĂ©curiser le paysage numĂ©rique du Canada.
En travaillant avec lâĂ©quipe du registre de CIRA, vous contribuerez Ă faire progresser la plateforme de registre de CIRA, qui appuie une vaste gamme de domaines Ă lâĂ©chelle mondiale. Aidez-nous Ă favoriser lâinnovation et Ă maintenir les normes Ă©levĂ©es de stabilitĂ© et de sĂ©curitĂ© qui font la rĂ©putation de notre plateforme. Joignez-vous Ă nous pour faire progresser lâidentitĂ© et la technologie numĂ©riques au Canada et au-delĂ de nos frontiĂšres.
Votre profil :Â
Vous ĂȘtes un·e chef·fe de file du domaine des technologies pour qui les personnes passent avant tout, et qui sâĂ©panouit lĂ oĂč convergent la fiabilitĂ©, lâingĂ©nierie des plateformes et lâexcellence opĂ©rationnelle. Vous aimez construire des Ă©quipes hautement performantes, apporter de la clartĂ© aux environnements complexes et donner aux ingĂ©nieur·es les moyens de travailler au meilleur de leurs capacitĂ©s. Vous savez trouver le juste Ă©quilibre entre la rĂ©flexion stratĂ©gique et la profondeur technique. Vous aidez les Ă©quipes Ă fournir des services rĂ©silients et Ă©volutifs tout en amĂ©liorant continuellement les processus, lâoutillage et les mĂ©thodes de travail. Et surtout, vous ĂȘtes motivĂ© Ă rĂ©soudre des dĂ©fis significatifs et Ă contribuer Ă lâinfrastructure sur laquelle la population canadienne et des organisations du monde entier comptent chaque jour.
Vos tùches :
- Diriger, encadrer et dĂ©velopper une Ă©quipe hautement performante de spĂ©cialistes de lâingĂ©nierie de la fiabilitĂ© des sites et de spĂ©cialistes des plateformes, responsables de la fiabilitĂ©, de lâĂ©volutivitĂ©, de la sĂ©curitĂ© et de lâexcellence opĂ©rationnelle des plateformes de registre de CIRA et des services technologiques qui les soutiennent.
- DĂ©finir et mettre en Ćuvre la stratĂ©gie de fiabilitĂ© de la plateforme et des sites, en alignant les prioritĂ©s et les investissements sur les objectifs organisationnels et les besoins des client·es.
- DĂ©finir et faire Ă©voluer les pratiques dâingĂ©nierie de la fiabilitĂ© des sites, y compris les objectifs de niveau de service (ONS), les indicateurs de niveau de service, la pondĂ©ration des erreurs, les normes de prĂ©paration Ă la production et les critĂšres dâacceptation opĂ©rationnelle pour la plateforme dâenregistrement essentielle Ă la mission.
- Diriger la conception, lâexploitation et lâamĂ©lioration continue des plateformes Ă©volutives, rĂ©silientes et infonuagiques natives en faisant appel Ă des technologies infonuagiques publiques comme AWS.
- Promouvoir lâautomatisation, lâinfrastructure en tant que code, GitOps, lâintĂ©gration continue/le dĂ©ploiement continu et les capacitĂ©s de plateforme libre-service afin de rĂ©duire les efforts manuels, la charge opĂ©rationnelle et les goulots dâĂ©tranglement dâingĂ©nierie.
- Ătablir et amĂ©liorer continuellement les pratiques dâobservabilitĂ©, de surveillance, dâalerte et de compilation des informations sous forme de tableau de bord afin de fournir une visibilitĂ© claire sur la santĂ© de la plateforme, la fiabilitĂ© du service et les problĂšmes ayant une incidence sur la clientĂšle.
- Diriger la gestion des incidents pour les Ă©vĂ©nements de gravitĂ© Ă©levĂ©e, en assurant le commandement dâincident, les communications avec les parties prenantes et lâanalyse des causes profondes, ainsi quâen pilotant des mesures de suivi qui renforcent la rĂ©silience Ă long terme de la plateforme.
- Collaborer avec les parties prenantes en matiĂšre dâingĂ©nierie, de sĂ©curitĂ©, dâassistance, de conformitĂ© et dâexploitation afin de dĂ©finir les prioritĂ©s, dâĂ©quilibrer les risques et dâapporter des amĂ©liorations Ă la plateforme de façon Ă soutenir les activitĂ©s du registre et les objectifs organisationnels.
- Favoriser lâingĂ©nierie du rendement, la planification de la capacitĂ©, les essais de reprise aprĂšs sinistre et la validation de la rĂ©silience pour assurer la fiabilitĂ© et la disponibilitĂ© continues des plateformes de registre critiques et des services connexes.
- Favoriser une culture dâengagement, de responsabilitĂ©, dâapprentissage continu, dâexcellence opĂ©rationnelle et de sĂ©curitĂ© psychologique qui permet Ă lâĂ©quipe dâinnover et de donner le meilleur dâelle-mĂȘme.
Â
Vos antécédents :
- Au moins sept ans dâexpĂ©rience progressive en ingĂ©nierie de la fiabilitĂ© des sites, en ingĂ©nierie de plateforme, en dĂ©veloppement et exploitation, en infrastructure ou en exploitation infonuagique, y compris une expĂ©rience pratique de plateformes infonuagiques publiques comme AWS.
- Au moins trois ans dâexpĂ©rience Ă diriger, encadrer et dĂ©velopper des Ă©quipes techniques en ingĂ©nierie de la fiabilitĂ© des sites, en ingĂ©nierie des plateformes, en dĂ©veloppement et exploitation, en infrastructure ou en exploitation infonuagique.
- SuccĂšs avĂ©rĂ© dans la crĂ©ation et le dĂ©veloppement dâĂ©quipes dâingĂ©nierie hautement performantes grĂące au mentorat, Ă lâencadrement, Ă la gestion du rendement et Ă la promotion dâune culture de lâapprentissage et de la responsabilitĂ© continus.
- ExpĂ©rience dans la dĂ©finition de stratĂ©gies techniques, Ă influencer les intervenant·es interfonctionnel·les et Ă Ă©quilibrer la fiabilitĂ©, la sĂ©curitĂ©, lâexcellence opĂ©rationnelle et les prioritĂ©s commerciales.
- Solide expĂ©rience pratique des plateformes infonuagiques publiques, de prĂ©fĂ©rence AWS, y compris lâarchitecture infonuagique native, le rĂ©seautage, la sĂ©curitĂ©, la rĂ©silience, lâĂ©volutivitĂ© et les opĂ©rations sensibles aux coĂ»ts.
- ExpĂ©rience en gestion dâĂ©quipes qui mettent en Ćuvre et exploitent lâinfrastructure en tant que code (IaC), GitOps et des pratiques dâautomatisation pour gĂ©rer lâinfrastructure infonuagique, les services de plateforme et les flux de travail de dĂ©ploiement.
- Solide comprĂ©hension des principes dâintĂ©gration continue/de dĂ©ploiement continu, de lâautomatisation des versions et des pratiques modernes de livraison de logiciels.
- ExpĂ©rience des technologies de conteneurisation et dâorchestration comme Docker et Kubernetes.
- ExpĂ©rience des plateformes dâobservabilitĂ©, des cadres de surveillance, des pratiques de gestion des incidents et des outils dâanalyse opĂ©rationnelle.
- ExpĂ©rience avĂ©rĂ©e dans la dĂ©finition et la mise en Ćuvre dâobjectifs de niveau de service, dâindicateurs de niveau de service, de la pondĂ©ration des erreurs, de normes de prĂ©paration Ă la production et de processus dâintervention en cas dâincident.
- Solide compréhension de la reprise aprÚs sinistre, de la continuité des activités, des stratégies de sauvegarde et de reprise et des essais de résilience.
- ExpĂ©rience en soutien de plateformes technologiques hautement disponibles, essentielles Ă la mission ou rĂ©glementĂ©es oĂč la fiabilitĂ©, la sĂ©curitĂ© et la discipline opĂ©rationnelle sont essentielles.
- Aptitudes exceptionnelles pour la communication, la collaboration et la gestion des intervenants, et capacité de traduire des concepts techniques complexes en résultats commerciaux compréhensibles pour les auditoires techniques et non techniques.
à propos de nous :
Chez CIRA, nous sommes motivé·es par la passion dâavoir un impact positif sur lâavenir numĂ©rique du Canada. Nous ne nous contentons pas de demander : « Que pouvons-nous faire de plus? » Nous explorons activement de nouvelles frontiĂšres afin dâamĂ©liorer et de sĂ©curiser Internet pour la population canadienne. CIRA est reconnue comme lâun des meilleurs employeurs de la rĂ©gion de la capitale nationale depuis dix ans, ce qui tĂ©moigne de notre culture dynamique. Nous croyons quâil est important de favoriser un environnement oĂč la collaboration et la franchise sont une seconde nature et oĂč la diversitĂ© des points de vue fait partie intĂ©grante de notre succĂšs, car nous savons que les grandes idĂ©es viennent de partout. Si vous ĂȘtes passionné·e par lâinnovation et prĂȘt·e Ă faire une diffĂ©rence dans un domaine dynamique, joignez-vous Ă nous et contribuez Ă façonner lâavenir dâInternet!
CIRA favorise un mĂ©lange de travail Ă distance et de travail au bureau pour que notre Ă©quipe reste connectĂ©e et engagĂ©e. SituĂ© Ă Ottawa, notre siĂšge social est un carrefour pour les Ă©vĂ©nements rĂ©guliers et les activitĂ©s sociales qui rassemblent les membres de notre Ă©quipe, favorisant un fort sentiment dâappartenance au sein de notre entreprise. Peu importe oĂč vous travaillez, vous aurez toujours le sentiment de faire partie de notre Ă©quipe dynamique et de partager notre mission commune.
Chez CIRA, les personnes restent au cĆur de notre processus de recrutement. Bien que CIRA utilise des plateformes de recrutement dotĂ©es de fonctionnalitĂ©s basĂ©es sur lâintelligence artificielle, qui peuvent ĂȘtre utilisĂ©es pour faciliter les processus administratifs ou les Ă©valuations basĂ©es sur les compĂ©tences, ces fonctionnalitĂ©s ont pour but dâaider nos activitĂ©s de recrutement et ne remplacent pas le jugement humain. Toutes les prĂ©sĂ©lections, les entrevues, les Ă©valuations et les dĂ©cisions de sĂ©lection sont effectuĂ©es par notre personnel. Lâintelligence artificielle nâest pas utilisĂ©e pour prendre des dĂ©cisions autonomes ou dĂ©finitives en matiĂšre dâembauche.
Cette offre dâemploi concerne un poste actuellement vacant. CIRA sâengage Ă adopter des pratiques de recrutement Ă©quitables, inclusives et accessibles. Des mesures dâadaptation sont disponibles sur demande tout au long du processus de recrutement, dâĂ©valuation et de sĂ©lection. Si vous avez besoin dâaide ou de mesures dâadaptation, veuillez communiquer avec nous Ă lâadresse peopleandculture@cira.ca.







