
SRE
- Devops
- Terraform
- Disaster Recovery
- Kubernetes
- Prometheus
- Grafana
- Datadog
- Splunk
- CloudWatch
- AWS Cloud
EnEX Squared LATAM somos una empresa de transformación digital enfocada en desarrollar soluciones tecnológicas innovadoras y de alto impacto que generan valor real para el negocio. Trabajamos con clientes de primer nivel en mercados globales, regionales y locales, fomentando una cultura colaborativa, inclusiva e impulsada por la innovación, donde las ideas de cada persona realmente importan.
Buscamos un/aSite Reliability Engineer (SRE) con experiencia sólida enoperación de servicios críticos y entornos productivos, que combine conocimientos de cloud, automatización, observabilidad y gestión de incidentes para contribuir a la construcción y evolución de plataformas tecnológicas confiables, resilientes y escalables.
La posición trabajará de manera cercana con equipos de desarrollo y plataforma, promoviendo prácticas de confiabilidad desde el diseño hasta la operación y equilibrando la estabilidad de los servicios con la velocidad de entrega de cambios.
Tipo de posición: Tiempo completo, long-term.
Responsabilidades
- Diseñar e implementar soluciones de automatización para reducir tareas operativas manuales y repetitivas en ambientes productivos.
- Implementar y evolucionar prácticas deobservabilidad, utilizando métricas, logs y trazas para entender el comportamiento de los servicios.
- Definir y mantenerSLIs y SLOs en conjunto con equipos de desarrollo y stakeholders del negocio.
- Participar en la atención de incidentes y esquemas deon-call, realizando diagnóstico, contención y recuperación de servicios.
- Liderar y documentar análisis post-incidente yRoot Cause Analysis (RCA), identificando oportunidades de mejora y acciones preventivas.
- Promover el modelo“you build it, you run it”, incorporando prácticas de confiabilidad desde el desarrollo.
- Diseñar y mantener mecanismos de control de cambios y despliegues integrados a pipelines deCI/CD.
- Analizar capacidad, performance y comportamiento bajo carga de los servicios, proponiendo mejoras de arquitectura o configuración.
- Evaluar y fortalecer laresiliencia, disponibilidad y recuperación ante fallas de plataformas y servicios.
- Documentar estándares, procedimientos, runbooks y buenas prácticas de Site Reliability Engineering.
Requisitos
- Experiencia profesional enSite Reliability Engineering, DevOps, Cloud, Infrastructure, Systems Engineering u Operations.
- Experiencia hands-on trabajando conservicios críticos y ambientes productivos.
- Sólidos conocimientos deLinux y troubleshooting de infraestructura y aplicaciones.
- Experiencia con plataformas decloud computing.
- Experiencia en monitoreo y observabilidad mediante métricas, logs, trazas y alertamiento.
- Experiencia atendiendoincidentes de producción, troubleshooting y Root Cause Analysis.
- Conocimiento de conceptos deSLI, SLO y SLA y su aplicación en la gestión de confiabilidad.
- Experiencia con automatización y scripting.
- Conocimiento deCI/CD y procesos modernos de deployment.
- Experiencia conInfrastructure as Code, idealmente Terraform.
- Conocimiento de principios de alta disponibilidad, resiliencia, disaster recovery y escalabilidad.
- Capacidad para trabajar de manera colaborativa con equipos de desarrollo, infraestructura y operaciones.
Deseable
- Experiencia conAWS y arquitecturas cloud-native.
- Experiencia conTerraform y automatización de infraestructura.
- Experiencia conDocker y Kubernetes.
- Conocimiento de herramientas de observabilidad como Prometheus, Grafana, Datadog, Splunk, CloudWatch o equivalentes.
- Experiencia trabajando con estrategias deHigh Availability y Disaster Recovery.
- Experiencia en análisis de capacidad, performance y escalabilidad.
- Experiencia participando en esquemas deon-call y gestión de incidentes críticos.
- Certificaciones relacionadas con AWS, Cloud Operations o Site Reliability Engineering.
Beneficios
- Seguro médico privado.
- Asociación solidarista.
- Vacaciones y feriados de acuerdo con la legislación de Costa Rica.
- Oportunidades de aprendizaje y crecimiento profesional.
- Participación en proyectos tecnológicos de alto impacto.
Nota de elegibilidad
Esta oportunidad está disponible únicamente para candidatos que residan actualmente en Costa Rica. Aplicaciones fuera de esta región no serán consideradas.
SRE · EX Squared