Empresa: Consultores en Capital Humano Avant - Garde, SA de CV.
Empresa del sector financiero busca un Ingeniero de Confiabilidad de Sitio (SRE) y Observabilidad con experiencia en ambientes de misión crítica, enfocado en garantizar la disponibilidad, estabilidad y desempeño de plataformas tecnológicas de alta disponibilidad.
7 años de experiencia en Site Reliability Engineering (SRE), Observabilidad y monitoreo, Plataformas de misión crítica, Gestión de incidentes mayores, Automatización de operaciones y sistemas distribuidos.
Diseñar, administrar y evolucionar la plataforma de observabilidad (métricas, logs y trazas); definir e implementar indicadores de confiabilidad (SLIs/SLOs) y administrar error budgets; liderar la respuesta técnica ante incidentes críticos (Sev1 y Sev2); realizar análisis de causa raíz (RCA) y conducir post-mortems; automatizar procesos operativos para reducir trabajo manual (toil) y minimizar errores; implementar mejoras continuas para incrementar la disponibilidad y resiliencia de los servicios; colaborar con equipos de desarrollo, infraestructura y operaciones.
Prometheus, Grafana, ELK/OpenSearch, Datadog, New Relic, PRTG, OpenTelemetry, AxonOps, Kubernetes, Apache Cassandra, Kafka, Linux, Bases de datos SQL y NoSQL, Python, Bash, Go, Ansible, Terraform, CI/CD, SLIs/SLOs, Error Budgets, PagerDuty/Opsgenie, ITIL v4, ISO 20000
Ingeniería en Sistemas, Computación, Telecomunicaciones o carrera afín (Título indispensable)
Tipo de Contrato
Tiempo completoModalidad del Empleo
PresencialIdioma
Inglés intermedio-avanzado