Detalles de la Vacante

Ingeniero de Confiabilidad de Sitio (SRE) y Observabilidad

Descripción

Empresa: Consultores en Capital Humano Avant - Garde, SA de CV.

Empresa del sector financiero busca un Ingeniero de Confiabilidad de Sitio (SRE) y Observabilidad con experiencia en ambientes de misión crítica, enfocado en garantizar la disponibilidad, estabilidad y desempeño de plataformas tecnológicas de alta disponibilidad.

Experiencia requerida

7 años de experiencia en Site Reliability Engineering (SRE), Observabilidad y monitoreo, Plataformas de misión crítica, Gestión de incidentes mayores, Automatización de operaciones y sistemas distribuidos.

Responsabilidades

Diseñar, administrar y evolucionar la plataforma de observabilidad (métricas, logs y trazas); definir e implementar indicadores de confiabilidad (SLIs/SLOs) y administrar error budgets; liderar la respuesta técnica ante incidentes críticos (Sev1 y Sev2); realizar análisis de causa raíz (RCA) y conducir post-mortems; automatizar procesos operativos para reducir trabajo manual (toil) y minimizar errores; implementar mejoras continuas para incrementar la disponibilidad y resiliencia de los servicios; colaborar con equipos de desarrollo, infraestructura y operaciones.

Conocimientos técnicos

Prometheus, Grafana, ELK/OpenSearch, Datadog, New Relic, PRTG, OpenTelemetry, AxonOps, Kubernetes, Apache Cassandra, Kafka, Linux, Bases de datos SQL y NoSQL, Python, Bash, Go, Ansible, Terraform, CI/CD, SLIs/SLOs, Error Budgets, PagerDuty/Opsgenie, ITIL v4, ISO 20000

Escolaridad

Ingeniería en Sistemas, Computación, Telecomunicaciones o carrera afín (Título indispensable)

Experiencia

7 años de experiencia en Site Reliability Engineering (SRE), Observabilidad y monitoreo, Plataformas de misión crítica, Gestión de incidentes mayores, Automatización de operaciones y sistemas distribuidos.

Conocimientos

Prometheus, Grafana, ELK/OpenSearch, Datadog, New Relic, PRTG, OpenTelemetry, AxonOps, Kubernetes, Apache Cassandra, Kafka, Linux, Bases de datos SQL y NoSQL, Python, Bash, Go, Ansible, Terraform, CI/CD, SLIs/SLOs, Error Budgets, PagerDuty/Opsgenie, ITIL v4, ISO 20000

Actividades

Diseñar, administrar y evolucionar la plataforma de observabilidad (métricas, logs y trazas); definir e implementar indicadores de confiabilidad (SLIs/SLOs) y administrar error budgets; liderar la respuesta técnica ante incidentes críticos (Sev1 y Sev2); realizar análisis de causa raíz (RCA) y conducir post-mortems; automatizar procesos operativos para reducir trabajo manual (toil) y minimizar errores; implementar mejoras continuas para incrementar la disponibilidad y resiliencia de los servicios; colaborar con equipos de desarrollo, infraestructura y operaciones.

Educación

Ingeniería en Sistemas, Computación, Telecomunicaciones o carrera afín (Título indispensable)

Idiomas

Inglés intermedio-avanzado

Datos Generales

Tipo de Contrato

Tiempo completo

Modalidad del Empleo

Presencial

Idioma

Inglés intermedio-avanzado