Senior Site Reliability Engineer — Mexico

Vacante

Senior Site Reliability Engineer

JobgetherJobgether
Tiempo completo Mexico

Vacante indexada automáticamente desde LinkedIn. TG Empleos no intermedia este proceso.

Compartir:

Análisis Técnico de Tec Gurus

Vacante de SRE Senior para un equipo de infraestructura global, enfocada en garantizar fiabilidad, rendimiento y operación segura de sistemas críticos en cloud mediante SLIs/SLOs, observabilidad, respuesta a incidentes y automatización con Terraform y Kubernetes. Requiere perfil hands-on en programación (Go/Python) y experiencia avanzada en sistemas distribuidos de alta concurrencia.

SRE y fiabilidad de sistemas productivosKubernetes/EKS y contenedoresTerraform (infraestructura como código)GoPythonObservabilidad (Datadog, Prometheus, Grafana, OpenTelemetry)Redis/ElastiCacheSLIs, SLOs y error budgetsSistemas distribuidos de alto rendimiento y baja latencia

Descripción

Empresa: Jobgether

SRE Senior responsable de la fiabilidad y rendimiento operativo de sistemas críticos en producción, trabajando en infraestructura cloud, observabilidad, respuesta a incidentes y herramientas de software.

Experiencia requerida

6–10 años en SRE, ingeniería de producción, infraestructura o backend, idealmente en entornos cloud con responsabilidad sobre sistemas productivos.

Responsabilidades

Ser dueño de la fiabilidad de sistemas críticos end-to-end; definir y mantener SLIs/SLOs/error budgets; mejorar alertas; liderar respuesta a incidentes severos y postmortems; diseñar y operar infraestructura segura/resiliente/cost-efficient; análisis de capacidad y rendimiento; mejorar la seguridad de cambios (progressive delivery, rollback); gestionar infraestructura como código con Terraform; desarrollar software y tooling; realizar pruebas de caos y game days; colaborar con equipos de producto en production readiness; participar en on-call; aplicar mentalidad de seguridad; mentorizar ingenieros.

Conocimientos técnicos

SLIs, SLOs y error budgets; respuesta a incidentes de alta severidad; modos de fallo en sistemas distribuidos de alto rendimiento y baja latencia; fundamentos de cloud (redes, balanceo de carga, contenedores, Kubernetes/EKS); Terraform o equivalente; programación en Go, Python o similar; observabilidad con Datadog, Prometheus, Grafana u OpenTelemetry; Redis/ElastiCache (clústeres, shards, failover, eviction); prácticas de ingeniería de software (control de versiones, code review, testing, despliegue seguro).

Habilidades

Alto grado de ownership y autonomía; enfoque pragmático ante la fiabilidad; mentoría a ingenieros; excelente comunicación técnica escrita y verbal en inglés; uso de herramientas de IA en flujos de ingeniería.

Prestaciones y beneficios

Compensación competitiva alineada al mercado; entorno de trabajo totalmente remoto; oportunidad de formar parte de una organización de ingeniería globalmente distribuida.

Experiencia

6–10 años en SRE, ingeniería de producción, infraestructura o backend, idealmente en entornos cloud con responsabilidad sobre sistemas productivos.

Conocimientos

SLIs, SLOs y error budgets; respuesta a incidentes de alta severidad; modos de fallo en sistemas distribuidos de alto rendimiento y baja latencia; fundamentos de cloud (redes, balanceo de carga, contenedores, Kubernetes/EKS); Terraform o equivalente; programación en Go, Python o similar; observabilidad con Datadog, Prometheus, Grafana u OpenTelemetry; Redis/ElastiCache (clústeres, shards, failover, eviction); prácticas de ingeniería de software (control de versiones, code review, testing, despliegue seguro).

Habilidades

Alto grado de ownership y autonomía; enfoque pragmático ante la fiabilidad; mentoría a ingenieros; excelente comunicación técnica escrita y verbal en inglés; uso de herramientas de IA en flujos de ingeniería.

Actividades

Ser dueño de la fiabilidad de sistemas críticos end-to-end; definir y mantener SLIs/SLOs/error budgets; mejorar alertas; liderar respuesta a incidentes severos y postmortems; diseñar y operar infraestructura segura/resiliente/cost-efficient; análisis de capacidad y rendimiento; mejorar la seguridad de cambios (progressive delivery, rollback); gestionar infraestructura como código con Terraform; desarrollar software y tooling; realizar pruebas de caos y game days; colaborar con equipos de producto en production readiness; participar en on-call; aplicar mentalidad de seguridad; mentorizar ingenieros.

Idiomas

Inglés avanzado (excelente comunicación escrita y verbal)

Ruta de Capacitación Recomendada Tec Gurus

Consultor en Contenedores Docker &  Kubernetes Inicia: 25/12

Capacitación TecGurus

Consultor en Contenedores Docker & Kubernetes

sabatino35 hrs

Recomendado por TG Empleos porque refuerza los conocimientos técnicos que pide esta vacante.

Ver temario →
Master Consultor Python Full Stack Inicia: 08/01

Capacitación TecGurus

Master Consultor Python Full Stack

sabatino140 hrs

Recomendado por TG Empleos porque refuerza los conocimientos técnicos que pide esta vacante.

Ver temario →
Consultor AWS Despliegue de Apps Inicia: 27/09

Capacitación TecGurus

Consultor AWS Despliegue de Apps

sabatino20 hrs

Recomendado por TG Empleos porque refuerza los conocimientos técnicos que pide esta vacante.

Ver temario →
Consultor GO Desde Cero Inicia: 27/12

Capacitación TecGurus

Consultor GO Desde Cero

sabatino30 hrs

Recomendado por TG Empleos porque refuerza los conocimientos técnicos que pide esta vacante.

Ver temario →
Arquitecturas Híbridas, Kubernetes Productivo y DevOps

Capacitación TecGurus

Arquitecturas Híbridas, Kubernetes Productivo y DevOps

48 hrs

Recomendado por TG Empleos porque refuerza los conocimientos técnicos que pide esta vacante.

Ver temario →

¿Buscas una capacitación a la medida para este puesto? Cotiza un curso personalizado sobre Senior Site Reliability Engineer.

Cotiza un curso personalizado por WhatsApp

Datos Generales

Tipo de Contrato

Tiempo completo

Idioma

Inglés avanzado (excelente comunicación escrita y verbal)
Senior Site Reliability EngineerJobgether
Postúlate ahora🔔 Recibir alertas