Se requiere un Ingeniero SRE DevOps para fortalecer la confiabilidad de servicios críticos. El rol concentra la gestión de disponibilidad, resiliencia y observabilidad de la plataforma. Se busca experiencia en Site Reliability Engineering, manejo de incidentes y automatización operativa. Se gestionarán SLO, SLI y error budgets, asegurando el cumplimiento de métricas DORA. La posición contribuye directamente a la continuidad del negocio mediante la implementación de prácticas de Infraestructura como Código (IaC) y Procesos de Integración Continua/Entrega Continua (CI/CD), con un enfoque en la automatización y el uso de tecnologías como Kubernetes y plataformas cloud. El objetivo es optimizar el rendimiento y la estabilidad de los sistemas.
Responsabilidades:
- Diseñar implementar y mantener sistemas de alta disponibilidad escalabilidad y confiabilidad.
- Definir y monitorear Service Level Objectives (SLO) y Service Level Indicators (SLI).
- Gestionar y optimizar el uso de Error Budgets para priorizar el desarrollo y la estabilidad.
- Implementar y mantener soluciones de observabilidad (métricas logs trazas) para la monitorización proactiva.
- Automatizar despliegues configuraciones y operaciones utilizando herramientas de IaC y CI/CD.
- Administrar y optimizar entornos basados en Kubernetes y plataformas cloud.
- Participar en la resolución de incidentes críticos realizando análisis post-mortem y definiendo acciones correctivas.
- Colaborar con equipos de desarrollo y operaciones para mejorar la resiliencia y el rendimiento de los servicios.
- Aplicar principios de ingeniería de confiabilidad para reducir la incidencia de fallos y mejorar los tiempos de recuperación (MTTR).
- Contribuir a la mejora continua de los procesos y her