Hola ¿Listo para llevar la confiabilidad de nuestros servicios al siguiente nivel? Buscamos un Especialista SRE apasionado por la excelencia operativa y la automatización. Tu rol será clave para garantizar la disponibilidad, resiliencia y performance de nuestra plataforma tecnológica, trabajando de cerca con equipos de Platform, SRE y Desarrollo. Si te motiva el desafío de optimizar la operación mediante SRE, observabilidad, Kubernetes, métricas DORA y automatización, este es tu lugar Aquí tendrás la ocasión de aprender y aplicar conocimientos en cloud, IA y las últimas tendencias en Site Reliability Engineering. Postúlate y participa en la evolución de una operación tecnológica más confiable
Responsabilidades:
- Diseñar implementar y mantener sistemas robustos y escalables utilizando principios SRE.
- Definir y monitorear SLOs y SLIs gestionando los Error Budgets para asegurar la confiabilidad del servicio.
- Implementar y optimizar soluciones de observabilidad (APM logs métricas tracing) para una visibilidad completa del sistema.
- Desarrollar y mantener pipelines de CI/CD y prácticas de IaC para automatizar el despliegue y la gestión de la infraestructura.
- Gestionar y mantener entornos Kubernetes asegurando su estabilidad y performance.
- Colaborar estrechamente con los equipos de desarrollo y plataforma para resolver incidentes críticos y mejorar la resiliencia del sistema.
- Analizar métricas DORA para identificar cuellos de botella y oportunidades de mejora continua.
- Participar en la guardia de incidentes y liderar la respuesta y resolución de problemas complejos.
- Investigar y aplicar nuevas tecnologías y enfoques incluyendo inteligencia artificial para mejorar la operac