¿Eres un apasionado por la automatización, la observabilidad y la confiabilidad?
En Davivienda buscamos talento que nos ayude a ir un paso adelante: anticipar fallas, construir plataformas a prueba de balas y fortalecer la resiliencia de nuestros sistemas. Si te apasiona resolver problemas complejos antes de que impacten al usuario, este es tu lugar
Propósito del rol:
Diseñar, automatizar y ejecutar estrategias para validar la tolerancia a fallos y potenciar la resiliencia en arquitecturas distribuidas. Integrarás prácticas fundamental de Site Reliability Engineering (SRE), Ingeniería de Caos y Observabilidad en todo el ciclo de vida del software.
Lo que harás en tu día a día:
- Diseñar y ejecutar experimentos de Ingeniería de Caos e inyección controlada de fallas para detectar vulnerabilidades de forma proactiva.
- Automatizar escenarios de resiliencia integrándolos a pipelines CI/CD, creando SDKs, librerías compartidas y Golden Paths para estandarizar pruebas y monitoreo.
- Implementar Observabilidad como Código (OaC) e Infraestructura como Código (IaC),
optimizando su gestión y despliegue.
- Administrar estrategias eficientes de telemetría, colectores, sampling y modelos semánticos, optimizando los costos de ingesta y almacenamiento de datos.
- Definir, iterar y validar estrategias de confiabilidad en ambientes controlados.
- Fundamentos sólidos en SRE, Observabilidad e Ingeniería de Caos.
- Herramientas de Chaos Engineering (Litmus, Chaos Mesh, Chaos Monkey o Gremlin).
- Experiencia práctica en al menos una plataforma Cloud.
- GitHub / GitLab y gestión de pipelines CI/CD.
- Dominio en automatización y prácticas de IaC.
- Herramientas de monitoreo de alto nivel como Dynatrace o SolarWinds.
- Deseable: Conocimiento en IA aplicada a la automatización, analítica predictiva y AIOps.
Más allá del código, buscamos:
Una persona con pensamiento analítico, mente curiosa para diseñar estrategias, experimentar, iterar y aprender de las fallas, siempre impulsada por la mentalidad