En Digital Profit estamos buscando un/a Ingeniero/a SRE2 – Site Reliability Engineer, para fortalecer la confiabilidad, resiliencia y disponibilidad de servicios digitales (SECTOR ASEGURADOR)¿Qué buscamos?
Cualificado en Ingeniería de Sistemas, Electrónica, Telecomunicaciones o carreras afines.
Deseable especialización en Ingeniería de Software, Arquitectura TI o áreas relacionadas.
Experiencia: 3 a 5 años en operación de servicios digitales de misión crítica.
Certificaciones: SRE Foundation (requerida)¿Cuál será tu reto?
Implementar técnicamente las prácticas de Site Reliability Engineering (SRE) en las tribus asignadas, liderar la resolución de incidentes mayores, impulsar mejoras estructurales de confiabilidad y transferir conocimiento a los SRE1, trabajando con autonomía y mínimo acompañamiento.Monitoreo & ObservabilidadInstrumentalizar la observabilidad en las tribus.Impulsar la adopción de prácticas de observabilidad.Mejorar el SLO Score.Coordinar y gestionar necesidades de monitoreo y observabilidad.SLIs & SLOsImplementar los SLIs y SLOs definidos con el dueño del servicio.Configurar alertas y tableros.Dar seguimiento a los indicadores de confiabilidad de los servicios.Presupuesto de ErrorLiderar la aplicación de la política de Error Budget.Participar desde el Planning.Recomendar prioridades de acuerdo con los niveles de confiabilidad.Aplicar las reglas de decisión establecidas.Automatización & reducción de ToilIdentificar y priorizar oportunidades de automatización.Diseñar y liderar iniciativas para reducir Toil.Implementar mejoras que disminuyan tareas operativas repetitivas y aumenten la eficiencia.Ingeniería del CaosDiseñar escenarios e hipótesis de prueba.Preparar planes y decks para ejercicios de resiliencia.Liderar técnicamente las pruebas de Chaos Engineering.Postmortem & mejora continuaLiderar el análisis técnico posterior a incidentes.Identificar la causa raíz (RCA).
Definir y priorizar acciones de mejora de confiabilidad.Dar seguimiento a las acciones preventivas y correctivas.Ingeniería de LanzamientoEvaluar el riesgo de confiabilidad asociado a nuevos cambios.Identificar desviaciones.Proponer mejoras para realizar lanzamientos más seguros y confiables.Incidentes MayoresSerás parte fundamental del gobierno técnico de incidentes, liderando:Resolución técnica.Formulación de hipótesis.Definición de estrategias de mitigación.Validación de recuperación del servicio.Coordinación técnica durante situaciones críticas.Buscamos un perfil con mentalidad SREConfiabilidad + Observabilidad + Automatización + Resiliencia + Análisis de incidentes + Mejora continuaUna persona con capacidad para pasar de la reacción ante un incidente a la prevención y mejora estructural del servicio.Ubicación: Bogotá, ColombiaModalidad: Híbrida 3x2Contrato: IndefinidoHorario: Lunes a viernes, 8:00 a.m. – 6:00 p.m.Experiencia: 3 a 5 años
#J-*****-Ljbffr
📌 Ingeniero/A Sre2 - Site Reliability Engineer (Bogotá)
🏢 Digital Profit Colombia
📍 Bogotá
Postulate a este anuncio
Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.