18 sep
|
Scotiabank
|
Bogotá
Propósito:
Contribuye al éxito de International Banking mediante el monitoreo continuo de plataformas, aplicaciones y servicios críticos, garantizando la detección temprana de degradaciones del servicio, alertas e incidentes, y facilitando el análisis inicial de acuerdo con los playbooks, procedimientos operativos y controles del Banco. Todas las actividades se realizan en cumplimiento de las regulaciones aplicables, políticas internas, procedimientos de riesgo operativo, estándares de seguridad, cumplimiento y conducta.
Responsabilidades:
- Mantener una vigilancia activa de pantallas de monitoreo, dashboards y consolas operativas de las aplicaciones y componentes de International Banking durante los turnos asignados.
- Monitorear alertas, incidentes y eventos a través de plataformas como Dynatrace, GEMS, Grail, dashboards designados, herramientas de gestión de logs y otras soluciones autorizadas de monitoreo operativo.
- Identificar señales de degradación del servicio, interrupciones, errores recurrentes, incremento en la latencia, fallas transaccionales, comportamientos anómalos o alertas críticas.
- Realizar el análisis inicial (triage) de alertas e incidentes validando el impacto visible, revisando dashboards, analizando logs, identificando síntomas, recopilando evidencia y determinando la severidad preliminar según los procedimientos establecidos.
- Ejecutar escalaciones oportunas hacia equipos de aplicaciones, infraestructura, soporte, SRE Senior, Gestión de Incidentes o áreas de negocio, siguiendo las matrices de escalamiento y playbooks aprobados.
- Apoyar la creación, actualización y seguimiento de incidentes o tickets en plataformas ITSM, garantizando una documentación clara sobre evidencias iniciales, tiempos de detección, acciones realizadas y estado presente.
- Consultar y ejecutar playbooks, runbooks y procedimientos documentados para actividades de primera respuesta, incluyendo acciones básicas aprobadas y pasos controlados de remediación.
- Ejecutar scripts batch o comandos operativos autorizados para validaciones o actividades básicas de remediación,
siempre dentro del alcance aprobado y definido para el rol.
- Realizar verificaciones de salud de servicios, revisión de dashboards, validación de alertas e inspecciones periódicas durante el inicio, desarrollo y cierre de cada turno.
- Llevar a cabo entregas de turno claras y completas, documentando eventos abiertos, alertas relevantes, acciones realizadas, riesgos pendientes y próximos pasos recomendados.
- Apoyar salas de crisis (war rooms) o llamadas de coordinación de incidentes proporcionando información de monitoreo en tiempo real y evidencias obtenidas de Dynatrace, Grail, logs, GEMS y dashboards operativos, sin asumir la responsabilidad de la resolución técnica avanzada.
- Mantener disciplina operativa mediante documentación precisa, actualización de registros, seguimiento de tareas y cumplimiento de procedimientos de monitoreo.
- Identificar y reportar oportunidades de mejora en alertas, dashboards, umbrales, reducción de ruido operativo y documentación, permitiendo optimizar la efectividad del monitoreo.
- Contribuir a un ambiente de trabajo inclusivo, colaborativo y orientado al servicio, alineado con la cultura de control y cumplimiento del Banco.
Educación / Experiencia / Información Adicional:
- Tecnólogo, técnico o profesional en Ingeniería de Sistemas, Ciencias de la Computación, Telecomunicaciones, Electrónica o áreas relacionadas. También se considerará experiencia equivalente en operaciones de TI, soporte o monitoreo.
- Más de 6 meses de experiencia en operaciones de TI, soporte técnico, Service Desk, ambientes NOC, monitoreo de aplicaciones, soporte de infraestructura o servicios digitales. Candidatos con alto potencial podrán ser considerados con menos experiencia si demuestran disciplina operativa y capacidad de aprendizaje.
- Conocimientos básicos en monitoreo de aplicaciones e infraestructura, incluyendo análisis de dashboards, interpretación de alertas, revisión de métricas, análisis de trazas, investigación de logs y monitoreo de salud de servicios.
- Conocimiento básico de Dynatrace o plataformas similares de observabilidad. Experiencia con GEMS, Grail, Splunk, Kibana, Grafana, CloudWatch, AppDynamics u otras herramientas relacionadas será considerada una ventaja.
- Capacidad para seguir playbooks, runbooks, listas de verificación y procedimientos operativos paso a paso con precisión y consistencia.
- Conocimientos básicos de entornos Linux y Windows, incluyendo la ejecución controlada de scripts y comandos documentados, así como fundamentos de redes como DNS, TCP/IP, HTTP, latencia y disponibilidad.
- Comprensión básica de Gestión de Incidentes, incluyendo severidad, impacto, urgencia, escalamiento, comunicación, recopilación de evidencias y seguimiento de tickets en plataformas ITSM.
- Capacidad para analizar logs e identificar patrones simples de error, fallas recurrentes, anomalías de comportamiento u otros indicadores relevantes para el análisis de incidentes.
- Fuertes habilidades de comunicación verbal y escrita en español para reportar hallazgos, documentar incidentes y realizar entregas de turno. El inglés no es obligatorio, pero será considerado un valor agregado.
- Alto nivel de atención al detalle, concentración sostenida, orientación a procesos, puntualidad, trabajo en equipo y capacidad para mantener la calma durante incidentes o degradaciones del servicio.
- Disponibilidad para trabajar presencialmente en Bogotá y participar en turnos nocturnos rotativos cuando sea requerido.
Working Conditions
Work in a standard office-based environment; non-standard hours are a common occurrence
Availability to work rotating monitoring shifts, including overnight coverage, extended operational support hours, and schedule adjustments as required to meet business and operational needs.
Onsite role based in Bogotá, Colombia.
📌 SRE Analyst - Analista SRE (Site Reliability Engineering) (Bogotá)
🏢 Scotiabank
📍 Bogotá