01 oct
|
Scotiabank
|
Bogotá, D.C.
01 oct
Scotiabank
Bogotá, D.C.
Contribuye al éxito de International Banking mediante el monitoreo continuo de plataformas, aplicaciones y servicios críticos, garantizando la detección temprana de degradaciones del servicio, alertas e incidentes, y facilitando el análisis inicial de acuerdo con los playbooks, procedimientos operativos y controles del Banco. Todas las actividades se realizan en cumplimiento de las regulaciones aplicables, políticas internas, procedimientos de riesgo operativo, estándares de seguridad, cumplimiento y conducta.
- Mantener una vigilancia activa de pantallas de monitoreo, dashboards y consolas operativas de las aplicaciones y componentes de International Banking durante los turnos asignados.
- Monitorear alertas, incidentes y eventos a través de plataformas como Dynatrace, GEMS, Grail, dashboards designados, herramientas de gestión de logs y otras soluciones autorizadas de monitoreo operativo.
- Identificar señales de degradación del servicio, interrupciones, errores recurrentes, incremento en la latencia, fallas transaccionales, comportamientos anómalos o alertas críticas.
- Realizar el análisis inicial (triage) de alertas e incidentes validando el impacto visible, revisando dashboards, analizando logs, identificando síntomas, recopilando evidencia y determinando la severidad preliminar según los procedimientos establecidos.
- Ejecutar escalaciones oportunas hacia equipos de aplicaciones, infraestructura, soporte, SRE Senior, Gestión de Incidentes o áreas de negocio, siguiendo las matrices de escalamiento y playbooks aprobados.
- Apoyar la creación, actualización y seguimiento de incidentes o tickets en plataformas ITSM, garantizando una documentación clara sobre evidencias iniciales, tiempos de detección, acciones realizadas y estado vigente.
- Consultar y ejecutar playbooks, runbooks y procedimientos documentados para actividades de primera respuesta, incluyendo acciones básicas aprobadas y pasos controlados de remediación.
- Ejecutar scripts batch o comandos operativos autorizados para validaciones o actividades básicas de remediación, siempre dentro del alcance aprobado y definido para el rol.
- Realizar verificaciones de salud de servicios, revisión de dashboards, validación de alertas e inspecciones periódicas durante el inicio, desarrollo y cierre de cada turno.
- Llevar a cabo entregas de turno claras y completas, documentando eventos abiertos, alertas relevantes, acciones realizadas, riesgos pendientes y próximos pasos recomendados.
- Apoyar salas de crisis (war rooms) o llamadas de coordinación de incidentes proporcionando información de monitoreo en tiempo real y evidencias obtenidas de Dynatrace, Grail, logs, GEMS y dashboards operativos, sin asumir la responsabilidad de la resolución técnica avanzada.
- Mantener disciplina operativa mediante documentación precisa, actualización de registros, seguimiento de tareas y cumplimiento de procedimientos de monitoreo.
- Identificar y reportar oportunidades de mejora en alertas, dashboards, umbrales, reducción de ruido operativo y documentación, permitiendo optimizar la efectividad del monitoreo.
- Contribuir a un ambiente de trabajo inclusivo, colaborativo y orientado al servicio, alineado con la cultura de control y cumplimiento del Banco.
- Tecnólogo, técnico o profesional en Ingeniería de Sistemas, Ciencias de la Computación, Telecomunicaciones, Electrónica o áreas relacionadas. También se considerará experiencia equivalente en operaciones de TI, soporte o monitoreo.
- Más de 6 meses de experiencia en operaciones de TI, soporte técnico, Service Desk, ambientes NOC, monitoreo de aplicaciones,
soporte de infraestructura o servicios digitales. Candidatos con alto potencial podrán ser considerados con menos experiencia si demuestran disciplina operativa y capacidad de aprendizaje.
- Conocimientos básicos en monitoreo de aplicaciones e infraestructura, incluyendo análisis de dashboards, interpretación de alertas, revisión de métricas, análisis de trazas, investigación de logs y monitoreo de salud de servicios.
- Conocimiento básico de Dynatrace o plataformas similares de observabilidad. Experiencia con GEMS, Grail, Splunk, Kibana, Grafana, CloudWatch, AppDynamics u otras herramientas relacionadas será considerada una ventaja.
- Capacidad para seguir playbooks, runbooks, listas de verificación y procedimientos operativos paso a paso con precisión y consistencia.
- Conocimientos básicos de entornos Linux y Windows, incluyendo la ejecución controlada de scripts y comandos documentados, así como fundamentos de redes como DNS, TCP/IP, HTTP, latencia y disponibilidad.
- Comprensión básica de Gestión de Incidentes, incluyendo severidad, impacto, urgencia, escalamiento, comunicación, recopilación de evidencias y seguimiento de tickets en plataformas ITSM.
- Capacidad para analizar logs e identificar patrones simples de error, fallas recurrentes, anomalías de comportamiento u otros indicadores relevantes para el análisis de incidentes.
- Fuertes habilidades de comunicación verbal y escrita en español para reportar hallazgos, documentar incidentes y realizar entregas de turno. El inglés no es obligatorio, pero será considerado un valor agregado.
- Alto nivel de atención al detalle, concentración sostenida, orientación a procesos, puntualidad, trabajo en equipo y capacidad para mantener la calma durante incidentes o degradaciones del servicio.
- Disponibilidad para trabajar presencialmente en Bogotá y participar en turnos nocturnos rotativos cuando sea requerido.
#J-18808-Ljbffr
📌 SRE Analyst - Analista SRE (Site Reliability Engineering) - Scotiatech (Bogotá, D.C.)
🏢 Scotiabank
📍 Bogotá, D.C.