Ingeniero de datos IA/ML (Colombia)

Ingeniero de datos IA/ML (Colombia)

15 sep
|
Layer7.mx
|
Colombia

15 sep

Layer7.mx

Colombia

¡Únete a nuestro equipo!

¡Queremos que formes parte de nuestro talentoso equipo de profesionales! Aprovecha esta oportunidad para desarrollar tus habilidades y crecer profesionalmente en un ambiente dinámico y colaborativo.

Perfil del Candidato:

Este rol es adecuado para alguien con experiencia real moviendo datos a escala que quiera especializarse en la capa que sostiene a los sistemas de IA: no solo tableros y reportes, sino datasets de entrenamiento, features en producción y la evidencia con la que se evalúan modelos y agentes.

Buscamos a alguien riguroso y pragmático: que piense en costo y en frescura tanto como en corrección, que instrumente sus pipelines antes de que fallen, y que sepa distinguir entre "el job terminó sin error" y "los datos son correctos".

No necesitas dominar todo el stack. Necesitas fundamentos sólidos de Python, SQL y procesamiento distribuido, criterio para diseñar modelos de datos que sobrevivan al cambio, y la disciplina para construir pipelines que sigan funcionando cuando nadie los está mirando.

Responsabilidades del Puesto:

En tu rol como Ingeniero de Datos para IA/ML, serás quien construye y opera la infraestructura de datos sobre la que corren nuestros modelos y agentes: desde la ingesta de fuentes operativas, telefonía y sistemas de negocio, hasta las tablas curadas que alimentan entrenamiento, evaluación y features en producción. Trabajarás con volúmenes de miles de millones de registros al año, donde una decisión de particionado o de formato de tabla se traduce directamente en costo y latencia. Tus retos diarios incluirán:

● Diseñar y operar pipelines ETL/ELT de extremo a extremo: ingesta batch e incremental (CDC) desde bases operativas, APIs, colas y archivos hacia el lakehouse, con idempotencia, reprocesos controlados y contratos de datos explícitos.

● Procesamiento distribuido con Apache Spark: escribir y optimizar jobs en PySpark y Spark SQL para transformaciones a gran escala, afinando particionado, shuffles, joins y uso de recursos del clúster.

● Construir el modelo de datos analítico: arquitectura por capas (bronze / silver / gold) sobre formatos de tabla abiertos como Apache Iceberg y almacenamiento de objetos, con versionado y evolución de esquema.

● Orquestación de flujos con Airflow, Dagster o equivalentes: dependencias, reintentos, backfills, SLAs y alertamiento de fallas.

● Preparación de datasets para Machine Learning: feature engineering, ventanas temporales sin fuga de información, splits reproducibles y versionado de datasets.





● Construcción y mantenimiento de feature stores y tablas de features servidas tanto en batch como en línea para modelos en producción.

● Pipelines de datos para agentes de IA y LLMs: ingesta y normalización de transcripciones, logs de conversación, traces y llamadas a herramientas, para alimentar evaluaciones, fine-tuning y análisis de calidad.

● Pipelines de RAG a escala: chunking, generación de embeddings por lote, carga en bases vectoriales y estrategias de reindexado incremental.

● Procesamiento near real-time con Kafka y Spark Structured Streaming para los casos donde el batch no es suficiente.

● Calidad y observabilidad de datos: pruebas automatizadas, validación de esquemas, detección de anomalías, monitoreo de frescura, linaje y documentación de los datasets.

● Optimización de costo y desempeño: compactación de archivos pequeños, tuning de consultas, elección de formatos y estrategias de almacenamiento por capa.

● Modelado y transformación declarativa con SQL avanzado y dbt o similares, sobre motores como Trino, Athena, Spark SQL y PostgreSQL.

● Colaboración con científicos de datos e ingenieros de IA para llevar features y modelos de la experimentación a producción, y con equipos de producto para entender el dominio del dato.

● Gobierno y seguridad del dato: control de accesos, manejo de información sensible, anonimización y cumplimiento de políticas internas.

● Despliegue contenerizado de los servicios de datos e infraestructura como código, bajo flujos de Git con code review y CI/CD.

Habilidades y Competencias Requeridas:

● Dominio de Python aplicado a datos: código modular, testeable y reproducible, con manejo de pandas, PySpark, entornos virtuales y empaquetado de jobs.

● Dominio de SQL avanzado: window functions, CTEs, modelado dimensional y lectura de planes de ejecución para optimizar consultas pesadas.

● Experiencia comprobable con Apache Spark en producción: entendimiento de particiones, shuffles, broadcast joins, caching y diagnóstico de jobs lentos o con data skew.

● Diseño de pipelines ETL/ELT con criterios de idempotencia, reprocesamiento,



manejo de datos que llegan tarde y contratos de datos entre productores y consumidores.

● Conocimiento de arquitecturas lakehouse y formatos de tabla abiertos (Apache Iceberg, Delta Lake o Hudi), así como de formatos columnares como Parquet.

● Experiencia con orquestadores de flujos (Airflow, Dagster, Prefect o similares), incluyendo dependencias, backfills y estrategias de reintento.

● Fundamentos sólidos de Machine Learning: cómo se entrena, evalúa y monitorea un modelo, y qué exige eso del dato en términos de leakage, sesgo, drift y reproducibilidad.

● Familiaridad con prácticas de MLOps: versionado de datos y modelos, seguimiento de experimentos, monitoreo de drift y pipelines de reentrenamiento.

● Comprensión de sistemas de IA generativa desde el lado de datos: embeddings, bases vectoriales, RAG, evaluación de agentes y explotación de traces y transcripciones.

● Experiencia con bases de datos relacionales (PostgreSQL) y nociones de bases vectoriales, columnares y NoSQL según el caso de uso.

● Manejo de procesamiento en streaming con Kafka y/o Spark Structured Streaming, y comprensión de semánticas de entrega y ventanas de tiempo.

● Conocimientos de Docker y comodidad trabajando en Linux: contenerizar jobs y servicios, línea de comandos, logs y diagnóstico de problemas en servidores.

● Experiencia con almacenamiento de objetos (S3 o compatible) y motores de consulta distribuidos como Trino o Athena.

● Cultura de calidad de datos: pruebas automatizadas, validación de esquemas, monitoreo de frescura y trazabilidad del linaje.

● Colaboración técnica eficiente empleando Git bajo flujos de trabajo basados en pull requests, revisiones de código y CI/CD.

● Habilidad para documentar modelos de datos y comunicar decisiones y trade-offs de forma clara a perfiles técnicos y no técnicos.

● Experiencia de 3 a 6 años en roles como Data Engineer, Analytics Engineer, ML Engineer o Backend con foco en datos.

Deseable (suma puntos):● Experiencia con dbt para transformaciones declarativas, pruebas y documentación sobre el warehouse.

● Exposición a datos de telefonía, contact center o cobranza: CDRs, grabaciones, transcripciones, métricas de campaña y flujos de IVR.

● Uso de Claude Code o herramientas agénticas equivalentes como parte del flujo de desarrollo cotidiano.

● Experiencia con infraestructura como código (Terraform) y con el despliegue y operación de plataformas de datos autoalojadas

📌 Ingeniero de datos IA/ML (Colombia)
🏢 Layer7.mx
📍 Colombia

Postulate a este anuncio

Muestra tus habilidades a la empresa, rellenar el formulario y deja un toque personal en la carta, ayudará el reclutador en la elección del candidato.

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: ingeniero de datos ia/ml (colombia) / colombia

Suscribete a esta alerta:

Recibe por email las nuevas ofertas de trabajo para: ingeniero de datos ia/ml (colombia) / colombia