Descripción
Este puesto requiere una mentalidad de ingeniero de confiabilidad de sitios (SRE) combinada con experiencia en IA/ML y sólidas habilidades de ingeniería de aplicaciones en entornos de nube pública y privada.
**Responsabilidades clave**
\- Propiedad integral del servicio: diseñar para telemetría, seguridad, resiliencia, escalabilidad y rendimiento; liderar el dimensionamiento/arquitectura; impulsar revisiones de salud del servicio y simplificación de procesos.
\- Gestión y prevención de incidencias: liderar análisis posteriores a fallos (postmortems) y análisis de causas raíz (RCA), coordinar correcciones, definir elementos de reparación e implementar prevención basada en datos y mejora continua.
\- Entrega de IA/ML y GenIA: diseñar e integrar soluciones con modelos de lenguaje grande (LLM), recuperación-aumentada con generación (RAG), flujos de trabajo basados en agentes e IA conversacional; construir pipelines de servicio de modelos de baja latencia y reentrenamiento.
\- Ingeniería de aplicaciones: desarrollar microservicios de alto rendimiento para sistemas distribuidos, contenerizados y nativos de la nube.
\- Automatización: eliminar tareas repetitivas automatizando flujos operativos, procedimientos de recuperación, entrega de código y gestión de configuraciones; construir herramientas internas y scripts/servicios reutilizables para acelerar la entrega y reducir errores.
\- Observabilidad: definir e implementar estrategias de monitoreo, registro (logging), alertas y trazado (tracing); establecer objetivos de nivel de servicio (SLO) y indicadores de nivel de servicio (SLI), así como presupuestos de error; mejorar los diagnósticos y la visibilidad del rendimiento para una clasificación rápida.
\- Colaboración interfuncional: colaborar con equipos de producto, operaciones y datos para traducir requisitos en soluciones seguras y escalables; comunicarse eficazmente con partes interesadas técnicas y no técnicas.
**Cualificaciones mínimas**
\- Licenciatura o maestría en Ciencias de la Computación o campo relacionado; 10 años o más de experiencia en ingeniería de software en entornos de nube.
\- Conocimientos sólidos en sistemas distribuidos/microservicios usando Java/Python; modelado de datos/SQL; Python para IA/automatización.
\- Experiencia en SRE/DevOps: fundamentos de sistemas y redes, seguridad de aplicaciones, observabilidad, análisis de rendimiento y respuesta ante incidencias.
\- Excelencia comprobada en el ciclo de vida del desarrollo de software (SDLC): calidad del código, revisiones, control de versiones, integración y despliegue continuos (CI/CD), pruebas e ingeniería de lanzamientos.
\- Excelentes habilidades de comunicación escrita y verbal; dominio del inglés.
**Habilidades preferidas/técnicas**
\- IA/ML/GenIA: experiencia con modelos fundamentales, RAG y arquitecturas basadas en agentes; despliegue, optimización, monitoreo y reentrenamiento de modelos.
\- Nube y contenedores: experiencia en contenerización, orquestación y microservicios resilientes y tolerantes a fallos.
\- Observabilidad: experiencia práctica diseñando paneles de control, alertas, trazas, registros y métricas; definición de SLO/SLI y presupuestos de error; disponibilidad para turnos de guardia y calidad de manuales operativos (runbooks).
\- Operaciones: ajuste de rendimiento en Java/Python y SQL para aplicaciones empresariales a gran escala; sólida experiencia en Linux/Unix; planificación de capacidad y revisiones de confiabilidad.
\- Automatización y scripting: dominio del scripting para automatizar flujos operativos, construcción de herramientas y tareas de CI/CD (por ejemplo, scripting en shell, Python, infraestructura como código, ejecutores de tareas).
\- Conocimiento de aplicaciones empresariales ERP y prácticas/herramientas estándar de DevOps.