Descripción
Buscamos un **Ingeniero Jefe de Red HPC** para definir la estrategia técnica global, la arquitectura de referencia y la visión de ingeniería detrás de la infraestructura avanzada de IA, investigación y GPU basada en Kubernetes para un importante cliente tecnológico global.
El puesto se centra en establecer la dirección técnica a largo plazo, gobernar las decisiones arquitectónicas en múltiples programas y fijar estándares de ingeniería a nivel organizacional para tejidos de red de alto rendimiento que soporten cargas de trabajo masivas de modelos de lenguaje grande (LLM) e IA distribuida, incluyendo InfiniBand/RDMA, Ethernet de alta velocidad, redes Kubernetes, redes GPU en el lado del host, tecnologías SmartNIC/DPU y observabilidad profunda de redes. Como máxima autoridad técnica, usted dará forma a la cultura de ingeniería, mentorizará a ingenieros líderes y principales, influirá en las hojas de ruta ejecutivas del cliente y asumirá la gobernanza de extremo a extremo de plataformas de red críticas para la misión en todo el portafolio.
El candidato ideal combina una experiencia autorizada en InfiniBand NDR/HDR y tejidos de próxima generación, RDMA/RoCE, redes NVIDIA/Mellanox, patrones de comunicación NCCL/MSCCL, redes Linux en el lado del host, topología PCIe/GPU/NIC y redes Kubernetes para clústeres GPU, junto con un historial comprobado de liderazgo de múltiples equipos de ingeniería, definición de estrategia técnica a nivel de programa y configuración de plataformas de red HPC/IA líderes en la industria.
**Responsabilidades**
* Definir y asumir la propiedad de la visión estratégica plurianual y la hoja de ruta arquitectónica para tejidos de alto rendimiento InfiniBand/RDMA y Ethernet que impulsen clústeres GPU a gran escala y cargas de trabajo distribuidas de IA/LLM en todo el portafolio del cliente
* Gobernar el diseño, evaluación y estandarización de topologías de red de clúster, incluyendo Fat-tree, Clos, Rail-optimizadas y Dragonfly, y establecer marcos de decisión a nivel empresarial alineados con las restricciones de escala, rendimiento y costo de las cargas de trabajo
* Establecer y hacer cumplir estándares y mejores prácticas de ingeniería a nivel organizacional para redes en el lado del host, incluyendo configuración de NIC, controladores, firmware, afinidad de IRQ, colocación NUMA, topología PCIe y rutas de comunicación entre GPU y NIC
* Fijar la dirección estratégica para la ingeniería de rendimiento en RDMA/RoCE, NCCL/MSCCL y comunicación colectiva para cargas de trabajo de entrenamiento multi-nodo GPU, y supervisar la resolución de los problemas sistémicos de rendimiento más complejos
* Definir la arquitectura de referencia canónica para redes Kubernetes en clústeres GPU, incluyendo plugins CNI, políticas de red, pods con múltiples NIC, plugins de dispositivos RDMA/GPU y su integración con la orquestación de cargas de trabajo, impulsando su adopción en todos los programas
* Asumir la estrategia y la gobernanza de tecnologías SmartNIC/DPU como NVIDIA BlueField, incluyendo casos de uso de SR-IOV, descarga, aislamiento y seguridad, y alinear su adopción con la hoja de ruta general de infraestructura
* Definir la estrategia empresarial de observabilidad para plataformas de red, gobernando métricas, paneles de control, alertas, detección de congestión, trazado de latencia, marcos SLO y metodologías de análisis de capacidad y rendimiento
* Proporcionar liderazgo técnico y mentoría a ingenieros líderes y principales en equipos de red, Kubernetes, almacenamiento, infraestructura GPU, observabilidad e investigación en IA, construyendo el canal de talento y promoviendo la alineación transfuncional a gran escala
* Actuar como máxima autoridad técnica en foros ejecutivos del cliente y con partes interesadas, moldeando la dirección técnica estratégica, negociando compensaciones a nivel de programa y garantizando la entrega de plataformas de red confiables y escalables en múltiples compromisos
* Contribuir a la comunidad de ingeniería más amplia mediante liderazgo intelectual, desarrollo interno de prácticas y representación de la empresa en eventos industriales
**Requisitos**
* 8+ años de experiencia en roles de ingeniería relacionados con redes, infraestructura, HPC, SRE o similares, con 4+ años centrados en redes HPC, IA/ML o clústeres GPU, incluyendo liderazgo técnico demostrado a nivel de programa o portafolio (2+ años)
* Experiencia comprobada definiendo la arquitectura y gobernando la entrega de tejidos InfiniBand/RDMA, Ethernet de alta velocidad y redes Linux en entornos distribuidos de cómputo a gran escala y críticos para el rendimiento
* Experiencia autorizada en redes en el lado del host, incluyendo NIC, controladores y firmware, así como topología PCIe, conciencia NUMA y afinidad GPU-NIC, con capacidad comprobada para establecer estándares a nivel empresarial y elevar organizaciones de ingeniería
* Comprensión profunda de los patrones de comunicación en entrenamiento distribuido de IA, incluyendo cargas de trabajo basadas en NCCL y operaciones colectivas como all-reduce y all-gather, con capacidad para impulsar estrategias de co-diseño carga de trabajo-red a gran escala
* Conocimiento autorizado de Kubernetes y redes de contenedores para cargas de trabajo GPU o distribuidas, incluyendo conceptos CNI, políticas de red, patrones de múltiples NIC e integración de dispositivos RDMA/GPU, con experiencia definiendo arquitecturas de referencia
* Dominio experto de conceptos de redes RDMA, incluyendo InfiniBand, RoCE/RoCEv2, patrones relacionados con GPUDirect, comportamiento de congestión y ajuste de rendimiento a muy gran escala
* Dominio de redes Linux y resolución de problemas en el lado del host, incluyendo afinidad de IRQ, MTU, descargas y diagnóstico de rendimiento, con capacidad para definir metodologías diagnósticas para toda la organización de ingeniería
* Experiencia comprobada en la propiedad de estrategias empresariales de observabilidad y gestión del rendimiento de redes, incluyendo telemetría, monitoreo de tráfico, detección de congestión, análisis de latencia, SLO, planificación de capacidad y alertas/resolución de problemas en las capas L1-L4, tejido y RDMA
* Excelentes habilidades de liderazgo, mentoría, gestión de partes interesadas y comunicación ejecutiva, con experiencia comprobada liderando múltiples equipos de ingeniería, influyendo en decisiones arquitectónicas del cliente a nivel C-suite y generando consenso entre investigadores, partes interesadas de la plataforma y patrocinadores ejecutivos
* Competencia avanzada en inglés (nivel C1)
**Deseable**
* Experiencia práctica arquitectónica y estratégica con redes Azure, Ethernet y tecnologías GPGPU/GPU
* Dominio autorizado de Grafana, Prometheus y administración de redes, con experiencia definiendo estándares de observabilidad en una organización de ingeniería
* Capacidad comprobada para definir estrategias, gobernar y escalar prácticas de Infraestructura como Código (IaC) en múltiples equipos y programas
* Competencia en Python y scripting de shell UNIX para automatización, herramientas y mejora de la productividad de ingeniería a nivel organizacional
* Historial de liderazgo intelectual mediante charlas en conferencias, publicaciones, patentes o contribuciones de código abierto en el dominio de redes HPC/IA