Descripción
Buscamos un **Ingeniero Senior de Redes HPC** para apoyar infraestructuras avanzadas de IA, investigación y basadas en Kubernetes con GPU para un importante cliente tecnológico global.
El puesto se centra en la arquitectura, operación y optimización de redes de alto rendimiento para cargas de trabajo de IA distribuida y modelos de lenguaje de gran tamaño (LLM) a gran escala, incluyendo InfiniBand/RDMA, Ethernet de alta velocidad, redes Kubernetes, redes GPU en el lado del host, tecnologías SmartNIC/DPU y observabilidad profunda de la red.
El candidato ideal cuenta con amplia experiencia práctica con InfiniBand NDR/HDR y redes de próxima generación, RDMA/RoCE, redes NVIDIA/Mellanox, patrones de comunicación NCCL/MSCCL, redes Linux en el host, topología PCIe/GPU/NIC y redes Kubernetes para clústeres de GPU.
**Responsabilidades**
* Arquitecturar, operar y solucionar incidencias en redes de alto rendimiento InfiniBand/RDMA y Ethernet para clústeres de GPU a gran escala y cargas de trabajo de IA/LLM distribuidas
* Diseñar y evaluar topologías de red para clústeres, incluyendo Fat-tree, Clos, Rail-optimizadas y Dragonfly, según la escala de la carga de trabajo y las necesidades de rendimiento
* Optimizar la red en el lado del host, incluyendo configuración de NIC, controladores, firmware, afinidad de IRQ, ubicación NUMA, topología PCIe y rutas de comunicación entre GPU y NIC
* Ajustar y solucionar incidencias en RDMA/RoCE, NCCL/MSCCL y el rendimiento de comunicaciones colectivas para cargas de trabajo de entrenamiento multi-nodo con GPU
* Diseñar y mantener redes Kubernetes para clústeres de GPU, incluyendo plugins CNI, políticas de red, pods con múltiples NIC, plugins de dispositivos RDMA/GPU e integración con la orquestación de cargas de trabajo
* Apoyar tecnologías SmartNIC/DPU como NVIDIA BlueField cuando sea aplicable, incluyendo casos de uso SR-IOV, descarga, aislamiento y seguridad
* Construir y mejorar la observabilidad de la red, incluyendo métricas, paneles de control, alertas, detección de congestión, trazado de latencia, informes de SLO y análisis de capacidad/rendimiento
* Colaborar con equipos de Kubernetes, almacenamiento, infraestructura GPU, observabilidad e investigación en IA para resolver cuellos de botella de red y E/S, y mejorar la fiabilidad de las cargas de trabajo
**Requisitos**
* 5 o más años de experiencia en redes, infraestructura, HPC, SRE u otros roles de ingeniería similares, con al menos 2 años centrados en HPC, IA/ML o redes para clústeres de GPU
* Experiencia comprobada en redes InfiniBand/RDMA, Ethernet de alta velocidad y redes Linux en entornos de cómputo distribuido críticos para el rendimiento
* Conocimientos sobre redes en el lado del host, incluyendo NIC, controladores y firmware, así como topología PCIe, conciencia NUMA y afinidad entre GPU y NIC
* Conocimiento de los patrones de comunicación en entrenamiento distribuido de IA, incluyendo cargas de trabajo basadas en NCCL y operaciones colectivas como all-reduce y all-gather
* Experiencia especializada en redes Kubernetes y contenedores para cargas de trabajo con GPU o distribuidas, incluyendo conceptos CNI, políticas de red, patrones de múltiples NIC e integración de dispositivos RDMA/GPU
* Competencia en conceptos de redes RDMA, incluyendo InfiniBand, RoCE/RoCEv2, patrones relacionados con GPUDirect, comportamiento de congestión y ajuste de rendimiento
* Habilidades en redes Linux y resolución de incidencias en el lado del host, incluyendo afinidad de IRQ, MTU, descargas y diagnóstico de rendimiento
* Antecedentes en observabilidad y gestión del rendimiento de redes, incluyendo telemetría, monitoreo de tráfico y detección de congestión, así como análisis de latencia, SLO y planificación de capacidad, además de alertas y solución de incidencias en las capas L1-L4, la red de interconexión y RDMA
* Fuertes habilidades para la resolución de incidencias, análisis de causas raíz, documentación y comunicación al trabajar con equipos de ingeniería del cliente, investigadores y partes interesadas de la plataforma
* Nivel de inglés mínimo B2 (intermedio alto) para una comunicación eficaz
**Deseable**
* Familiaridad con redes Azure, Ethernet y tecnologías GPGPU/GPU
* Competencia en Grafana, Prometheus y administración de redes
* Capacidad para desarrollar y mantener infraestructura como código
* Flexibilidad para usar Python y scripts de shell UNIX para automatización y herramientas