Chat rápido, mejores ofertas — Descargar

Ingeniero de red HPC principal - Infraestructura de IA

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoRemoto
Nivel de experiencia6 a 10 años
Nivel educativoSin requisito de título

Descripción

Buscamos un **Ingeniero de red HPC principal** para impulsar la estrategia, la arquitectura y la excelencia en ingeniería detrás de la infraestructura avanzada de IA, investigación y GPU basada en Kubernetes para un importante cliente tecnológico global. El puesto se centra en definir la visión técnica, liderar las decisiones arquitectónicas y establecer estándares de ingeniería para tejidos de red de alto rendimiento que soporten cargas de trabajo distribuidas de IA y modelos de lenguaje de gran tamaño (LLM) a gran escala, incluyendo InfiniBand/RDMA, Ethernet de alta velocidad, redes de Kubernetes, redes de GPU en el lado del host, tecnologías SmartNIC/DPU y observabilidad profunda de la red. Como líder técnico, mentorizará a ingenieros senior, influirá en las hojas de ruta del cliente y será responsable de la entrega integral de plataformas de red críticas para la misión. El candidato ideal combina una experiencia profunda en tejidos InfiniBand NDR/HDR y de próxima generación, RDMA/RoCE, redes NVIDIA/Mellanox, patrones de comunicación NCCL/MSCCL, redes Linux en el host, topología PCIe/GPU/NIC y redes de Kubernetes para clústeres de GPU, junto con un historial comprobado de liderazgo de equipos de ingeniería y definición de plataformas de red HPC/IA a gran escala. **Responsabilidades** * Ser responsable de la visión arquitectónica y de la hoja de ruta a largo plazo para tejidos de red de alto rendimiento basados en InfiniBand/RDMA y Ethernet que soporten clústeres de GPU a gran escala y cargas de trabajo distribuidas de IA/LLM * Liderar el diseño, evaluación y selección de topologías de red de clúster, incluyendo Fat-tree, Clos, Rail-optimized y Dragonfly, y definir marcos de decisión alineados con las restricciones de escala, rendimiento y costo de las cargas de trabajo * Establecer estándares y buenas prácticas de ingeniería para redes en el lado del host, incluyendo configuración de NIC, controladores, firmware, afinidad de IRQ, colocación NUMA, topología PCIe y rutas de comunicación entre GPU y NIC * Impulsar iniciativas de ingeniería de rendimiento para RDMA/RoCE, NCCL/MSCCL y comunicaciones colectivas en cargas de trabajo de entrenamiento multi-nodo con GPU, y liderar complejas investigaciones de causa raíz * Definir la arquitectura de referencia para redes de Kubernetes en clústeres de GPU, incluyendo plugins CNI, políticas de red, pods con múltiples NIC, plugins de dispositivos RDMA/GPU e integración con la orquestación de cargas de trabajo * Liderar la estrategia de adopción e integración de tecnologías SmartNIC/DPU como NVIDIA BlueField, incluyendo casos de uso de SR-IOV, descarga, aislamiento y seguridad * Dar forma a la estrategia de observabilidad de red, definiendo métricas, paneles de control, alertas, detección de congestión, trazado de latencia, marcos de SLO y metodologías de análisis de capacidad y rendimiento * Mentorizar y liderar técnicamente a ingenieros de los equipos de red, Kubernetes, almacenamiento, infraestructura GPU, observabilidad e investigación en IA, impulsando la alineación transversal y la resolución de cuellos de botella complejos * Representar al equipo de ingeniería en foros con el cliente y otras partes interesadas, influyendo en la dirección técnica, comunicando compensaciones y asegurando la entrega de plataformas de red fiables y escalables **Requisitos** * 6 o más años de experiencia en roles de ingeniería relacionados con redes, infraestructura, HPC, SRE u otros similares, con al menos 3 años centrados en redes de HPC, IA/ML o clústeres de GPU, incluyendo liderazgo técnico comprobado en iniciativas a gran escala (1 año o más) * Experiencia comprobada liderando la arquitectura y entrega de tejidos InfiniBand/RDMA, Ethernet de alta velocidad y redes Linux en entornos distribuidos de cómputo críticos para el rendimiento * Conocimientos profundos sobre redes en el lado del host, incluyendo NIC, controladores y firmware, así como topología PCIe, conciencia NUMA y afinidad entre GPU y NIC, con capacidad para establecer estándares y guiar a otros ingenieros * Comprensión sólida de los patrones de comunicación en entrenamiento distribuido de IA, incluyendo cargas de trabajo basadas en NCCL y operaciones colectivas como all-reduce y all-gather, y capacidad para asesorar sobre el diseño conjunto carga de trabajo-red * Conocimientos expertos sobre Kubernetes y redes de contenedores para cargas de trabajo GPU o distribuidas, incluyendo conceptos CNI, políticas de red, patrones de múltiples NIC e integración de dispositivos RDMA/GPU * Competencia avanzada en conceptos de redes RDMA, incluyendo InfiniBand, RoCE/RoCEv2, patrones relacionados con GPUDirect, comportamiento de congestión y ajuste de rendimiento a gran escala * Dominio de redes Linux y resolución de problemas en el lado del host, incluyendo afinidad de IRQ, MTU, descargas y diagnóstico de rendimiento * Experiencia demostrada en la gestión de la estrategia de observabilidad y rendimiento de redes, incluyendo telemetría, monitoreo de tráfico, detección de congestión, análisis de latencia, SLO, planificación de capacidad y alertas/resolución de problemas en las capas L1-L4, tejido y RDMA * Excelentes habilidades de liderazgo, mentoría, gestión de partes interesadas y comunicación, con experiencia guiando equipos de ingeniería, influyendo en decisiones arquitectónicas del cliente y promoviendo consensos entre investigadores y partes interesadas de la plataforma * Excelentes habilidades escritas y verbales en inglés (nivel B2 o superior) **Deseable** * Experiencia práctica con redes Azure, Ethernet y tecnologías GPGPU/GPU a nivel arquitectónico * Amplio dominio de Grafana, Prometheus y administración de redes, con experiencia definiendo estándares de observabilidad * Capacidad comprobada para diseñar, desarrollar y gobernar Infrastructure as Code a gran escala * Competencia en Python y scripting de shell UNIX para automatización, creación de herramientas y mejora de la productividad del equipo

Parte del contenido se ha traducido automáticamente

Publicado por

Juan García

Indeed · HR

Ubicación

Juan García

Indeed · HR

Empleos similares

Ingeniero de red HPC principal - Infraestructura de IA empleo de Indeed en 2026 | ok.com