Chat rápido, mejores ofertas — Descargar

Ingeniero Senior de Redes HPC - Infraestructura de IA

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoRemoto
Nivel de experiencia6 a 10 años
Nivel educativoLicenciatura

Descripción

Buscamos un **Ingeniero Senior de Redes HPC** para apoyar infraestructuras avanzadas de IA, investigación y basadas en Kubernetes con GPU para un importante cliente tecnológico global. El puesto se centra en la arquitectura, operación y optimización de redes de alto rendimiento para cargas de trabajo de IA distribuida y modelos de lenguaje de gran tamaño (LLM) a gran escala, incluyendo InfiniBand/RDMA, Ethernet de alta velocidad, redes Kubernetes, redes GPU en el lado del host, tecnologías SmartNIC/DPU y observabilidad profunda de la red. El candidato ideal cuenta con amplia experiencia práctica con InfiniBand NDR/HDR y redes de próxima generación, RDMA/RoCE, redes NVIDIA/Mellanox, patrones de comunicación NCCL/MSCCL, redes Linux en el host, topología PCIe/GPU/NIC y redes Kubernetes para clústeres de GPU. **Responsabilidades** * Arquitecturar, operar y solucionar incidencias en redes de alto rendimiento InfiniBand/RDMA y Ethernet para clústeres de GPU a gran escala y cargas de trabajo de IA/LLM distribuidas * Diseñar y evaluar topologías de red para clústeres, incluyendo Fat-tree, Clos, Rail-optimizadas y Dragonfly, según la escala de la carga de trabajo y las necesidades de rendimiento * Optimizar la red en el lado del host, incluyendo configuración de NIC, controladores, firmware, afinidad de IRQ, ubicación NUMA, topología PCIe y rutas de comunicación entre GPU y NIC * Ajustar y solucionar incidencias en RDMA/RoCE, NCCL/MSCCL y el rendimiento de comunicaciones colectivas para cargas de trabajo de entrenamiento multi-nodo con GPU * Diseñar y mantener redes Kubernetes para clústeres de GPU, incluyendo plugins CNI, políticas de red, pods con múltiples NIC, plugins de dispositivos RDMA/GPU e integración con la orquestación de cargas de trabajo * Apoyar tecnologías SmartNIC/DPU como NVIDIA BlueField cuando sea aplicable, incluyendo casos de uso SR-IOV, descarga, aislamiento y seguridad * Construir y mejorar la observabilidad de la red, incluyendo métricas, paneles de control, alertas, detección de congestión, trazado de latencia, informes de SLO y análisis de capacidad/rendimiento * Colaborar con equipos de Kubernetes, almacenamiento, infraestructura GPU, observabilidad e investigación en IA para resolver cuellos de botella de red y E/S, y mejorar la fiabilidad de las cargas de trabajo **Requisitos** * 5 o más años de experiencia en redes, infraestructura, HPC, SRE u otros roles de ingeniería similares, con al menos 2 años centrados en HPC, IA/ML o redes para clústeres de GPU * Experiencia comprobada en redes InfiniBand/RDMA, Ethernet de alta velocidad y redes Linux en entornos de cómputo distribuido críticos para el rendimiento * Conocimientos sobre redes en el lado del host, incluyendo NIC, controladores y firmware, así como topología PCIe, conciencia NUMA y afinidad entre GPU y NIC * Conocimiento de los patrones de comunicación en entrenamiento distribuido de IA, incluyendo cargas de trabajo basadas en NCCL y operaciones colectivas como all-reduce y all-gather * Experiencia especializada en redes Kubernetes y contenedores para cargas de trabajo con GPU o distribuidas, incluyendo conceptos CNI, políticas de red, patrones de múltiples NIC e integración de dispositivos RDMA/GPU * Competencia en conceptos de redes RDMA, incluyendo InfiniBand, RoCE/RoCEv2, patrones relacionados con GPUDirect, comportamiento de congestión y ajuste de rendimiento * Habilidades en redes Linux y resolución de incidencias en el lado del host, incluyendo afinidad de IRQ, MTU, descargas y diagnóstico de rendimiento * Antecedentes en observabilidad y gestión del rendimiento de redes, incluyendo telemetría, monitoreo de tráfico y detección de congestión, así como análisis de latencia, SLO y planificación de capacidad, además de alertas y solución de incidencias en las capas L1-L4, la red de interconexión y RDMA * Fuertes habilidades para la resolución de incidencias, análisis de causas raíz, documentación y comunicación al trabajar con equipos de ingeniería del cliente, investigadores y partes interesadas de la plataforma * Nivel de inglés mínimo B2 (intermedio alto) para una comunicación eficaz **Deseable** * Familiaridad con redes Azure, Ethernet y tecnologías GPGPU/GPU * Competencia en Grafana, Prometheus y administración de redes * Capacidad para desarrollar y mantener infraestructura como código * Flexibilidad para usar Python y scripts de shell UNIX para automatización y herramientas

Parte del contenido se ha traducido automáticamente

Publicado por

Juan García

Indeed · HR

Ubicación

Juan García

Indeed · HR

Empleos similares

Ingeniero Senior de Redes HPC - Infraestructura de IA empleo de Indeed en 2026 | ok.com