Chat rápido, mejores ofertas — Descargar

Ingeniero Jefe de Red HPC - Infraestructura de IA

Indeed

Compañía

Tipo de empleoTiempo completo
Modalidad de trabajoRemoto
Nivel de experienciaMás de 10 años
Nivel educativoSin requisito de título

Descripción

Buscamos un **Ingeniero Jefe de Red HPC** para definir la estrategia técnica global, la arquitectura de referencia y la visión de ingeniería detrás de la infraestructura avanzada de IA, investigación y GPU basada en Kubernetes para un importante cliente tecnológico global. El puesto se centra en establecer la dirección técnica a largo plazo, gobernar las decisiones arquitectónicas en múltiples programas y fijar estándares de ingeniería a nivel organizacional para tejidos de red de alto rendimiento que soporten cargas de trabajo masivas de modelos de lenguaje grande (LLM) e IA distribuida, incluyendo InfiniBand/RDMA, Ethernet de alta velocidad, redes Kubernetes, redes GPU en el lado del host, tecnologías SmartNIC/DPU y observabilidad profunda de redes. Como máxima autoridad técnica, usted dará forma a la cultura de ingeniería, mentorizará a ingenieros líderes y principales, influirá en las hojas de ruta ejecutivas del cliente y asumirá la gobernanza de extremo a extremo de plataformas de red críticas para la misión en todo el portafolio. El candidato ideal combina una experiencia autorizada en InfiniBand NDR/HDR y tejidos de próxima generación, RDMA/RoCE, redes NVIDIA/Mellanox, patrones de comunicación NCCL/MSCCL, redes Linux en el lado del host, topología PCIe/GPU/NIC y redes Kubernetes para clústeres GPU, junto con un historial comprobado de liderazgo de múltiples equipos de ingeniería, definición de estrategia técnica a nivel de programa y configuración de plataformas de red HPC/IA líderes en la industria. **Responsabilidades** * Definir y asumir la propiedad de la visión estratégica plurianual y la hoja de ruta arquitectónica para tejidos de alto rendimiento InfiniBand/RDMA y Ethernet que impulsen clústeres GPU a gran escala y cargas de trabajo distribuidas de IA/LLM en todo el portafolio del cliente * Gobernar el diseño, evaluación y estandarización de topologías de red de clúster, incluyendo Fat-tree, Clos, Rail-optimizadas y Dragonfly, y establecer marcos de decisión a nivel empresarial alineados con las restricciones de escala, rendimiento y costo de las cargas de trabajo * Establecer y hacer cumplir estándares y mejores prácticas de ingeniería a nivel organizacional para redes en el lado del host, incluyendo configuración de NIC, controladores, firmware, afinidad de IRQ, colocación NUMA, topología PCIe y rutas de comunicación entre GPU y NIC * Fijar la dirección estratégica para la ingeniería de rendimiento en RDMA/RoCE, NCCL/MSCCL y comunicación colectiva para cargas de trabajo de entrenamiento multi-nodo GPU, y supervisar la resolución de los problemas sistémicos de rendimiento más complejos * Definir la arquitectura de referencia canónica para redes Kubernetes en clústeres GPU, incluyendo plugins CNI, políticas de red, pods con múltiples NIC, plugins de dispositivos RDMA/GPU y su integración con la orquestación de cargas de trabajo, impulsando su adopción en todos los programas * Asumir la estrategia y la gobernanza de tecnologías SmartNIC/DPU como NVIDIA BlueField, incluyendo casos de uso de SR-IOV, descarga, aislamiento y seguridad, y alinear su adopción con la hoja de ruta general de infraestructura * Definir la estrategia empresarial de observabilidad para plataformas de red, gobernando métricas, paneles de control, alertas, detección de congestión, trazado de latencia, marcos SLO y metodologías de análisis de capacidad y rendimiento * Proporcionar liderazgo técnico y mentoría a ingenieros líderes y principales en equipos de red, Kubernetes, almacenamiento, infraestructura GPU, observabilidad e investigación en IA, construyendo el canal de talento y promoviendo la alineación transfuncional a gran escala * Actuar como máxima autoridad técnica en foros ejecutivos del cliente y con partes interesadas, moldeando la dirección técnica estratégica, negociando compensaciones a nivel de programa y garantizando la entrega de plataformas de red confiables y escalables en múltiples compromisos * Contribuir a la comunidad de ingeniería más amplia mediante liderazgo intelectual, desarrollo interno de prácticas y representación de la empresa en eventos industriales **Requisitos** * 8+ años de experiencia en roles de ingeniería relacionados con redes, infraestructura, HPC, SRE o similares, con 4+ años centrados en redes HPC, IA/ML o clústeres GPU, incluyendo liderazgo técnico demostrado a nivel de programa o portafolio (2+ años) * Experiencia comprobada definiendo la arquitectura y gobernando la entrega de tejidos InfiniBand/RDMA, Ethernet de alta velocidad y redes Linux en entornos distribuidos de cómputo a gran escala y críticos para el rendimiento * Experiencia autorizada en redes en el lado del host, incluyendo NIC, controladores y firmware, así como topología PCIe, conciencia NUMA y afinidad GPU-NIC, con capacidad comprobada para establecer estándares a nivel empresarial y elevar organizaciones de ingeniería * Comprensión profunda de los patrones de comunicación en entrenamiento distribuido de IA, incluyendo cargas de trabajo basadas en NCCL y operaciones colectivas como all-reduce y all-gather, con capacidad para impulsar estrategias de co-diseño carga de trabajo-red a gran escala * Conocimiento autorizado de Kubernetes y redes de contenedores para cargas de trabajo GPU o distribuidas, incluyendo conceptos CNI, políticas de red, patrones de múltiples NIC e integración de dispositivos RDMA/GPU, con experiencia definiendo arquitecturas de referencia * Dominio experto de conceptos de redes RDMA, incluyendo InfiniBand, RoCE/RoCEv2, patrones relacionados con GPUDirect, comportamiento de congestión y ajuste de rendimiento a muy gran escala * Dominio de redes Linux y resolución de problemas en el lado del host, incluyendo afinidad de IRQ, MTU, descargas y diagnóstico de rendimiento, con capacidad para definir metodologías diagnósticas para toda la organización de ingeniería * Experiencia comprobada en la propiedad de estrategias empresariales de observabilidad y gestión del rendimiento de redes, incluyendo telemetría, monitoreo de tráfico, detección de congestión, análisis de latencia, SLO, planificación de capacidad y alertas/resolución de problemas en las capas L1-L4, tejido y RDMA * Excelentes habilidades de liderazgo, mentoría, gestión de partes interesadas y comunicación ejecutiva, con experiencia comprobada liderando múltiples equipos de ingeniería, influyendo en decisiones arquitectónicas del cliente a nivel C-suite y generando consenso entre investigadores, partes interesadas de la plataforma y patrocinadores ejecutivos * Competencia avanzada en inglés (nivel C1) **Deseable** * Experiencia práctica arquitectónica y estratégica con redes Azure, Ethernet y tecnologías GPGPU/GPU * Dominio autorizado de Grafana, Prometheus y administración de redes, con experiencia definiendo estándares de observabilidad en una organización de ingeniería * Capacidad comprobada para definir estrategias, gobernar y escalar prácticas de Infraestructura como Código (IaC) en múltiples equipos y programas * Competencia en Python y scripting de shell UNIX para automatización, herramientas y mejora de la productividad de ingeniería a nivel organizacional * Historial de liderazgo intelectual mediante charlas en conferencias, publicaciones, patentes o contribuciones de código abierto en el dominio de redes HPC/IA

Parte del contenido se ha traducido automáticamente

Publicado por

Juan García

Indeed · HR

Ubicación

Juan García

Indeed · HR

Empleos similares

Ingeniero Jefe de Red HPC - Infraestructura de IA empleo de Indeed en 2026 | ok.com