欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
课题背景: 随着大语言模型(LLM)参数量级的爆炸式增长,超大规模 AI 集群的算力瓶颈已逐渐从单卡算力转移到集群通信能力上。本项目聚焦于“高性能大模型训练/推理网络”,基于腾讯自研的星脉网络 2. 0,致力于打通端侧计算节点与网侧交换机,构建端到端的高性能网络架构。通过在芯片、硬件、软件及集群网络算法等关键技术上的全栈自研,全面提升 GPU 集群的数据吞吐与协同效率,为腾讯内部应用及公有云业务的 AI 大模型训练与推理场景提供坚实的底层网络支撑。 课题挑战: 1、端网协同的极致性能优化:如何在硬件网卡、驱动、传输层协议与网侧交换机之间进行全栈协同设计,打破传统网络协议瓶颈,实现底层通信效率的极限突破; 2、复杂流量下的动态拥塞控制:在大模型训练的 All-to-All、All-Reduce 等高频突发流量场景下,如何设计并实现高效、灵活的网卡可编程拥塞控制(CC)算法,避免网络拥堵导致的算力闲置; 3、vRDMA 协议栈的深度定制与虚拟化:在云原生环境下,如何兼顾 RDMA 的高性能与虚拟化的灵活性,解决 vRDMA 在多租户隔离、连接大规模扩展及高可靠传输上的技术挑战; 4、全路径性能瓶颈定位与观测:在复杂的分布式环境下,如何建立从底层网络协议到上层 AI 框架的端到端观测体系,实现对网络波动、协议异常及计算通信重叠问题的精准识别与快速定位。 具体工作: 你将深入参与到超大规模 AI 集群高性能网络的架构设计、协议开发与端到端优化中,具体包括: 1、vRDMA 核心传输协议开发:深入参与vRDMA传输层的设计与实现,涵盖多路径负载均衡、快速重传机制、大规模连接状态机管理逻辑优化; 2、端到端训练性能优化:基于 vRDMA 平台及商业网卡(如 NVIDIA ConnectX 系列),优化大模型训练中的集合通信库(如 NCCL/RCCL),提升有效带宽与并行效率; 3、低延迟推理网络优化:针对大语言模型推理场景,利用 vRDMA 的硬件卸载与轻量化协议栈特性,优化 Prefill 与 Decode 阶段的通信逻辑,并结合商业网卡技术栈实现高并发场景下的端到端推理加速; 4、全路径观测与性能分析体系建设:构建跨层次的性能监控方案,打通从网卡硬件计数器、驱动层、传输层协议到 AI 框架通信算子的全路径数据,实现对训练/推理任务中性能瓶颈的准确识别与根因分析; 5、可编程拥塞控制与闭环调优:参与自研可编程拥塞控制模块(如 DCQCN 或新型 CC 协议)的开发与在线调优,针对不同业务流量特征实现精细化的带宽分配。 1、包含但不限于计算机、软件工程、人工智能等相关专业博士或优秀硕士; 2、熟悉高性能网络相关技术,包括RDMA, IB, libfabric, mpi等; 3、熟悉机器学习训练过程,特别是训练中的网络通信过程及相关技术和组件。包括NCCL, DP/PP/TP, Megatron等; 4、追求极致性能,主动寻求突破。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录课题背景: 随着大语言模型(LLM)参数量级的爆炸式增长,超大规模 AI 集群的算力瓶颈已逐渐从单卡算力转移到集群通信能力上。本项目聚焦于“高性能大模型训练/推理网络”,基于腾讯自研的星脉网络 2. 0,致力于打通端侧计算节点与网侧交换机,构建端到端的高性能网络架构。通过在芯片、硬件、软件及集群网络算法等关键技术上的全栈自研,全面提升 GPU 集群的数据吞吐与协同效率,为腾讯内部应用及公有云业务的 AI 大模型训练与推理场景提供坚实的底层网络支撑。 课题挑战: 1、端网协同的极致性能优化:如何在硬件网卡、驱动、传输层协议与网侧交换机之间进行全栈协同设计,打破传统网络协议瓶颈,实现底层通信效率的极限突破; 2、复杂流量下的动态拥塞控制:在大模型训练的 All-to-All、All-Reduce 等高频突发流量场景下,如何设计并实现高效、灵活的网卡可编程拥塞控制(CC)算法,避免网络拥堵导致的算力闲置; 3、vRDMA 协议栈的深度定制与虚拟化:在云原生环境下,如何兼顾 RDMA 的高性能与虚拟化的灵活性,解决 vRDMA 在多租户隔离、连接大规模扩展及高可靠传输上的技术挑战; 4、全路径性能瓶颈定位与观测:在复杂的分布式环境下,如何建立从底层网络协议到上层 AI 框架的端到端观测体系,实现对网络波动、协议异常及计算通信重叠问题的精准识别与快速定位。 具体工作: 你将深入参与到超大规模 AI 集群高性能网络的架构设计、协议开发与端到端优化中,具体包括: 1、vRDMA 核心传输协议开发:深入参与vRDMA传输层的设计与实现,涵盖多路径负载均衡、快速重传机制、大规模连接状态机管理逻辑优化; 2、端到端训练性能优化:基于 vRDMA 平台及商业网卡(如 NVIDIA ConnectX 系列),优化大模型训练中的集合通信库(如 NCCL/RCCL),提升有效带宽与并行效率; 3、低延迟推理网络优化:针对大语言模型推理场景,利用 vRDMA 的硬件卸载与轻量化协议栈特性,优化 Prefill 与 Decode 阶段的通信逻辑,并结合商业网卡技术栈实现高并发场景下的端到端推理加速; 4、全路径观测与性能分析体系建设:构建跨层次的性能监控方案,打通从网卡硬件计数器、驱动层、传输层协议到 AI 框架通信算子的全路径数据,实现对训练/推理任务中性能瓶颈的准确识别与根因分析; 5、可编程拥塞控制与闭环调优:参与自研可编程拥塞控制模块(如 DCQCN 或新型 CC 协议)的开发与在线调优,针对不同业务流量特征实现精细化的带宽分配。 1、包含但不限于计算机、软件工程、人工智能等相关专业博士或优秀硕士; 2、熟悉高性能网络相关技术,包括RDMA, IB, libfabric, mpi等; 3、熟悉机器学习训练过程,特别是训练中的网络通信过程及相关技术和组件。包括NCCL, DP/PP/TP, Megatron等; 4、追求极致性能,主动寻求突破。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作