欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
工作职责:1. 负责大规模GPU集群的管理与训练系统建设,包括任务调度、资源管理、训练框架适配与性能优化。2. 解决超大规模训练任务中出现的稳定性、网络通讯、NCCL通讯、断点恢复等问题,构建训练全链路可观测体系。3. 针对不同GPU型号,进行算子适配和算子调优,实现慢节点自动检测与故障自愈。4. 针对不同训练场景、集群环境,设计自动化运维工具,持续优化训练方案与GPU有效利用率。5. 与算法、数据、平台紧密配合,打造一套高效的训练生态,推动训练成本优化。工作要求:工作要求1. 精通C++、Rust、Python等任意一门语言,C++更佳,具备良好的系统设计与工程实现能力。2. 熟悉Megatron、DeepSpeed、PyTorch、FSDP等一种或者多种训练框架的底层原理。3. 有真实GPU训练任务调优经验,解决过训练中出现过的慢节点、机器故障、网络拥塞等问题。4. 在大规模训练任务中,有过算子调优、精度验证、CUDA优化、训练策略优化(ZeRO/TP/PP/DP/EP)等经验。5. 有RDMA网络、高性能存储、NCCL通讯等方面的经验,熟悉Linux系统编程。加分项1. 社区开源训推框架贡献者,包括但不限于Megatron、DeepSpeed、SGLang、vLLM等;2. 有大规模音视频生成与理解模型的训练/推理优化经验,如视频生成、多模态理解等方向;3. 有大规模MoE(Mixture of Experts)与Diffusion Transformer(DiT)模型的训练性能优化、显存优化、通信优化等实战经验;4. 有千卡/万卡GPU任务训推经验, 有H卡、B卡针对性调优经验
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录工作职责:1. 负责大规模GPU集群的管理与训练系统建设,包括任务调度、资源管理、训练框架适配与性能优化。2. 解决超大规模训练任务中出现的稳定性、网络通讯、NCCL通讯、断点恢复等问题,构建训练全链路可观测体系。3. 针对不同GPU型号,进行算子适配和算子调优,实现慢节点自动检测与故障自愈。4. 针对不同训练场景、集群环境,设计自动化运维工具,持续优化训练方案与GPU有效利用率。5. 与算法、数据、平台紧密配合,打造一套高效的训练生态,推动训练成本优化。工作要求:工作要求1. 精通C++、Rust、Python等任意一门语言,C++更佳,具备良好的系统设计与工程实现能力。2. 熟悉Megatron、DeepSpeed、PyTorch、FSDP等一种或者多种训练框架的底层原理。3. 有真实GPU训练任务调优经验,解决过训练中出现过的慢节点、机器故障、网络拥塞等问题。4. 在大规模训练任务中,有过算子调优、精度验证、CUDA优化、训练策略优化(ZeRO/TP/PP/DP/EP)等经验。5. 有RDMA网络、高性能存储、NCCL通讯等方面的经验,熟悉Linux系统编程。加分项1. 社区开源训推框架贡献者,包括但不限于Megatron、DeepSpeed、SGLang、vLLM等;2. 有大规模音视频生成与理解模型的训练/推理优化经验,如视频生成、多模态理解等方向;3. 有大规模MoE(Mixture of Experts)与Diffusion Transformer(DiT)模型的训练性能优化、显存优化、通信优化等实战经验;4. 有千卡/万卡GPU任务训推经验, 有H卡、B卡针对性调优经验
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作