欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
1. 负责GPU/CPU服务器、网络存储及AI基础设施(K8s+MPI/DeepSpeed)日常巡检与维护。 2. 建立应急预案,快速响应集群宕机、训练中断等故障,精准定位并沉淀规避方案。 3. 监控算力利用率,优化调度策略与运行参数,解决显存不足及通信延迟等瓶颈。 4. 对接分布式存储(Ceph/GlusterFS),保障AI训练数据与模型的安全及高并发访问。 5. 统一配置GPU驱动、CUDA/CUDNN及深度学习框架,通过自动化工具管控配置一致性。 6. 协助算法团队优化分布式训练方案,支撑大模型训练/推理的资源调度与落地。 7. 搭建运维自动化体系,利用Ansible/Jenkins实现部署、更新及故障自愈的自动化。 8. 落实权限管控与漏洞防护,定期开展压力测试与灾备演练,保障集群高负载稳定。 1. 计算机、软件工程等相关专业本科及以上学历。 2. 5年以上AI/HPC集群运维经验,熟悉K8s+AI调度(Volcano/Kubeflow)及DeepSpeed。 3. 精通Linux系统管理,熟练使用Shell/Python开发自动化运维工具与巡检脚本。 4. 精通GPU硬件特性、CUDA/CUDNN版本适配,掌握显存分析与算力性能调优。 5. 熟悉Docker/K8s及AI原生调度工具,掌握Ceph/GlusterFS等分布式存储维护。 6. 熟悉TensorFlow/PyTorch及MPI/NCCL分布式训练技术,能排查集群层面问题。 7. 具备扎实网络基础,熟悉TCP/IP及InfiniBand高速网络配置与延迟排查。 加分项 a, 具备大规模GPU集群及分布式训练集群实战运维经验者优先。 b, 有主导集群版本迭代、新硬件接入及自动化工具部署经验者优先。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录1. 负责GPU/CPU服务器、网络存储及AI基础设施(K8s+MPI/DeepSpeed)日常巡检与维护。 2. 建立应急预案,快速响应集群宕机、训练中断等故障,精准定位并沉淀规避方案。 3. 监控算力利用率,优化调度策略与运行参数,解决显存不足及通信延迟等瓶颈。 4. 对接分布式存储(Ceph/GlusterFS),保障AI训练数据与模型的安全及高并发访问。 5. 统一配置GPU驱动、CUDA/CUDNN及深度学习框架,通过自动化工具管控配置一致性。 6. 协助算法团队优化分布式训练方案,支撑大模型训练/推理的资源调度与落地。 7. 搭建运维自动化体系,利用Ansible/Jenkins实现部署、更新及故障自愈的自动化。 8. 落实权限管控与漏洞防护,定期开展压力测试与灾备演练,保障集群高负载稳定。 1. 计算机、软件工程等相关专业本科及以上学历。 2. 5年以上AI/HPC集群运维经验,熟悉K8s+AI调度(Volcano/Kubeflow)及DeepSpeed。 3. 精通Linux系统管理,熟练使用Shell/Python开发自动化运维工具与巡检脚本。 4. 精通GPU硬件特性、CUDA/CUDNN版本适配,掌握显存分析与算力性能调优。 5. 熟悉Docker/K8s及AI原生调度工具,掌握Ceph/GlusterFS等分布式存储维护。 6. 熟悉TensorFlow/PyTorch及MPI/NCCL分布式训练技术,能排查集群层面问题。 7. 具备扎实网络基础,熟悉TCP/IP及InfiniBand高速网络配置与延迟排查。 加分项 a, 具备大规模GPU集群及分布式训练集群实战运维经验者优先。 b, 有主导集群版本迭代、新硬件接入及自动化工具部署经验者优先。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作