欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!

网站地图
上海招聘网

上海站[切换城市]
  • 职位
    • 公司
    • 职位
  • 上海招聘网 www.shrszp.net 提示:

    确认
    上海招聘网 上海招聘网 > 招聘列表 > 招聘详情 >

    ML Infra & MLOps

    ML Infra & MLOps

    职位月薪:面议

    ML Infra & MLOps

    职位月薪: 面议

    • 岗位类别:
    • 招聘类型: 全职
    • 工作经验: 10年以上
    • 工作地点: 上海市
    • 学历要求: 本科
    • 招聘人数: 1人
      福利待遇:
    • 五险一金
    • 优质平台
    • 法定节假日休息
    • 年终奖

    收藏 收藏 小程序 小程序 岗位分享 微信分享

    聊一聊 和TA聊一聊  投递简历 投个简历

    联系方式

    联系人:宁德时代新能源科技股份有限公司

    联系电话:152****5633

    点击查看
    打电话联系前先投递一份简历,面试成功率提高60%!

    (联系我时,请说是在上海易职邦上看到的)

    职位描述

    ML Infra & MLOps 团队简介:

    (Deep Learning Full-Stack|CUDA/加速|Infra & Ops)

    我们在研发面向科学推理的新一代 LLM/MLLM 与科学大模型(新记忆系统、新 attention 结构、MoE 等)。要让这些新算法真正长成,需要一支能把云上 GPU 算力变成稳定科研生产力的团队:训练更稳、吞吐更高、推理更快、成本更可控,并让研究者能快速 bring-up、debug、复现、迭代与发布。

    前期以GPU 云服务为主,同时为未来混合部署预留可迁移能力。


    Job 1 | Deep Learning Full-Stack 工程师(LLM Training & Inference)

    岗位概述:

    你将把“研究想法”变成“可规模化的训练与推理系统”。你做的不是单点平台,而是贯穿训练、对齐、推理与发布的全栈工程,让前沿实验在云上跑得动、跑得稳、跑得快、跑得省。

    你将负责:

    • 构建并优化大模型训练系统:作业编排、数据吞吐、checkpoint/恢复、容错、实验追踪与成本控制;
    • Bring-up & debug 中途训练与对齐流程:continued pretrain / SFT / 偏好优化 / RL(按项目);
    • 构建推理服务链路:高并发、批处理、缓存、路由、灰度发布、回滚与SLA指标体系;
    • 与研究团队并肩推进 frontier experiments:把新算法(新 attention/新记忆/MoE 等)快速集成进训练与推理主干,并完成消融与复现;
    • -(可选)在合规与IP边界内沉淀通用工具/脚手架与技术报告/开源贡献/论文发表;

    我们希望你具备:

    • 熟悉分布式训练/推理工程:Megatron-LM / DeepSpeed / FSDP / TorchTitan etc.(任一做深);
    • 有系统级优化与故障定位能力:吞吐、显存、通信、checkpoint、失败恢复、稳定性;
    • 熟悉国内云平台之一的 GPU 训练实践(阿里云/火山/腾讯/华为云等):弹性扩缩、竞价/spot、成本可视化、资源配额
    • 强工程习惯:可复现、可观测、版本与发布流程清晰。


    Job 2 | CUDA Kernel & Acceleration 工程师(Attention / MoE / Ops)

    岗位概述:

    你将为科学大模型打造“发动机”。我们需要把 CUDA 内核、算子与性能工程直接注入训练/推理/对齐系统,让新结构(attention 变体、MoE、稀疏/混合精度等)在真实工作负载上获得稳定的吞吐收益与成本下降。

    你将负责:

    • 编写、集成并优化 CUDA kernels/算子:attention、MoE、dispatch-combine、融合算子等;
    • 将内核接入训练与推理框架:训练(Megatron/TorchTitan/DeepSpeed 等),推理(vLLM/SGLang 类);
    • 性能工程:混合精度、稀疏、算子融合、显存/带宽优化、profiling 与性能回归测试;
    • 与研究团队共创:确保“理论收益”变成“端到端训练/推理收益”,并在多版本迭代中保持稳定;
    • (可选)在合规与IP边界内贡献到开源 AI stack / 技术报告/论文发表,建立影响力;

    我们希望你具备:

    • 强 CUDA/性能工程能力:能独立写 kernel,熟悉 Nsight 等 profiling 工具与优化方法论;
    • 熟悉 attention/MoE/通信等典型瓶颈,理解吞吐、显存与带宽的权衡;
    • 熟悉 Triton/CUTLASS/自定义算子接入(任一即可),并能在真实训练场景验证收益;
    • 具备工程化意识:性能回归、版本兼容、可复现基准与自动化测试。


    Job 3 | ML Infra & Ops 工程师(Cloud GPU, Scheduling, CI/CD, Security)

    岗位概述:

    你将把云上 GPU 变成“像水电一样可靠”的科研基础设施。前期我们以国内 GPU 云租用为主,你的任务是建设可扩展、可观测、可自助、成本可控的基础设施与 MLOps 体系,让研究者专注算法与模型,不被环境、调度、权限与故障拖慢。

    你将负责:

    • 云上算力底座:GPU/CPU 资源编排、作业调度、配额与成本治理、生命周期自动化(扩缩/回收);
    • 集群与工作负载运维:镜像与环境管理、作业模板、数据/存储/网络基础能力、故障恢复;
    • CI/CD & GitOps:构建/测试/部署流水线、制品库、灰度发布与回滚(GitHub CI/GitLab CI/ArgoCD 等任一);
    • 可观测与SRE:监控告警、日志、追踪、容量规划、故障演练与SLA;
    • 安全与合规:权限与审计、密钥管理、网络隔离,与公司 IT/安全团队协同;

    我们希望你具备:

    • 国内云平台经验:阿里云/火山引擎/腾讯云/华为云(任一),理解 GPU 计算、网络、存储与权限模型;
    • 编排与调度:k8s 和/或 slurm(任一做深,二者都懂更佳);
    • 自动化与IaC:terraform/ansible(任一)或同类能力;
    • 可观测:Prometheus/Grafana/DataDog/VictoriaMetrics 等(任一);
    • 具备“运维产品化”思维:稳定、易用、可自助、成本可控、可持续迭代;
    • 加分项:AWS/GCP/Azure 或跨云迁移经验;


    加分项(通用):

    • 有 1,000+ GPU 规模训练/推理支持经验(或同等复杂度系统经验);
    • 熟悉多维并行(TP/PP/DP/CP/EP)与 MoE 训练优化;
    • 有开源贡献:训练框架/推理框架/性能工具/算子库等;
    • 有高质量技术写作能力(技术报告/论文/专利均可)。

    二维码微信扫一扫,及时了解投递状态
    头像您目前还没有登录:立即登录

    ML Infra & MLOps 团队简介:

    (Deep Learning Full-Stack|CUDA/加速|Infra & Ops)

    我们在研发面向科学推理的新一代 LLM/MLLM 与科学大模型(新记忆系统、新 attention 结构、MoE 等)。要让这些新算法真正长成,需要一支能把云上 GPU 算力变成稳定科研生产力的团队:训练更稳、吞吐更高、推理更快、成本更可控,并让研究者能快速 bring-up、debug、复现、迭代与发布。

    前期以GPU 云服务为主,同时为未来混合部署预留可迁移能力。


    Job 1 | Deep Learning Full-Stack 工程师(LLM Training & Inference)

    岗位概述:

    你将把“研究想法”变成“可规模化的训练与推理系统”。你做的不是单点平台,而是贯穿训练、对齐、推理与发布的全栈工程,让前沿实验在云上跑得动、跑得稳、跑得快、跑得省。

    你将负责:

    • 构建并优化大模型训练系统:作业编排、数据吞吐、checkpoint/恢复、容错、实验追踪与成本控制;
    • Bring-up & debug 中途训练与对齐流程:continued pretrain / SFT / 偏好优化 / RL(按项目);
    • 构建推理服务链路:高并发、批处理、缓存、路由、灰度发布、回滚与SLA指标体系;
    • 与研究团队并肩推进 frontier experiments:把新算法(新 attention/新记忆/MoE 等)快速集成进训练与推理主干,并完成消融与复现;
    • -(可选)在合规与IP边界内沉淀通用工具/脚手架与技术报告/开源贡献/论文发表;

    我们希望你具备:

    • 熟悉分布式训练/推理工程:Megatron-LM / DeepSpeed / FSDP / TorchTitan etc.(任一做深);
    • 有系统级优化与故障定位能力:吞吐、显存、通信、checkpoint、失败恢复、稳定性;
    • 熟悉国内云平台之一的 GPU 训练实践(阿里云/火山/腾讯/华为云等):弹性扩缩、竞价/spot、成本可视化、资源配额
    • 强工程习惯:可复现、可观测、版本与发布流程清晰。


    Job 2 | CUDA Kernel & Acceleration 工程师(Attention / MoE / Ops)

    岗位概述:

    你将为科学大模型打造“发动机”。我们需要把 CUDA 内核、算子与性能工程直接注入训练/推理/对齐系统,让新结构(attention 变体、MoE、稀疏/混合精度等)在真实工作负载上获得稳定的吞吐收益与成本下降。

    你将负责:

    • 编写、集成并优化 CUDA kernels/算子:attention、MoE、dispatch-combine、融合算子等;
    • 将内核接入训练与推理框架:训练(Megatron/TorchTitan/DeepSpeed 等),推理(vLLM/SGLang 类);
    • 性能工程:混合精度、稀疏、算子融合、显存/带宽优化、profiling 与性能回归测试;
    • 与研究团队共创:确保“理论收益”变成“端到端训练/推理收益”,并在多版本迭代中保持稳定;
    • (可选)在合规与IP边界内贡献到开源 AI stack / 技术报告/论文发表,建立影响力;

    我们希望你具备:

    • 强 CUDA/性能工程能力:能独立写 kernel,熟悉 Nsight 等 profiling 工具与优化方法论;
    • 熟悉 attention/MoE/通信等典型瓶颈,理解吞吐、显存与带宽的权衡;
    • 熟悉 Triton/CUTLASS/自定义算子接入(任一即可),并能在真实训练场景验证收益;
    • 具备工程化意识:性能回归、版本兼容、可复现基准与自动化测试。


    Job 3 | ML Infra & Ops 工程师(Cloud GPU, Scheduling, CI/CD, Security)

    岗位概述:

    你将把云上 GPU 变成“像水电一样可靠”的科研基础设施。前期我们以国内 GPU 云租用为主,你的任务是建设可扩展、可观测、可自助、成本可控的基础设施与 MLOps 体系,让研究者专注算法与模型,不被环境、调度、权限与故障拖慢。

    你将负责:

    • 云上算力底座:GPU/CPU 资源编排、作业调度、配额与成本治理、生命周期自动化(扩缩/回收);
    • 集群与工作负载运维:镜像与环境管理、作业模板、数据/存储/网络基础能力、故障恢复;
    • CI/CD & GitOps:构建/测试/部署流水线、制品库、灰度发布与回滚(GitHub CI/GitLab CI/ArgoCD 等任一);
    • 可观测与SRE:监控告警、日志、追踪、容量规划、故障演练与SLA;
    • 安全与合规:权限与审计、密钥管理、网络隔离,与公司 IT/安全团队协同;

    我们希望你具备:

    • 国内云平台经验:阿里云/火山引擎/腾讯云/华为云(任一),理解 GPU 计算、网络、存储与权限模型;
    • 编排与调度:k8s 和/或 slurm(任一做深,二者都懂更佳);
    • 自动化与IaC:terraform/ansible(任一)或同类能力;
    • 可观测:Prometheus/Grafana/DataDog/VictoriaMetrics 等(任一);
    • 具备“运维产品化”思维:稳定、易用、可自助、成本可控、可持续迭代;
    • 加分项:AWS/GCP/Azure 或跨云迁移经验;


    加分项(通用):

    • 有 1,000+ GPU 规模训练/推理支持经验(或同等复杂度系统经验);
    • 熟悉多维并行(TP/PP/DP/CP/EP)与 MoE 训练优化;
    • 有开源贡献:训练框架/推理框架/性能工具/算子库等;
    • 有高质量技术写作能力(技术报告/论文/专利均可)。

    二维码微信扫一扫,及时了解投递状态
    头像您已有可投递的在线简历:点击投递
    简历完成度50%,完善简历才能找到好工作:完善简历

    公司介绍

    企业尚未更新

    工作地点

    地址上海市

    查看地图

    看了此职位的人还会看
    查看更多相似的职位 >>

    公司信息 给我留言

    推荐职位 相关公司推荐

    • 头像

      自由鸟健身工作室

      热招1个职位
      查看
    • 头像

      上海龙攀网络科技有限公司

      热招3个职位
      查看
    • 头像

      上海若济生物医药科技有限公司

      热招1个职位
      查看
    • 头像

      浚汰集团

      热招1个职位
      查看
    • 头像

      凯莫(上海)教育科技有限公司

      热招2个职位
      查看
    二维码

    扫描二维码及时订阅职位

    最新职位信息第一时间知晓

    上海兼职招聘

    • 扫码下载APP

      上海招聘网APP
    • 扫码进小程序

      上海招聘网小程序

    服务信息

    联系电话: 13916151478 杨老师

    服务时间:08:00-18:00

    上海人才招聘 | 上海招聘网 | 上海找工作 | 上海招聘 | 上海人才招聘网

    Copyright 2012-2022 上海招聘网 All Rights Reserved

    详细地址:江西省南昌市青山湖区高新大道万象汇9号楼7楼

    版权所有:江西易职邦网络科技有限公司

    ICP证:赣ICP备2021008707号-3 赣公网安备 36010202000584号

    技术支持:南昌传爱网络科技有限公司

    关注公众号

    服务时间08:00-24:00

    微信公众号

    微信公众号

    招聘交流群

    招聘交流群

    微信小程序

    微信小程序

    微信扫一扫

    面试通知

    收藏

    简历

    足迹

    微信求职

    关注公众号

    掌握最新求职动态

    微信公众号

    小程序

    进入小程序

    随时随地找工作

    小程序