ML Infra & MLOps 团队简介:
(Deep Learning Full-Stack|CUDA/加速|Infra & Ops)
我们在研发面向科学推理的新一代 LLM/MLLM 与科学大模型(新记忆系统、新 attention 结构、MoE 等)。要让这些新算法真正长成,需要一支能把云上 GPU 算力变成稳定科研生产力的团队:训练更稳、吞吐更高、推理更快、成本更可控,并让研究者能快速 bring-up、debug、复现、迭代与发布。
前期以GPU 云服务为主,同时为未来混合部署预留可迁移能力。
Job 1 | Deep Learning Full-Stack 工程师(LLM Training & Inference)
岗位概述:
你将把“研究想法”变成“可规模化的训练与推理系统”。你做的不是单点平台,而是贯穿训练、对齐、推理与发布的全栈工程,让前沿实验在云上跑得动、跑得稳、跑得快、跑得省。
你将负责:
- 构建并优化大模型训练系统:作业编排、数据吞吐、checkpoint/恢复、容错、实验追踪与成本控制;
- Bring-up & debug 中途训练与对齐流程:continued pretrain / SFT / 偏好优化 / RL(按项目);
- 构建推理服务链路:高并发、批处理、缓存、路由、灰度发布、回滚与SLA指标体系;
- 与研究团队并肩推进 frontier experiments:把新算法(新 attention/新记忆/MoE 等)快速集成进训练与推理主干,并完成消融与复现;
- -(可选)在合规与IP边界内沉淀通用工具/脚手架与技术报告/开源贡献/论文发表;
我们希望你具备:
- 熟悉分布式训练/推理工程:Megatron-LM / DeepSpeed / FSDP / TorchTitan etc.(任一做深);
- 有系统级优化与故障定位能力:吞吐、显存、通信、checkpoint、失败恢复、稳定性;
- 熟悉国内云平台之一的 GPU 训练实践(阿里云/火山/腾讯/华为云等):弹性扩缩、竞价/spot、成本可视化、资源配额
- 强工程习惯:可复现、可观测、版本与发布流程清晰。
Job 2 | CUDA Kernel & Acceleration 工程师(Attention / MoE / Ops)
岗位概述:
你将为科学大模型打造“发动机”。我们需要把 CUDA 内核、算子与性能工程直接注入训练/推理/对齐系统,让新结构(attention 变体、MoE、稀疏/混合精度等)在真实工作负载上获得稳定的吞吐收益与成本下降。
你将负责:
- 编写、集成并优化 CUDA kernels/算子:attention、MoE、dispatch-combine、融合算子等;
- 将内核接入训练与推理框架:训练(Megatron/TorchTitan/DeepSpeed 等),推理(vLLM/SGLang 类);
- 性能工程:混合精度、稀疏、算子融合、显存/带宽优化、profiling 与性能回归测试;
- 与研究团队共创:确保“理论收益”变成“端到端训练/推理收益”,并在多版本迭代中保持稳定;
- (可选)在合规与IP边界内贡献到开源 AI stack / 技术报告/论文发表,建立影响力;
我们希望你具备:
- 强 CUDA/性能工程能力:能独立写 kernel,熟悉 Nsight 等 profiling 工具与优化方法论;
- 熟悉 attention/MoE/通信等典型瓶颈,理解吞吐、显存与带宽的权衡;
- 熟悉 Triton/CUTLASS/自定义算子接入(任一即可),并能在真实训练场景验证收益;
- 具备工程化意识:性能回归、版本兼容、可复现基准与自动化测试。
Job 3 | ML Infra & Ops 工程师(Cloud GPU, Scheduling, CI/CD, Security)
岗位概述:
你将把云上 GPU 变成“像水电一样可靠”的科研基础设施。前期我们以国内 GPU 云租用为主,你的任务是建设可扩展、可观测、可自助、成本可控的基础设施与 MLOps 体系,让研究者专注算法与模型,不被环境、调度、权限与故障拖慢。
你将负责:
- 云上算力底座:GPU/CPU 资源编排、作业调度、配额与成本治理、生命周期自动化(扩缩/回收);
- 集群与工作负载运维:镜像与环境管理、作业模板、数据/存储/网络基础能力、故障恢复;
- CI/CD & GitOps:构建/测试/部署流水线、制品库、灰度发布与回滚(GitHub CI/GitLab CI/ArgoCD 等任一);
- 可观测与SRE:监控告警、日志、追踪、容量规划、故障演练与SLA;
- 安全与合规:权限与审计、密钥管理、网络隔离,与公司 IT/安全团队协同;
我们希望你具备:
- 国内云平台经验:阿里云/火山引擎/腾讯云/华为云(任一),理解 GPU 计算、网络、存储与权限模型;
- 编排与调度:k8s 和/或 slurm(任一做深,二者都懂更佳);
- 自动化与IaC:terraform/ansible(任一)或同类能力;
- 可观测:Prometheus/Grafana/DataDog/VictoriaMetrics 等(任一);
- 具备“运维产品化”思维:稳定、易用、可自助、成本可控、可持续迭代;
- 加分项:AWS/GCP/Azure 或跨云迁移经验;
加分项(通用):
- 有 1,000+ GPU 规模训练/推理支持经验(或同等复杂度系统经验);
- 熟悉多维并行(TP/PP/DP/CP/EP)与 MoE 训练优化;
- 有开源贡献:训练框架/推理框架/性能工具/算子库等;
- 有高质量技术写作能力(技术报告/论文/专利均可)。

微信扫一扫,及时了解投递状态
ML Infra & MLOps 团队简介:
(Deep Learning Full-Stack|CUDA/加速|Infra & Ops)
我们在研发面向科学推理的新一代 LLM/MLLM 与科学大模型(新记忆系统、新 attention 结构、MoE 等)。要让这些新算法真正长成,需要一支能把云上 GPU 算力变成稳定科研生产力的团队:训练更稳、吞吐更高、推理更快、成本更可控,并让研究者能快速 bring-up、debug、复现、迭代与发布。
前期以GPU 云服务为主,同时为未来混合部署预留可迁移能力。
Job 1 | Deep Learning Full-Stack 工程师(LLM Training & Inference)
岗位概述:
你将把“研究想法”变成“可规模化的训练与推理系统”。你做的不是单点平台,而是贯穿训练、对齐、推理与发布的全栈工程,让前沿实验在云上跑得动、跑得稳、跑得快、跑得省。
你将负责:
- 构建并优化大模型训练系统:作业编排、数据吞吐、checkpoint/恢复、容错、实验追踪与成本控制;
- Bring-up & debug 中途训练与对齐流程:continued pretrain / SFT / 偏好优化 / RL(按项目);
- 构建推理服务链路:高并发、批处理、缓存、路由、灰度发布、回滚与SLA指标体系;
- 与研究团队并肩推进 frontier experiments:把新算法(新 attention/新记忆/MoE 等)快速集成进训练与推理主干,并完成消融与复现;
- -(可选)在合规与IP边界内沉淀通用工具/脚手架与技术报告/开源贡献/论文发表;
我们希望你具备:
- 熟悉分布式训练/推理工程:Megatron-LM / DeepSpeed / FSDP / TorchTitan etc.(任一做深);
- 有系统级优化与故障定位能力:吞吐、显存、通信、checkpoint、失败恢复、稳定性;
- 熟悉国内云平台之一的 GPU 训练实践(阿里云/火山/腾讯/华为云等):弹性扩缩、竞价/spot、成本可视化、资源配额
- 强工程习惯:可复现、可观测、版本与发布流程清晰。
Job 2 | CUDA Kernel & Acceleration 工程师(Attention / MoE / Ops)
岗位概述:
你将为科学大模型打造“发动机”。我们需要把 CUDA 内核、算子与性能工程直接注入训练/推理/对齐系统,让新结构(attention 变体、MoE、稀疏/混合精度等)在真实工作负载上获得稳定的吞吐收益与成本下降。
你将负责:
- 编写、集成并优化 CUDA kernels/算子:attention、MoE、dispatch-combine、融合算子等;
- 将内核接入训练与推理框架:训练(Megatron/TorchTitan/DeepSpeed 等),推理(vLLM/SGLang 类);
- 性能工程:混合精度、稀疏、算子融合、显存/带宽优化、profiling 与性能回归测试;
- 与研究团队共创:确保“理论收益”变成“端到端训练/推理收益”,并在多版本迭代中保持稳定;
- (可选)在合规与IP边界内贡献到开源 AI stack / 技术报告/论文发表,建立影响力;
我们希望你具备:
- 强 CUDA/性能工程能力:能独立写 kernel,熟悉 Nsight 等 profiling 工具与优化方法论;
- 熟悉 attention/MoE/通信等典型瓶颈,理解吞吐、显存与带宽的权衡;
- 熟悉 Triton/CUTLASS/自定义算子接入(任一即可),并能在真实训练场景验证收益;
- 具备工程化意识:性能回归、版本兼容、可复现基准与自动化测试。
Job 3 | ML Infra & Ops 工程师(Cloud GPU, Scheduling, CI/CD, Security)
岗位概述:
你将把云上 GPU 变成“像水电一样可靠”的科研基础设施。前期我们以国内 GPU 云租用为主,你的任务是建设可扩展、可观测、可自助、成本可控的基础设施与 MLOps 体系,让研究者专注算法与模型,不被环境、调度、权限与故障拖慢。
你将负责:
- 云上算力底座:GPU/CPU 资源编排、作业调度、配额与成本治理、生命周期自动化(扩缩/回收);
- 集群与工作负载运维:镜像与环境管理、作业模板、数据/存储/网络基础能力、故障恢复;
- CI/CD & GitOps:构建/测试/部署流水线、制品库、灰度发布与回滚(GitHub CI/GitLab CI/ArgoCD 等任一);
- 可观测与SRE:监控告警、日志、追踪、容量规划、故障演练与SLA;
- 安全与合规:权限与审计、密钥管理、网络隔离,与公司 IT/安全团队协同;
我们希望你具备:
- 国内云平台经验:阿里云/火山引擎/腾讯云/华为云(任一),理解 GPU 计算、网络、存储与权限模型;
- 编排与调度:k8s 和/或 slurm(任一做深,二者都懂更佳);
- 自动化与IaC:terraform/ansible(任一)或同类能力;
- 可观测:Prometheus/Grafana/DataDog/VictoriaMetrics 等(任一);
- 具备“运维产品化”思维:稳定、易用、可自助、成本可控、可持续迭代;
- 加分项:AWS/GCP/Azure 或跨云迁移经验;
加分项(通用):
- 有 1,000+ GPU 规模训练/推理支持经验(或同等复杂度系统经验);
- 熟悉多维并行(TP/PP/DP/CP/EP)与 MoE 训练优化;
- 有开源贡献:训练框架/推理框架/性能工具/算子库等;
- 有高质量技术写作能力(技术报告/论文/专利均可)。

微信扫一扫,及时了解投递状态
简历完成度50%,完善简历才能找到好工作:
完善简历