岗位职责与要求:
1. 负责维护和开发内部强化学习后训练(Post-training)框架,支持 Reasoning、Agentic 等方向的文本及多模态 RL 训练;
2. 探索算法、框架、硬件的协同设计,提升大规模 RL 训练的稳定性和效率;
3. 解决大模型 RL 中的实际工程痛点,如训推不一致、Rollout 阶段的长尾延迟等问题。
4. 解决Agentic RL中的痛点问题,如Agent trajectory 收集、回放,Agent 长周期任务的上下文压缩与摘要等。1. 扎实的工程算法基础,熟练掌握 PyTorch 及性能调试工具;
2. 深入了解 Megatron、DeepSpeed、SGLang、vLLM 等主流训推引擎;
3. 具备扎实的 RL 算法基础(PPO/DPO/GRPO等)与实际大规模训练经验;
4. 加分项:为 Slime、VeRL、OpenRLHF 等开源框架提交过重要 PR;或在 RL 稳定性、环境工程等方向发表过顶会论文。

微信扫一扫,及时了解投递状态
岗位职责与要求:
1. 负责维护和开发内部强化学习后训练(Post-training)框架,支持 Reasoning、Agentic 等方向的文本及多模态 RL 训练;
2. 探索算法、框架、硬件的协同设计,提升大规模 RL 训练的稳定性和效率;
3. 解决大模型 RL 中的实际工程痛点,如训推不一致、Rollout 阶段的长尾延迟等问题。
4. 解决Agentic RL中的痛点问题,如Agent trajectory 收集、回放,Agent 长周期任务的上下文压缩与摘要等。1. 扎实的工程算法基础,熟练掌握 PyTorch 及性能调试工具;
2. 深入了解 Megatron、DeepSpeed、SGLang、vLLM 等主流训推引擎;
3. 具备扎实的 RL 算法基础(PPO/DPO/GRPO等)与实际大规模训练经验;
4. 加分项:为 Slime、VeRL、OpenRLHF 等开源框架提交过重要 PR;或在 RL 稳定性、环境工程等方向发表过顶会论文。

微信扫一扫,及时了解投递状态
简历完成度50%,完善简历才能找到好工作:
完善简历