欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
1. 计算机、机器学习、人工智能、自然语言处理等相关专业,硕士及以上学历。2. 具有 RLHF / Reward Modeling / 偏好对齐方向的实践经验,熟悉 PPO、DPO、GRPO 等主流算法的原理与工程实现。3. 精通 Python 及 PyTorch 等深度学习框架,具备扎实的工程能力,能够独立完成从数据处理、模型训练到评测部署的全链路工作。4. 对数据质量高度敏感,具备优秀的数据分析与问题诊断能力,能够从复杂反馈信号中提炼有效的优化方向。加分项1. 熟悉主流 RL 训练框架(如 veRL )及大规模分布式训练方案(DeepSpeed、Megatron-LM、FSDP)。2. 在 Reward Model 泛化性、Reward Hacking 缓解、偏好数据合成等方向有深入研究或实际落地经验。3. 曾在 NeurIPS、ICLR、ICML、ACL 等顶级会议发表对齐、强化学习或 NLP 相关论文,具有一定学术影响力。4. 拥有知名开源项目贡献经历,在开源社区具有较好的影响力。5. 具备线上系统用户反馈分析经验,熟悉 A/B 测试、用户行为建模等方法论。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录1. 计算机、机器学习、人工智能、自然语言处理等相关专业,硕士及以上学历。2. 具有 RLHF / Reward Modeling / 偏好对齐方向的实践经验,熟悉 PPO、DPO、GRPO 等主流算法的原理与工程实现。3. 精通 Python 及 PyTorch 等深度学习框架,具备扎实的工程能力,能够独立完成从数据处理、模型训练到评测部署的全链路工作。4. 对数据质量高度敏感,具备优秀的数据分析与问题诊断能力,能够从复杂反馈信号中提炼有效的优化方向。加分项1. 熟悉主流 RL 训练框架(如 veRL )及大规模分布式训练方案(DeepSpeed、Megatron-LM、FSDP)。2. 在 Reward Model 泛化性、Reward Hacking 缓解、偏好数据合成等方向有深入研究或实际落地经验。3. 曾在 NeurIPS、ICLR、ICML、ACL 等顶级会议发表对齐、强化学习或 NLP 相关论文,具有一定学术影响力。4. 拥有知名开源项目贡献经历,在开源社区具有较好的影响力。5. 具备线上系统用户反馈分析经验,熟悉 A/B 测试、用户行为建模等方法论。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作