欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
岗位职责: 团队介绍 我们是Shopee 的智能客服机器人团队,面向多语言、多业务场景构建新一代智能客服系统,服务广大消费者与商家。团队专注于将大语言模型(LLM)、智能体(Agent)、强化学习(RL)等前沿应用于真实客服场景,通过Post-Training、Agentic RL、Harness、Loop Engineering 持续提升模型的理解、决策、规划与执行能力。 我们已经基于 AI Agent 架构落地了全新的智能客服系统,希望进一步借助 Harness 和 Loop Engineering,对齐人类能力,推动系统从“回答问题的 Chatbot”演进为“能够理解场景、规划与执行方案并自我进化的智能客服 Agent”,达到并且超越人工客服的水平。 欢迎具备扎实研究背景、愿意在真实业务中打磨方法与系统的你加入。 岗位职责 一、围绕 AI Agent 架构与 Harness / Loop Engineering / Post-Training / Agentic RL 方向,参与或主导如下工作: 1. AI Agent 架构与 Harness(智能体架构与运行框架) 设计与迭代 AI Agent 架构(Planning / Tool Use / Memory / 多 Agent 协同等),建设工具集、上下文工程、SOP / 知识接入等 Harness,让基座模型的能力在客服场景中充分利用; 2. 推动 Agent 系统提效,通过模型分层、并行调度、上下文压缩与缓存复用等手段,降低端到端时延与推理成本。 二、Loop Engineering(数据与训练自进化闭环) 1. 建设“线上真实反馈(CSAT、转人工、人工改写等)→ 自动评估 → 训练数据生产 → Post-Training / RL → 灰度验证”的自进化闭环,让系统随真实流量持续变强; 2. 以“达到并超越人工客服”为目标,搭建自动化评估与 LLM-as-a-Judge 体系,从离线指标与业务指标共同衡量效果。 三、Post-Training 与 Agentic RL 1. 设计面向客服场景的 SFT / DPO / GRPO / PPO 等后训练策略,基于显式与隐式反馈(用户评分、CSAT、转人工、人工改写等)构造偏好与 Reward 信号; 2. 围绕 Agent 关键决策环节(动作选择、Tool 调用、澄清 / 追问策略等),设计 Agentic RL 目标与训练方法,探索 RLHF / RLAIF 在对话策略中的应用; 四、前沿实践 持续跟进 Post-Training、RL、Agent、Harness / Loop Engineering 等方向的最新研究进展并推动在业务中落地。 任职要求: 1. 计算机科学、人工智能相关专业硕士及以上学历,应届或具有 1–3 年研究 / 工程经验均可; 2. 扎实的计算机与数学基础,良好的算法与数据结构能力; 3. 系统掌握机器学习与深度学习基础理论,对 Transformer 与 LLM 架构有较深入理解; 4. 至少在以下方向中 1–2 个方向具备较深研究或项目经历: -Post-Training(SFT / DPO / GRPO 等); -强化学习 / Agentic RL; -Agent 方向(Planning / Reasoning / Tool Use / Memory / Multi-Agent 等); -Harness / Loop Engineering(Agent 运行框架、自动评估与数据自进化闭环); 5. 熟练掌握 Python,熟悉 PyTorch / TensorFlow 等主流深度学习框架; 6. 具备良好的英文论文阅读与技术沟通能力; 7. 对 研究 + 工程 + 业务 的交叉问题有兴趣,愿意在真实场景中验证和打磨方法。 加分项(优先考虑) 1. 具备国内外一线 AI 团队(OpenAI、Google DeepMind、Anthropic、Meta、字节 Seed、阿里通义、腾讯混元、百度文心等)Agent 或大模型项目经验; 2. 有 AI Agent 系统设计与规模化落地经验,或有 Agent 推理提效(模型蒸馏、模型路由、并行调度、上下文工程等)实践经验; 3. 在 NLP、LLM、RL、Agent 等相关方向于顶会 / 顶刊(如 ACL、EMNLP、NeurIPS、ICLR、ICML 等)有论文产出,或有完整的研究工作; 4. 有实际参与 LLM Post-Training / 强化学习(含 Agentic RL)项目的经验; 5. 有在对话 / 客服 / Agent 场景中开展 RLHF / Agentic RL 的实践经历; 6. 熟悉分布式训练与大模型优化(如 DeepSpeed、FSDP、Megatron 等)。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录岗位职责: 团队介绍 我们是Shopee 的智能客服机器人团队,面向多语言、多业务场景构建新一代智能客服系统,服务广大消费者与商家。团队专注于将大语言模型(LLM)、智能体(Agent)、强化学习(RL)等前沿应用于真实客服场景,通过Post-Training、Agentic RL、Harness、Loop Engineering 持续提升模型的理解、决策、规划与执行能力。 我们已经基于 AI Agent 架构落地了全新的智能客服系统,希望进一步借助 Harness 和 Loop Engineering,对齐人类能力,推动系统从“回答问题的 Chatbot”演进为“能够理解场景、规划与执行方案并自我进化的智能客服 Agent”,达到并且超越人工客服的水平。 欢迎具备扎实研究背景、愿意在真实业务中打磨方法与系统的你加入。 岗位职责 一、围绕 AI Agent 架构与 Harness / Loop Engineering / Post-Training / Agentic RL 方向,参与或主导如下工作: 1. AI Agent 架构与 Harness(智能体架构与运行框架) 设计与迭代 AI Agent 架构(Planning / Tool Use / Memory / 多 Agent 协同等),建设工具集、上下文工程、SOP / 知识接入等 Harness,让基座模型的能力在客服场景中充分利用; 2. 推动 Agent 系统提效,通过模型分层、并行调度、上下文压缩与缓存复用等手段,降低端到端时延与推理成本。 二、Loop Engineering(数据与训练自进化闭环) 1. 建设“线上真实反馈(CSAT、转人工、人工改写等)→ 自动评估 → 训练数据生产 → Post-Training / RL → 灰度验证”的自进化闭环,让系统随真实流量持续变强; 2. 以“达到并超越人工客服”为目标,搭建自动化评估与 LLM-as-a-Judge 体系,从离线指标与业务指标共同衡量效果。 三、Post-Training 与 Agentic RL 1. 设计面向客服场景的 SFT / DPO / GRPO / PPO 等后训练策略,基于显式与隐式反馈(用户评分、CSAT、转人工、人工改写等)构造偏好与 Reward 信号; 2. 围绕 Agent 关键决策环节(动作选择、Tool 调用、澄清 / 追问策略等),设计 Agentic RL 目标与训练方法,探索 RLHF / RLAIF 在对话策略中的应用; 四、前沿实践 持续跟进 Post-Training、RL、Agent、Harness / Loop Engineering 等方向的最新研究进展并推动在业务中落地。 任职要求: 1. 计算机科学、人工智能相关专业硕士及以上学历,应届或具有 1–3 年研究 / 工程经验均可; 2. 扎实的计算机与数学基础,良好的算法与数据结构能力; 3. 系统掌握机器学习与深度学习基础理论,对 Transformer 与 LLM 架构有较深入理解; 4. 至少在以下方向中 1–2 个方向具备较深研究或项目经历: -Post-Training(SFT / DPO / GRPO 等); -强化学习 / Agentic RL; -Agent 方向(Planning / Reasoning / Tool Use / Memory / Multi-Agent 等); -Harness / Loop Engineering(Agent 运行框架、自动评估与数据自进化闭环); 5. 熟练掌握 Python,熟悉 PyTorch / TensorFlow 等主流深度学习框架; 6. 具备良好的英文论文阅读与技术沟通能力; 7. 对 研究 + 工程 + 业务 的交叉问题有兴趣,愿意在真实场景中验证和打磨方法。 加分项(优先考虑) 1. 具备国内外一线 AI 团队(OpenAI、Google DeepMind、Anthropic、Meta、字节 Seed、阿里通义、腾讯混元、百度文心等)Agent 或大模型项目经验; 2. 有 AI Agent 系统设计与规模化落地经验,或有 Agent 推理提效(模型蒸馏、模型路由、并行调度、上下文工程等)实践经验; 3. 在 NLP、LLM、RL、Agent 等相关方向于顶会 / 顶刊(如 ACL、EMNLP、NeurIPS、ICLR、ICML 等)有论文产出,或有完整的研究工作; 4. 有实际参与 LLM Post-Training / 强化学习(含 Agentic RL)项目的经验; 5. 有在对话 / 客服 / Agent 场景中开展 RLHF / Agentic RL 的实践经历; 6. 熟悉分布式训练与大模型优化(如 DeepSpeed、FSDP、Megatron 等)。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作