欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
1. 阅读并整理 VLA、WAM、RL、TTR、TTT、自奖励学习和在线策略优化等方向的前沿论文。 2. 搭建并维护 VLA 模型的训练与评测流程,在 LIBERO、RoboTwin 等机器人仿真基准上完成策略 rollout、轨迹采集、任务评测和结果统计。 3. 实现和验证基于模型内部置信度的轨迹质量评估、伪专家选举、局部专家与全局专家池维护、轨迹相似度计算及动态奖励构造等关键模块。 4. 设计无外部奖励、无成功标签和无额外评估器条件下的自进化实验,分析模型置信度、轨迹质量、任务成功率和策略稳定性之间的关系。 5. 参与具身智能测试时自进化算法的进一步研究,开展跨模型架构、跨任务类型和跨评测基准实验,完成消融分析、失败案例分析和阶段性研究汇报。 1. 硕士研究生。 2. 计算机科学、人工智能、机器人、自动化、控制科学、数学或相关专业优先。 3. 具备机器学习、深度学习和概率统计基础,了解强化学习中的马尔可夫决策过程、策略梯度、价值函数、PPO 等基本方法。 4. 具备良好的 Python 编程能力,能够使用 PyTorch 等深度学习框架,熟悉 Linux、Git 及常用数据处理工具,能够独立运行和调试基础训练代码,能够有效利用 agent 工具。 5. 有 LIBERO、RoboSuite、RoboTwin、ManiSkill、Isaac Sim 等机器人仿真环境使用经历者优先,具备模型训练、infra、真机部署经验者优先。 6. 有强化学习、VLA、TTT、TTR、自监督学习、策略优化或机器人操作相关科研项目、论文和开源项目经历者优先。 7. 能够耐心处理长周期实验、环境配置和模型调试问题,重视实验可复现性,能够阅读英文论文并清晰汇报研究问题、实验设计和阶段性结论。 8. 线上线下结合,实习周期6个月以上,每周预计投入20-30小时。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录1. 阅读并整理 VLA、WAM、RL、TTR、TTT、自奖励学习和在线策略优化等方向的前沿论文。 2. 搭建并维护 VLA 模型的训练与评测流程,在 LIBERO、RoboTwin 等机器人仿真基准上完成策略 rollout、轨迹采集、任务评测和结果统计。 3. 实现和验证基于模型内部置信度的轨迹质量评估、伪专家选举、局部专家与全局专家池维护、轨迹相似度计算及动态奖励构造等关键模块。 4. 设计无外部奖励、无成功标签和无额外评估器条件下的自进化实验,分析模型置信度、轨迹质量、任务成功率和策略稳定性之间的关系。 5. 参与具身智能测试时自进化算法的进一步研究,开展跨模型架构、跨任务类型和跨评测基准实验,完成消融分析、失败案例分析和阶段性研究汇报。 1. 硕士研究生。 2. 计算机科学、人工智能、机器人、自动化、控制科学、数学或相关专业优先。 3. 具备机器学习、深度学习和概率统计基础,了解强化学习中的马尔可夫决策过程、策略梯度、价值函数、PPO 等基本方法。 4. 具备良好的 Python 编程能力,能够使用 PyTorch 等深度学习框架,熟悉 Linux、Git 及常用数据处理工具,能够独立运行和调试基础训练代码,能够有效利用 agent 工具。 5. 有 LIBERO、RoboSuite、RoboTwin、ManiSkill、Isaac Sim 等机器人仿真环境使用经历者优先,具备模型训练、infra、真机部署经验者优先。 6. 有强化学习、VLA、TTT、TTR、自监督学习、策略优化或机器人操作相关科研项目、论文和开源项目经历者优先。 7. 能够耐心处理长周期实验、环境配置和模型调试问题,重视实验可复现性,能够阅读英文论文并清晰汇报研究问题、实验设计和阶段性结论。 8. 线上线下结合,实习周期6个月以上,每周预计投入20-30小时。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作