欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!

网站地图
上海招聘网

上海站[切换城市]
  • 职位
    • 公司
    • 职位
  • 上海招聘网 www.shrszp.net 提示:

    确认
    上海招聘网 上海招聘网 > 招聘列表 > 招聘详情 >

    元宝-面向复杂搜索的自适应深度决策与推理效率优化

    元宝-面向复杂搜索的自适应深度决策与推理效率优化

    职位月薪:面议

    元宝-面向复杂搜索的自适应深度决策与推理效率优化

    职位月薪: 面议

    • 岗位类别:
    • 招聘类型: 全职
    • 工作经验: 10年以上
    • 工作地点: 上海市
    • 学历要求: 本科
    • 招聘人数: 1人
      福利待遇:
    • 五险一金
    • 优质平台
    • 法定节假日休息
    • 年终奖

    收藏 收藏 小程序 小程序 岗位分享 微信分享

    聊一聊 和TA聊一聊  投递简历 投个简历

    联系方式

    联系人:深圳市腾讯计算机系统有限公司

    联系电话:152****5633

    点击查看
    打电话联系前先投递一份简历,面试成功率提高60%!

    (联系我时,请说是在上海易职邦上看到的)

    职位描述

    真实搜索场景中,模型常面临两难困境:简单问题执行多轮搜索造成计算浪费,长尾高难问题却因搜索深度不足导致答案质量欠佳。随着资源放开,更需让模型内生学会“该停则停、该深则深”。本课题计划从信息论视角出发,将每轮搜索视为一次信息获取行为,研究如何让模型根据任务难度与当前信息状态自主决策搜索深度。 核心探索方向包括: 1. 信息增益感知的搜索价值评估——设计可计算的边际信息增益度量方法(如基于模型置信度变化、知识覆盖增量、不确定性缩减等),量化每轮搜索对最终答案的真实贡献,识别“有效搜索”与“无效搜索”的边界; 2. 难度感知的动态预算分配:构建问题难度预判模块,在搜索启动前输出初始难度评分与搜索预算建议,结合信息增益动态调整预算,既防止简单问题过搜,也保障高难问题有充足探索空间; 3. 自适应早停决策机制——在信息增益显著衰减时由模型自主触发停止,并可结合问题难度预判设定差异化搜索预算,防止简单问题过搜,保障高难问题深度探索; 4. 强化学习驱动的策略学习——采用GRPO/PPO等算法进行端到端训练,设计兼顾答案准确率与搜索效率的奖励函数(如信息增益阈值动态惩罚机制),让模型在探索与利用之间习得最优平衡策略,在保证长尾高难问题解决率的前提下最小化整体推理成本。 1. 计算机、人工智能、机器学习、自然语言处理等相关专业,熟悉深度学习及大语言模型基本原理; 2. 熟练使用Python、PyTorch等常用开发与深度学习框架,具备较强的模型训练、实验分析和工程实践能力,能够熟练使用主流AI编程工具开展研发工作; 3. 在SFT、RLHF/RL、Agent、Tool Use等方向具有研究或项目经验者优先,熟悉PPO、GRPO等Post-training方法或具有相关实践经验者优先; 4. 在推理效率优化、自适应计算、Early Exit等方向有相关研究或项目经验者优先,了解信息增益、主动学习等相关方法论; 5. 具备较强的模型行为分析能力,能够从实际问题出发定义可验证指标、设计优化方案,并通过实验持续迭代; 6. 具备较强的论文阅读、独立思考和实验分析能力,持续关注大模型推理优化与Agentic RL前沿研究; 7. 具备良好的沟通协作能力和Owner意识,能够主动推动开放性研究课题取得实质进展,具备高质量论文撰写能力。

    二维码微信扫一扫,及时了解投递状态
    头像您目前还没有登录:立即登录

    真实搜索场景中,模型常面临两难困境:简单问题执行多轮搜索造成计算浪费,长尾高难问题却因搜索深度不足导致答案质量欠佳。随着资源放开,更需让模型内生学会“该停则停、该深则深”。本课题计划从信息论视角出发,将每轮搜索视为一次信息获取行为,研究如何让模型根据任务难度与当前信息状态自主决策搜索深度。 核心探索方向包括: 1. 信息增益感知的搜索价值评估——设计可计算的边际信息增益度量方法(如基于模型置信度变化、知识覆盖增量、不确定性缩减等),量化每轮搜索对最终答案的真实贡献,识别“有效搜索”与“无效搜索”的边界; 2. 难度感知的动态预算分配:构建问题难度预判模块,在搜索启动前输出初始难度评分与搜索预算建议,结合信息增益动态调整预算,既防止简单问题过搜,也保障高难问题有充足探索空间; 3. 自适应早停决策机制——在信息增益显著衰减时由模型自主触发停止,并可结合问题难度预判设定差异化搜索预算,防止简单问题过搜,保障高难问题深度探索; 4. 强化学习驱动的策略学习——采用GRPO/PPO等算法进行端到端训练,设计兼顾答案准确率与搜索效率的奖励函数(如信息增益阈值动态惩罚机制),让模型在探索与利用之间习得最优平衡策略,在保证长尾高难问题解决率的前提下最小化整体推理成本。 1. 计算机、人工智能、机器学习、自然语言处理等相关专业,熟悉深度学习及大语言模型基本原理; 2. 熟练使用Python、PyTorch等常用开发与深度学习框架,具备较强的模型训练、实验分析和工程实践能力,能够熟练使用主流AI编程工具开展研发工作; 3. 在SFT、RLHF/RL、Agent、Tool Use等方向具有研究或项目经验者优先,熟悉PPO、GRPO等Post-training方法或具有相关实践经验者优先; 4. 在推理效率优化、自适应计算、Early Exit等方向有相关研究或项目经验者优先,了解信息增益、主动学习等相关方法论; 5. 具备较强的模型行为分析能力,能够从实际问题出发定义可验证指标、设计优化方案,并通过实验持续迭代; 6. 具备较强的论文阅读、独立思考和实验分析能力,持续关注大模型推理优化与Agentic RL前沿研究; 7. 具备良好的沟通协作能力和Owner意识,能够主动推动开放性研究课题取得实质进展,具备高质量论文撰写能力。

    二维码微信扫一扫,及时了解投递状态
    头像您已有可投递的在线简历:点击投递
    简历完成度50%,完善简历才能找到好工作:完善简历

    公司介绍

    企业尚未更新

    工作地点

    地址上海市

    查看地图

    看了此职位的人还会看
    查看更多相似的职位 >>

    公司信息 公司信息

    头像

    深圳市腾讯计算机系统有限公司

    ecruit_type} 全职

    人力资源服务 人力资源服务

    500-999 500-999人

    广东省,深圳市;北京市;上海市 广东省,深圳市;北京市;上海市

    查看所有职位

    公司信息 给我留言

    推荐职位 相关公司推荐

    • 头像

      凯莫(上海)教育科技有限公司

      热招2个职位
      查看
    • 头像

      上海砺墨信息咨询有限公司

      热招1个职位
      查看
    • 头像

      上海勤博集装箱服务有限公司

      热招2个职位
      查看
    • 头像

      考尚教育助你一战“尚”岸

      热招1个职位
      查看
    • 头像

      上海视妙文化传播有限公司

      热招1个职位
      查看
    二维码

    扫描二维码及时订阅职位

    最新职位信息第一时间知晓

    上海兼职招聘

    • 扫码下载APP

      上海招聘网APP
    • 扫码进小程序

      上海招聘网小程序

    服务信息

    联系电话: 13916151478 杨老师

    服务时间:08:00-18:00

    上海人才招聘 | 上海招聘网 | 上海找工作 | 上海招聘 | 上海人才招聘网

    Copyright 2012-2022 上海招聘网 All Rights Reserved

    详细地址:江西省南昌市青山湖区高新大道万象汇9号楼7楼

    版权所有:江西易职邦网络科技有限公司

    ICP证:赣ICP备2021008707号-3 赣公网安备 36010202000584号

    技术支持:南昌传爱网络科技有限公司

    关注公众号

    服务时间08:00-24:00

    微信公众号

    微信公众号

    招聘交流群

    招聘交流群

    微信小程序

    微信小程序

    微信扫一扫

    面试通知

    收藏

    简历

    足迹

    微信求职

    关注公众号

    掌握最新求职动态

    微信公众号

    小程序

    进入小程序

    随时随地找工作

    小程序