欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!

网站地图
上海招聘网

上海站[切换城市]
  • 职位
    • 公司
    • 职位
  • 上海招聘网 www.shrszp.net 提示:

    确认
    上海招聘网 上海招聘网 > 招聘列表 > 招聘详情 >

    优图实验室-视频全模态理解基础技术研究

    优图实验室-视频全模态理解基础技术研究

    职位月薪:面议

    优图实验室-视频全模态理解基础技术研究

    职位月薪: 面议

    • 岗位类别:
    • 招聘类型: 校园
    • 工作经验: 应届生
    • 工作地点: 上海市
    • 学历要求: 硕士研究生
    • 招聘人数: 1人
      福利待遇:
    • 五险一金
    • 优质平台
    • 法定节假日休息
    • 年终奖

    收藏 收藏 小程序 小程序 岗位分享 微信分享

    聊一聊 和TA聊一聊  投递简历 投个简历

    联系方式

    联系人:深圳市腾讯计算机系统有限公司

    联系电话:152****5633

    点击查看
    打电话联系前先投递一份简历,面试成功率提高60%!

    (联系我时,请说是在上海易职邦上看到的)

    职位描述

    课题背景:随着多模态大模型的快速发展,视频理解已成为模型感知与推理能力的核心赛道。然而,当前主流模型在视频理解领域仍面临显著瓶颈:音频与视频模态缺乏深度融合、对复杂时序事件的动态感知能力不足,以及长视频场景下 Encoder 计算效率极低。与此同时,以视频为输入的 GUI Agent 作为新兴应用方向,对视频的时序理解与跨帧感知提出了更高要求。本课题聚焦上述核心问题,旨在构建面向真实复杂场景的高效、强感知视频理解大模型,推动模型从"看懂图片"向"真正理解并操控视频世界"跨越。课题挑战:1. 音视频深度融合与跨模态交互: 如何设计统一的音视频联合建模架构,使模型能够精准捕捉语音内容、音频事件与视觉场景之间的语义对应与互补关系,而非各模态独立编码后简单拼接;2. 细粒度时序事件感知: 视频中事件往往具有精确的时间边界与因果关联,如何使模型具备对短时动作、跨镜头事件演化、时间戳定位的高精度感知能力,是当前视频理解的核心难题;3. 高效视频原生 Encoder 设计: 标准 ViT 在处理长视频时面临 Token 数量爆炸问题,如何设计原生支持视频输入的 Encoder 架构(如线性注意力、稀疏采样、时空因式分解等),在不显著损失语义信息的前提下大幅压缩计算开销,是实现实用化长视频理解的关键工程挑战;4. 视频 GUI Agent 的时序决策与界面感知: 以视频流为输入的 GUI Agent 需要实时理解界面状态变化、跨帧追踪操作轨迹,并基于历史交互序列做出精准的下一步动作预测;如何将视频理解能力与 Agent 决策链路深度耦合,实现从"理解屏幕视频"到"自主完成复杂操作任务"的端到端闭环,是本方向的核心挑战。具体工作:你将参与音视频融合 Encoder 架构设计、长视频高效建模与时序感知算法研究、视频 GUI Agent 框架与评估系统建设、视频理解指令数据构建等工作,推动大模型在视频理解与智能体方向的能力突破。1、计算机科学、人工智能、信号处理、模式识别、电子工程等相关专业的博士及优秀硕士;具有视频理解、多模态学习或音视频处理方向研究背景者优先;2、深入理解视频/多模态理解前沿进展,熟悉 ViT、Video Transformer、Audio Encoder(如 Wav2Vec、Whisper)等技术路径;精通 PyTorch,熟悉分布式训练框架(如 DeepSpeed、Megatron-LM);在 CVPR、ICLR、NeurIPS、ACM MM 等顶会有相关成果者优先;熟悉 CUDA 编程或高性能算子优化者更佳;3、对视频理解技术有强烈的研究热情与探索欲;具备较强的工程落地能力和问题抽象能力;沟通协作能力强,能在大规模团队协作中高效推进课题;具备面对复杂系统问题的韧性与独立解决问题的能力。

    二维码微信扫一扫,及时了解投递状态
    头像您目前还没有登录:立即登录

    课题背景:随着多模态大模型的快速发展,视频理解已成为模型感知与推理能力的核心赛道。然而,当前主流模型在视频理解领域仍面临显著瓶颈:音频与视频模态缺乏深度融合、对复杂时序事件的动态感知能力不足,以及长视频场景下 Encoder 计算效率极低。与此同时,以视频为输入的 GUI Agent 作为新兴应用方向,对视频的时序理解与跨帧感知提出了更高要求。本课题聚焦上述核心问题,旨在构建面向真实复杂场景的高效、强感知视频理解大模型,推动模型从"看懂图片"向"真正理解并操控视频世界"跨越。课题挑战:1. 音视频深度融合与跨模态交互: 如何设计统一的音视频联合建模架构,使模型能够精准捕捉语音内容、音频事件与视觉场景之间的语义对应与互补关系,而非各模态独立编码后简单拼接;2. 细粒度时序事件感知: 视频中事件往往具有精确的时间边界与因果关联,如何使模型具备对短时动作、跨镜头事件演化、时间戳定位的高精度感知能力,是当前视频理解的核心难题;3. 高效视频原生 Encoder 设计: 标准 ViT 在处理长视频时面临 Token 数量爆炸问题,如何设计原生支持视频输入的 Encoder 架构(如线性注意力、稀疏采样、时空因式分解等),在不显著损失语义信息的前提下大幅压缩计算开销,是实现实用化长视频理解的关键工程挑战;4. 视频 GUI Agent 的时序决策与界面感知: 以视频流为输入的 GUI Agent 需要实时理解界面状态变化、跨帧追踪操作轨迹,并基于历史交互序列做出精准的下一步动作预测;如何将视频理解能力与 Agent 决策链路深度耦合,实现从"理解屏幕视频"到"自主完成复杂操作任务"的端到端闭环,是本方向的核心挑战。具体工作:你将参与音视频融合 Encoder 架构设计、长视频高效建模与时序感知算法研究、视频 GUI Agent 框架与评估系统建设、视频理解指令数据构建等工作,推动大模型在视频理解与智能体方向的能力突破。1、计算机科学、人工智能、信号处理、模式识别、电子工程等相关专业的博士及优秀硕士;具有视频理解、多模态学习或音视频处理方向研究背景者优先;2、深入理解视频/多模态理解前沿进展,熟悉 ViT、Video Transformer、Audio Encoder(如 Wav2Vec、Whisper)等技术路径;精通 PyTorch,熟悉分布式训练框架(如 DeepSpeed、Megatron-LM);在 CVPR、ICLR、NeurIPS、ACM MM 等顶会有相关成果者优先;熟悉 CUDA 编程或高性能算子优化者更佳;3、对视频理解技术有强烈的研究热情与探索欲;具备较强的工程落地能力和问题抽象能力;沟通协作能力强,能在大规模团队协作中高效推进课题;具备面对复杂系统问题的韧性与独立解决问题的能力。

    二维码微信扫一扫,及时了解投递状态
    头像您已有可投递的在线简历:点击投递
    简历完成度50%,完善简历才能找到好工作:完善简历

    公司介绍

    企业尚未更新

    工作地点

    地址上海市

    查看地图

    看了此职位的人还会看
    查看更多相似的职位 >>

    公司信息 给我留言

    推荐职位 相关公司推荐

    • 头像

      浚汰集团

      热招1个职位
      查看
    • 头像

      上海市复旦求是进修学院

      热招6个职位
      查看
    • 头像

      上海砺墨信息咨询有限公司

      热招1个职位
      查看
    • 头像

      考尚教育助你一战“尚”岸

      热招1个职位
      查看
    • 头像

      自由鸟健身工作室

      热招1个职位
      查看
    二维码

    扫描二维码及时订阅职位

    最新职位信息第一时间知晓

    上海兼职招聘

    • 扫码下载APP

      上海招聘网APP
    • 扫码进小程序

      上海招聘网小程序

    服务信息

    联系电话: 13916151478 杨老师

    服务时间:08:00-18:00

    上海人才招聘 | 上海招聘网 | 上海找工作 | 上海招聘 | 上海人才招聘网

    Copyright 2012-2022 上海招聘网 All Rights Reserved

    详细地址:江西省南昌市青山湖区高新大道万象汇9号楼7楼

    版权所有:江西易职邦网络科技有限公司

    ICP证:赣ICP备2021008707号-3 赣公网安备 36010202000584号

    技术支持:南昌传爱网络科技有限公司

    关注公众号

    服务时间08:00-24:00

    微信公众号

    微信公众号

    招聘交流群

    招聘交流群

    微信小程序

    微信小程序

    微信扫一扫

    面试通知

    收藏

    简历

    足迹

    微信求职

    关注公众号

    掌握最新求职动态

    微信公众号

    小程序

    进入小程序

    随时随地找工作

    小程序