欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
课题背景:随着多模态大模型的快速发展,视频理解已成为模型感知与推理能力的核心赛道。然而,当前主流模型在视频理解领域仍面临显著瓶颈:音频与视频模态缺乏深度融合、对复杂时序事件的动态感知能力不足,以及长视频场景下 Encoder 计算效率极低。与此同时,以视频为输入的 GUI Agent 作为新兴应用方向,对视频的时序理解与跨帧感知提出了更高要求。本课题聚焦上述核心问题,旨在构建面向真实复杂场景的高效、强感知视频理解大模型,推动模型从"看懂图片"向"真正理解并操控视频世界"跨越。课题挑战:1. 音视频深度融合与跨模态交互: 如何设计统一的音视频联合建模架构,使模型能够精准捕捉语音内容、音频事件与视觉场景之间的语义对应与互补关系,而非各模态独立编码后简单拼接;2. 细粒度时序事件感知: 视频中事件往往具有精确的时间边界与因果关联,如何使模型具备对短时动作、跨镜头事件演化、时间戳定位的高精度感知能力,是当前视频理解的核心难题;3. 高效视频原生 Encoder 设计: 标准 ViT 在处理长视频时面临 Token 数量爆炸问题,如何设计原生支持视频输入的 Encoder 架构(如线性注意力、稀疏采样、时空因式分解等),在不显著损失语义信息的前提下大幅压缩计算开销,是实现实用化长视频理解的关键工程挑战;4. 视频 GUI Agent 的时序决策与界面感知: 以视频流为输入的 GUI Agent 需要实时理解界面状态变化、跨帧追踪操作轨迹,并基于历史交互序列做出精准的下一步动作预测;如何将视频理解能力与 Agent 决策链路深度耦合,实现从"理解屏幕视频"到"自主完成复杂操作任务"的端到端闭环,是本方向的核心挑战。具体工作:你将参与音视频融合 Encoder 架构设计、长视频高效建模与时序感知算法研究、视频 GUI Agent 框架与评估系统建设、视频理解指令数据构建等工作,推动大模型在视频理解与智能体方向的能力突破。1、计算机科学、人工智能、信号处理、模式识别、电子工程等相关专业的博士及优秀硕士;具有视频理解、多模态学习或音视频处理方向研究背景者优先;2、深入理解视频/多模态理解前沿进展,熟悉 ViT、Video Transformer、Audio Encoder(如 Wav2Vec、Whisper)等技术路径;精通 PyTorch,熟悉分布式训练框架(如 DeepSpeed、Megatron-LM);在 CVPR、ICLR、NeurIPS、ACM MM 等顶会有相关成果者优先;熟悉 CUDA 编程或高性能算子优化者更佳;3、对视频理解技术有强烈的研究热情与探索欲;具备较强的工程落地能力和问题抽象能力;沟通协作能力强,能在大规模团队协作中高效推进课题;具备面对复杂系统问题的韧性与独立解决问题的能力。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录课题背景:随着多模态大模型的快速发展,视频理解已成为模型感知与推理能力的核心赛道。然而,当前主流模型在视频理解领域仍面临显著瓶颈:音频与视频模态缺乏深度融合、对复杂时序事件的动态感知能力不足,以及长视频场景下 Encoder 计算效率极低。与此同时,以视频为输入的 GUI Agent 作为新兴应用方向,对视频的时序理解与跨帧感知提出了更高要求。本课题聚焦上述核心问题,旨在构建面向真实复杂场景的高效、强感知视频理解大模型,推动模型从"看懂图片"向"真正理解并操控视频世界"跨越。课题挑战:1. 音视频深度融合与跨模态交互: 如何设计统一的音视频联合建模架构,使模型能够精准捕捉语音内容、音频事件与视觉场景之间的语义对应与互补关系,而非各模态独立编码后简单拼接;2. 细粒度时序事件感知: 视频中事件往往具有精确的时间边界与因果关联,如何使模型具备对短时动作、跨镜头事件演化、时间戳定位的高精度感知能力,是当前视频理解的核心难题;3. 高效视频原生 Encoder 设计: 标准 ViT 在处理长视频时面临 Token 数量爆炸问题,如何设计原生支持视频输入的 Encoder 架构(如线性注意力、稀疏采样、时空因式分解等),在不显著损失语义信息的前提下大幅压缩计算开销,是实现实用化长视频理解的关键工程挑战;4. 视频 GUI Agent 的时序决策与界面感知: 以视频流为输入的 GUI Agent 需要实时理解界面状态变化、跨帧追踪操作轨迹,并基于历史交互序列做出精准的下一步动作预测;如何将视频理解能力与 Agent 决策链路深度耦合,实现从"理解屏幕视频"到"自主完成复杂操作任务"的端到端闭环,是本方向的核心挑战。具体工作:你将参与音视频融合 Encoder 架构设计、长视频高效建模与时序感知算法研究、视频 GUI Agent 框架与评估系统建设、视频理解指令数据构建等工作,推动大模型在视频理解与智能体方向的能力突破。1、计算机科学、人工智能、信号处理、模式识别、电子工程等相关专业的博士及优秀硕士;具有视频理解、多模态学习或音视频处理方向研究背景者优先;2、深入理解视频/多模态理解前沿进展,熟悉 ViT、Video Transformer、Audio Encoder(如 Wav2Vec、Whisper)等技术路径;精通 PyTorch,熟悉分布式训练框架(如 DeepSpeed、Megatron-LM);在 CVPR、ICLR、NeurIPS、ACM MM 等顶会有相关成果者优先;熟悉 CUDA 编程或高性能算子优化者更佳;3、对视频理解技术有强烈的研究热情与探索欲;具备较强的工程落地能力和问题抽象能力;沟通协作能力强,能在大规模团队协作中高效推进课题;具备面对复杂系统问题的韧性与独立解决问题的能力。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作