欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
岗位职责: 团队介绍做多模态的人通常有两种:一种是把各种模态「拼」在一起,一种是真的想搞清楚不同模态之间的关系,我们是后者。从视觉理解,到视觉+语音联合感知,到生成与理解统一——我们在挑战的不是某一个模态的单点能力,是整个「理解-生成-统一」的链条,挑战每种模态的单一能力上限,挑战多种模态的融合难题,挑战理解和生成能力的融合难题,实现类人的多模态能力。 岗位职责: 参与视觉语言大模型的研发工作,负责下属事项至少一项或若干VIT Pretrain:提升模型感知能力,包括但不限于 Vision Encoder Pretrain 算法架构 / 多种感知能力数据构建VLM Pretrain:提升 vlm pretrain 的通用能力,探索各种不同训练阶段设计 / 不同通用数据的组织形式;VLM Post Train:提升 vlm 通用能力,包括但不限于合成数据 / RL 等方法生成理解统一:探索生成理解统一架构,同时提升理解和生成能力 任职要求: 任职要求本科及以上学历,计算机等相关专业优化;熟练掌握代码的阅读和编写技术,熟练使用 agentic ai 能力;在 python 和 pytroch 技术栈上有过深入实践在视觉领域有过深入的实践和理解,有一定深度的专业认知和见解具备良好的科学研发习惯、问题定义能力和对细节的敏锐度
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录岗位职责: 团队介绍做多模态的人通常有两种:一种是把各种模态「拼」在一起,一种是真的想搞清楚不同模态之间的关系,我们是后者。从视觉理解,到视觉+语音联合感知,到生成与理解统一——我们在挑战的不是某一个模态的单点能力,是整个「理解-生成-统一」的链条,挑战每种模态的单一能力上限,挑战多种模态的融合难题,挑战理解和生成能力的融合难题,实现类人的多模态能力。 岗位职责: 参与视觉语言大模型的研发工作,负责下属事项至少一项或若干VIT Pretrain:提升模型感知能力,包括但不限于 Vision Encoder Pretrain 算法架构 / 多种感知能力数据构建VLM Pretrain:提升 vlm pretrain 的通用能力,探索各种不同训练阶段设计 / 不同通用数据的组织形式;VLM Post Train:提升 vlm 通用能力,包括但不限于合成数据 / RL 等方法生成理解统一:探索生成理解统一架构,同时提升理解和生成能力 任职要求: 任职要求本科及以上学历,计算机等相关专业优化;熟练掌握代码的阅读和编写技术,熟练使用 agentic ai 能力;在 python 和 pytroch 技术栈上有过深入实践在视觉领域有过深入的实践和理解,有一定深度的专业认知和见解具备良好的科学研发习惯、问题定义能力和对细节的敏锐度
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作