欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
工作职责: 1. Omni VLM 基础模型研发- 负责面向视频理解的 Omni VLM / 多模态理解基础模型研发。- 参与模型架构、数据体系、训练方法和评测体系建设。- 开展大规模图像、视频、音频和文本数据上的 VLM 预训练。- 开展多模态 SFT、偏好对齐、强化学习、复杂推理等后训练工作。- 提升模型在长视频理解、时序推理、细粒度感知和多模态交互等方面的能力。2. Captioner- 建设高质量视频 Caption 和结构化语义理解能力。- 提升模型对人物、场景、动作、事件、镜头、风格、音频和叙事等信息的理解。- 为视频生成基模提供高质量训练数据和语义条件。3. Prompt Enhance(PE)- 研发面向视频生成的 Prompt Enhance 模型与策略。- 将用户简短或模糊的意图转化为准确、丰富且适合视频生成的提示词。- 提升生成结果的语义一致性、视觉表现和可控性。4. Reward Model 与评估- 建设面向视频生成的 Reward Model 和自动化评测体系。- 评估文本—视频对齐、画面质量、运动质量、时序一致性、物理合理性和审美表现。- 为视频生成基模的训练、偏好对齐和效果优化提供反馈信号。5. Agent 创作链路- 研发基于 Omni VLM 的视频创作 Agent。- 建设意图理解、任务规划、Prompt Enhance、素材理解、工具调用和结果评估等能力。- 探索视频的多轮生成、局部修改和自动迭代优化。 工作要求: 1. 计算机、人工智能、自动化、数学或相关专业硕士及以上学历。 2. 具备扎实的机器学习、深度学习和 Transformer 基础,熟练使用 PyTorch 等主流框架。 3. 熟悉多模态基础模型,对视觉编码、跨模态对齐、时序建模和语言建模有深入理解。 4. 具有以下至少一个方向的研发经验: - Omni Model、VLM 或多模态理解基础模型; - VLM / LLM 预训练或后训练; - 视频理解、视频 Caption 或视频推理; - Reward Model、偏好对齐或强化学习; - 视频生成或图像生成基础模型; - 多模态 Agent、工具调用或任务规划。 5. 熟悉基础模型的数据构建、分布式训练、推理优化和模型评估流程。 6. 具备良好的工程能力、自驱力和协作能力,能够独立推进算法研发与实验迭代。加分项- 参与过大规模 VLM / LLM 的预训练或后训练。- 具有多模态 SFT、RLHF、DPO、GRPO、RLAIF 或 Reward Model 经验。- 具有视频生成、Diffusion 或 Flow Matching 相关经验。- 具有长视频理解、音视频联合建模或多模态推理经验。- 具有视频创作 Agent、多轮生成或工具调用系统经验。- 在相关顶级会议或期刊发表过论文,或有高质量开源项目。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录工作职责: 1. Omni VLM 基础模型研发- 负责面向视频理解的 Omni VLM / 多模态理解基础模型研发。- 参与模型架构、数据体系、训练方法和评测体系建设。- 开展大规模图像、视频、音频和文本数据上的 VLM 预训练。- 开展多模态 SFT、偏好对齐、强化学习、复杂推理等后训练工作。- 提升模型在长视频理解、时序推理、细粒度感知和多模态交互等方面的能力。2. Captioner- 建设高质量视频 Caption 和结构化语义理解能力。- 提升模型对人物、场景、动作、事件、镜头、风格、音频和叙事等信息的理解。- 为视频生成基模提供高质量训练数据和语义条件。3. Prompt Enhance(PE)- 研发面向视频生成的 Prompt Enhance 模型与策略。- 将用户简短或模糊的意图转化为准确、丰富且适合视频生成的提示词。- 提升生成结果的语义一致性、视觉表现和可控性。4. Reward Model 与评估- 建设面向视频生成的 Reward Model 和自动化评测体系。- 评估文本—视频对齐、画面质量、运动质量、时序一致性、物理合理性和审美表现。- 为视频生成基模的训练、偏好对齐和效果优化提供反馈信号。5. Agent 创作链路- 研发基于 Omni VLM 的视频创作 Agent。- 建设意图理解、任务规划、Prompt Enhance、素材理解、工具调用和结果评估等能力。- 探索视频的多轮生成、局部修改和自动迭代优化。 工作要求: 1. 计算机、人工智能、自动化、数学或相关专业硕士及以上学历。 2. 具备扎实的机器学习、深度学习和 Transformer 基础,熟练使用 PyTorch 等主流框架。 3. 熟悉多模态基础模型,对视觉编码、跨模态对齐、时序建模和语言建模有深入理解。 4. 具有以下至少一个方向的研发经验: - Omni Model、VLM 或多模态理解基础模型; - VLM / LLM 预训练或后训练; - 视频理解、视频 Caption 或视频推理; - Reward Model、偏好对齐或强化学习; - 视频生成或图像生成基础模型; - 多模态 Agent、工具调用或任务规划。 5. 熟悉基础模型的数据构建、分布式训练、推理优化和模型评估流程。 6. 具备良好的工程能力、自驱力和协作能力,能够独立推进算法研发与实验迭代。加分项- 参与过大规模 VLM / LLM 的预训练或后训练。- 具有多模态 SFT、RLHF、DPO、GRPO、RLAIF 或 Reward Model 经验。- 具有视频生成、Diffusion 或 Flow Matching 相关经验。- 具有长视频理解、音视频联合建模或多模态推理经验。- 具有视频创作 Agent、多轮生成或工具调用系统经验。- 在相关顶级会议或期刊发表过论文,或有高质量开源项目。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作