欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
工作职责: 预训练方向: 1. 分析大规模视频、图像及文本数据的内容分布、质量、多样性、冗余度、长尾覆盖和缺失模式。 2. 建设多模态数据理解能力,包括 embedding、检索、聚类、分类、标签体系、Caption 和质量评估。 3. 研究并落地数据清洗、去重、召回、采样、数据配比和课程学习等策略,优化预训练数据组成。 4. 围绕人物、场景、动作、运镜、时序一致性、物理规律和审美等维度,建立视频数据分析与分层方法。 5. 与模型团队共同设计数据消融和对比实验,分析数据规模、质量及分布对模型能力的影响。 6. 持续识别预训练数据中的能力缺口,形成“数据分析—策略设计—训练实验—效果归因”的数据飞轮。 7. 参与大规模数据处理 Pipeline、数据分析平台和可视化工具建设,提高数据研究及生产效率。 后训练方向: 1. 面向视频生成模型的 SFT、偏好优化和强化学习,设计并构建高质量后训练数据。 2. 分析模型在指令遵循、主体一致性、动作生成、复杂运镜、时序稳定性、物理规律和视觉审美等方面的能力短板。 3. 建设细粒度评测和错误分类体系,对模型失败案例进行聚类、归因和优先级判断。 4. 研究难例挖掘、数据筛选、数据合成、拒绝采样、偏好构造和数据配比等策略。 5. 建设视频生成偏好数据,包括 Pairwise Ranking、评分标准、标注规范及质量控制机制。 6. 探索基于多模态模型、Reward Model 和自动评测器的数据生产与筛选方法,提升数据生产效率。 7. 与模型团队共同开展 SFT、DPO、Reward Fine-tuning、RL 等实验,分析不同数据策略对模型能力的影响。 8. 结合离线评测、人工反馈和实际使用反馈,形成“模型评测—数据归因—数据构造—训练验证”的后训练数据飞轮。 工作要求: 1.有视频,图片,音频大规模数据处理经验或相关的预训练,后训练经验。 2. 2028 届及以后本科或研究生在读,计算机、人工智能、数学、统计学等相关专业优先。 3. 熟悉深度学习基础,了解多模态模型、视觉语言模型或视频生成模型的基本原理。 4. 对数据内容及分布敏感,能够从数据现象中发现问题、提出假设并设计实验验证。 5. 熟练使用 Python,掌握 PyTorch,具备良好的数据分析、统计和可视化能力。 6. 了解 embedding、向量检索、聚类、分类、去重或采样等常用算法。 7. 具备较强的研究能力和工程能力,能够独立定义问题并推动落地。 8. 每周可实习 4 天及以上,连续实习 3 个月以上,能长期实习者优先。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录工作职责: 预训练方向: 1. 分析大规模视频、图像及文本数据的内容分布、质量、多样性、冗余度、长尾覆盖和缺失模式。 2. 建设多模态数据理解能力,包括 embedding、检索、聚类、分类、标签体系、Caption 和质量评估。 3. 研究并落地数据清洗、去重、召回、采样、数据配比和课程学习等策略,优化预训练数据组成。 4. 围绕人物、场景、动作、运镜、时序一致性、物理规律和审美等维度,建立视频数据分析与分层方法。 5. 与模型团队共同设计数据消融和对比实验,分析数据规模、质量及分布对模型能力的影响。 6. 持续识别预训练数据中的能力缺口,形成“数据分析—策略设计—训练实验—效果归因”的数据飞轮。 7. 参与大规模数据处理 Pipeline、数据分析平台和可视化工具建设,提高数据研究及生产效率。 后训练方向: 1. 面向视频生成模型的 SFT、偏好优化和强化学习,设计并构建高质量后训练数据。 2. 分析模型在指令遵循、主体一致性、动作生成、复杂运镜、时序稳定性、物理规律和视觉审美等方面的能力短板。 3. 建设细粒度评测和错误分类体系,对模型失败案例进行聚类、归因和优先级判断。 4. 研究难例挖掘、数据筛选、数据合成、拒绝采样、偏好构造和数据配比等策略。 5. 建设视频生成偏好数据,包括 Pairwise Ranking、评分标准、标注规范及质量控制机制。 6. 探索基于多模态模型、Reward Model 和自动评测器的数据生产与筛选方法,提升数据生产效率。 7. 与模型团队共同开展 SFT、DPO、Reward Fine-tuning、RL 等实验,分析不同数据策略对模型能力的影响。 8. 结合离线评测、人工反馈和实际使用反馈,形成“模型评测—数据归因—数据构造—训练验证”的后训练数据飞轮。 工作要求: 1.有视频,图片,音频大规模数据处理经验或相关的预训练,后训练经验。 2. 2028 届及以后本科或研究生在读,计算机、人工智能、数学、统计学等相关专业优先。 3. 熟悉深度学习基础,了解多模态模型、视觉语言模型或视频生成模型的基本原理。 4. 对数据内容及分布敏感,能够从数据现象中发现问题、提出假设并设计实验验证。 5. 熟练使用 Python,掌握 PyTorch,具备良好的数据分析、统计和可视化能力。 6. 了解 embedding、向量检索、聚类、分类、去重或采样等常用算法。 7. 具备较强的研究能力和工程能力,能够独立定义问题并推动落地。 8. 每周可实习 4 天及以上,连续实习 3 个月以上,能长期实习者优先。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作