欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
一、岗位定位
负责下一代 AI for Science(AI4S)基础模型的数据体系建设,面向大语言模型和科学多模态模型,建设覆盖互联网文本、科学知识、代码、数学推理、多模态数据等多类型训练数据。
岗位需要结合 NLP、大模型数据工程和多模态数据处理技术,从海量异构数据中构建高质量训练数据,支撑模型预训练、后训练、推理增强和 AI Agent 能力发展。
二、岗位职责
1. 大规模多源数据采集与处理
负责多类型训练数据的采集、处理和组织,包括但不限于:
互联网数据
• Web网页(HTML)
• Wikipedia、论坛、技术博客
• PDF论文、教材、专利、技术报告
科学数据
• 科学论文与专业知识库
• 实验数据与模拟数据
• 化学、材料、物理、生物等科学数据库
代码和推理数据
• 开源代码仓库
• 软件工程数据
• 数学题、证明与推理过程
• 科学推理与问题求解数据
多模态数据
• 图像
• 表格
• 结构化数据
• 时序数据
• 科学图谱和模拟轨迹等
主要工作包括:
• 网络爬虫与数据获取;
• PDF解析、OCR识别、版面分析;
• 数据格式转换与统一模式设计;
• 多模态数据组织与管理。
大模型数据处理与质量治理
建设大模型训练数据 pipeline,包括:
• 数据清洗与标准化;
• 数据去重(精确去重 / 近似去重);
• 数据分类(领域、模态、质量、语言等);
• 数据质量评估与过滤;
• 数据污染检测;
• 数据混合设计与优化。
高质量训练数据构建
负责模型训练所需高质量数据建设,包括:
• 代码、数学、推理、科学数据整理;
• 合成数据生成、筛选和质量评估;
• Agent/ 工具调用数据构建;
• 指令数据构建与优化;
• 数据标注规范制定与标注流程优化。
数据驱动模型迭代
结合模型训练与评测结果,持续优化数据体系,包括:
• 模型失败案例分析;
• 数据缺陷定位;
• 新数据需求发现;
• 数据采集与生成策略优化。
建立“数据采集 → 数据处理 → 模型训练 → 模型评测 → 数据优化”的数据飞轮。
三、任职要求
必备条件
• 计算机、人工智能、自然语言处理、数据科学等相关专业硕士及以上学历;
• 扎实的 NLP 基础,熟悉大语言模型训练流程,包括预训练、监督微调、强化学习等;
• 熟悉大规模文本和多模态数据处理技术;
• 熟悉常见数据处理工具和框架;
• 具有大模型、多模态模型或相关数据 pipeline 搭建经验;
• 具备优秀的数据质量意识和工程实践能力。
优先考虑
具有以下经验者优先:
大模型数据经验
• 大规模互联网数据处理;
• Web crawler 及 HTML 数据解析;
• PDF文档解析和科学文献处理;
• 多模态数据处理;
• 代码、数学、推理数据构建;
• 合成数据和智能体数据建设;
• 数据评测与数据治理经验。
AI4S 相关背景
具备以下任一方向经验者优先:
• 材料科学;
• 化学;
• 物理;
• 生物信息学;
• 科学计算与模拟。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录一、岗位定位
负责下一代 AI for Science(AI4S)基础模型的数据体系建设,面向大语言模型和科学多模态模型,建设覆盖互联网文本、科学知识、代码、数学推理、多模态数据等多类型训练数据。
岗位需要结合 NLP、大模型数据工程和多模态数据处理技术,从海量异构数据中构建高质量训练数据,支撑模型预训练、后训练、推理增强和 AI Agent 能力发展。
二、岗位职责
1. 大规模多源数据采集与处理
负责多类型训练数据的采集、处理和组织,包括但不限于:
互联网数据
• Web网页(HTML)
• Wikipedia、论坛、技术博客
• PDF论文、教材、专利、技术报告
科学数据
• 科学论文与专业知识库
• 实验数据与模拟数据
• 化学、材料、物理、生物等科学数据库
代码和推理数据
• 开源代码仓库
• 软件工程数据
• 数学题、证明与推理过程
• 科学推理与问题求解数据
多模态数据
• 图像
• 表格
• 结构化数据
• 时序数据
• 科学图谱和模拟轨迹等
主要工作包括:
• 网络爬虫与数据获取;
• PDF解析、OCR识别、版面分析;
• 数据格式转换与统一模式设计;
• 多模态数据组织与管理。
大模型数据处理与质量治理
建设大模型训练数据 pipeline,包括:
• 数据清洗与标准化;
• 数据去重(精确去重 / 近似去重);
• 数据分类(领域、模态、质量、语言等);
• 数据质量评估与过滤;
• 数据污染检测;
• 数据混合设计与优化。
高质量训练数据构建
负责模型训练所需高质量数据建设,包括:
• 代码、数学、推理、科学数据整理;
• 合成数据生成、筛选和质量评估;
• Agent/ 工具调用数据构建;
• 指令数据构建与优化;
• 数据标注规范制定与标注流程优化。
数据驱动模型迭代
结合模型训练与评测结果,持续优化数据体系,包括:
• 模型失败案例分析;
• 数据缺陷定位;
• 新数据需求发现;
• 数据采集与生成策略优化。
建立“数据采集 → 数据处理 → 模型训练 → 模型评测 → 数据优化”的数据飞轮。
三、任职要求
必备条件
• 计算机、人工智能、自然语言处理、数据科学等相关专业硕士及以上学历;
• 扎实的 NLP 基础,熟悉大语言模型训练流程,包括预训练、监督微调、强化学习等;
• 熟悉大规模文本和多模态数据处理技术;
• 熟悉常见数据处理工具和框架;
• 具有大模型、多模态模型或相关数据 pipeline 搭建经验;
• 具备优秀的数据质量意识和工程实践能力。
优先考虑
具有以下经验者优先:
大模型数据经验
• 大规模互联网数据处理;
• Web crawler 及 HTML 数据解析;
• PDF文档解析和科学文献处理;
• 多模态数据处理;
• 代码、数学、推理数据构建;
• 合成数据和智能体数据建设;
• 数据评测与数据治理经验。
AI4S 相关背景
具备以下任一方向经验者优先:
• 材料科学;
• 化学;
• 物理;
• 生物信息学;
• 科学计算与模拟。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作