欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
岗位定位:
我们致力于通用大语言模型(LLM)的核心数据基建与评测体系建设。团队面向大模型的预训练、后训练、复杂推理增强及 AI Agent 场景,构建覆盖互联网文本、高质量代码、数学逻辑及专业领域知识的海量数据处理闭环。岗位需要结合 NLP、大模型数据工程与分布式系统技术,从海量异构数据中提炼/合成高质量训练语料,驱动模型通用能力与复杂推理(含 AI for Science 等前沿场景)的持续突破。
岗位职责:
1. 负责大模型预/后训练数据的全生命周期管理,构建支撑 TB 级及以上数据规模的高效清洗、去重与质量筛选 Pipeline。
2. 攻坚多源异构数据(如 PDF、网页、表格等)的解析与文本抽取,保障底层训练数据的高质量与高可用性。
任职要求:
1. 计算机相关专业,具备极强的代码实现与系统架构能力,精通 Python,熟练掌握 C++ / Rust / Go 中至少一门。
2. 拥有 TB 级及以上海量数据处理实战经验,熟悉 Spark、Hadoop、Ray、Flink 等主流分布式计算框架中至少一种,具备底层性能调优能力。
3. 理解大规模数据去重(如 MinHash、SimHash、Embedding-based)与质量过滤算法,熟悉分布式存储架构及 Parquet / Arrow 等列式存储格式,具备高并发 Pipeline 落地与海量数据 IO 优化经验。
4. 熟悉文档解析、OCR 及版面分析流程,有 PDF、表格等复杂文档处理经验。
5. 能熟练运用 AI 编程工具,将数据处理需求快速转化为高可用的工程组件。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录岗位定位:
我们致力于通用大语言模型(LLM)的核心数据基建与评测体系建设。团队面向大模型的预训练、后训练、复杂推理增强及 AI Agent 场景,构建覆盖互联网文本、高质量代码、数学逻辑及专业领域知识的海量数据处理闭环。岗位需要结合 NLP、大模型数据工程与分布式系统技术,从海量异构数据中提炼/合成高质量训练语料,驱动模型通用能力与复杂推理(含 AI for Science 等前沿场景)的持续突破。
岗位职责:
1. 负责大模型预/后训练数据的全生命周期管理,构建支撑 TB 级及以上数据规模的高效清洗、去重与质量筛选 Pipeline。
2. 攻坚多源异构数据(如 PDF、网页、表格等)的解析与文本抽取,保障底层训练数据的高质量与高可用性。
任职要求:
1. 计算机相关专业,具备极强的代码实现与系统架构能力,精通 Python,熟练掌握 C++ / Rust / Go 中至少一门。
2. 拥有 TB 级及以上海量数据处理实战经验,熟悉 Spark、Hadoop、Ray、Flink 等主流分布式计算框架中至少一种,具备底层性能调优能力。
3. 理解大规模数据去重(如 MinHash、SimHash、Embedding-based)与质量过滤算法,熟悉分布式存储架构及 Parquet / Arrow 等列式存储格式,具备高并发 Pipeline 落地与海量数据 IO 优化经验。
4. 熟悉文档解析、OCR 及版面分析流程,有 PDF、表格等复杂文档处理经验。
5. 能熟练运用 AI 编程工具,将数据处理需求快速转化为高可用的工程组件。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作