欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
岗位职责: 我们负责小红书 Agent 平台的评测建设,为基座大模型、多模态及各类 Agent 应用提供全生命周期的评测支撑。工作从平台架构、评测数据的挖掘采集与打标,到自动化评测引擎、Badcase 归因诊断,再到开发者工具链与生态建设,全程一手主导。我们相信评测是 AI 产品的生命线,直接影响全公司的 AI 迭代效率。我们期待工程能力扎实、能独立破局的人加入,一起把它做好。工作职责 1、评测平台架构与建设:负责 LLM 及 AI 应用评测平台的架构设计与核心开发,构建对基座大模型、多模态(图/文/音/视)、Agent 及各类 Tools/Skills 的自动化评测能力 2、评测数据挖掘与生产:负责评测数据的挖掘、采集、清洗与打标,建设标注质检流程,构建评测集并支持其校验、上架与版本化管理 3、自动化评测流水线:打造敏捷评测流水线,实现从数据、执行到结果的全链路自动化评估,支撑版本快速迭代验收 4、深度诊断与归因分析:构建效果分析与报告体系,对失败用例、Agent 决策轨迹(Trace)与 Badcase 深入归因,输出可驱动产品迭代的改进建议 5、系统稳定性建设:负责评测服务的性能调优、容量规划与可观测性建设(监控、告警、日志、链路追踪),保障高并发下稳定运行 6、开发者生态与工具链:开发 Agent 应用的自动化接入工具与诊断工作台,降低各业务线接入成本,提升全公司 AI 迭代效率 7、行业追踪与资产沉淀:跟踪业界大模型动态与主流 Benchmark,制定评测方案并推动落地,沉淀评测数据、结果与报告等资产 任职要求: 任职资格基础要求: 1、本科及以上学历,计算机、软件工程、人工智能等相关专业优先 2、扎实的工程能力,精通 Python / Java / Go 中至少一门语言,熟悉 Linux 与容器化开发 3、对并发编程、分布式系统有深入理解,熟悉 MySQL / Redis / Kafka / ElasticSearch 等常用存储与中间件 4、理解大模型评测体系(LLM-as-a-Judge、自动化指标、人工对齐等),有 AI 应用 / Agent 平台的落地经验 5、逻辑清晰、能拆解复杂问题,可独立分析并解决复杂工程问题 6、良好的跨团队沟通与推动能力加分项: 1、主导或深度参与过主流评测框架(如 OpenCompass、DeepEval、LangSmith 等)的开发 2、有 Agent / Workflow 研发经验,理解 Agent 评测原理(任务完成率、工具调用准确率等)及指标设计 3、有高质量评测数据集的设计与管理经验 4、对模型幻觉、安全性、红队测试有研究或实战我们希望你 1、追结果、重落地,不满足于"做完",而是"做好、做透" 2、主动思考多于被动执行,想到就能动手做到,不推诿、不等靠 3、对细节敏感,一个小 bug 就可能让版本对比失真,你得能揪出来 4、认同评测是 AI 产品的生命线,愿意用极致严谨支撑产品做到业内顶尖
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录岗位职责: 我们负责小红书 Agent 平台的评测建设,为基座大模型、多模态及各类 Agent 应用提供全生命周期的评测支撑。工作从平台架构、评测数据的挖掘采集与打标,到自动化评测引擎、Badcase 归因诊断,再到开发者工具链与生态建设,全程一手主导。我们相信评测是 AI 产品的生命线,直接影响全公司的 AI 迭代效率。我们期待工程能力扎实、能独立破局的人加入,一起把它做好。工作职责 1、评测平台架构与建设:负责 LLM 及 AI 应用评测平台的架构设计与核心开发,构建对基座大模型、多模态(图/文/音/视)、Agent 及各类 Tools/Skills 的自动化评测能力 2、评测数据挖掘与生产:负责评测数据的挖掘、采集、清洗与打标,建设标注质检流程,构建评测集并支持其校验、上架与版本化管理 3、自动化评测流水线:打造敏捷评测流水线,实现从数据、执行到结果的全链路自动化评估,支撑版本快速迭代验收 4、深度诊断与归因分析:构建效果分析与报告体系,对失败用例、Agent 决策轨迹(Trace)与 Badcase 深入归因,输出可驱动产品迭代的改进建议 5、系统稳定性建设:负责评测服务的性能调优、容量规划与可观测性建设(监控、告警、日志、链路追踪),保障高并发下稳定运行 6、开发者生态与工具链:开发 Agent 应用的自动化接入工具与诊断工作台,降低各业务线接入成本,提升全公司 AI 迭代效率 7、行业追踪与资产沉淀:跟踪业界大模型动态与主流 Benchmark,制定评测方案并推动落地,沉淀评测数据、结果与报告等资产 任职要求: 任职资格基础要求: 1、本科及以上学历,计算机、软件工程、人工智能等相关专业优先 2、扎实的工程能力,精通 Python / Java / Go 中至少一门语言,熟悉 Linux 与容器化开发 3、对并发编程、分布式系统有深入理解,熟悉 MySQL / Redis / Kafka / ElasticSearch 等常用存储与中间件 4、理解大模型评测体系(LLM-as-a-Judge、自动化指标、人工对齐等),有 AI 应用 / Agent 平台的落地经验 5、逻辑清晰、能拆解复杂问题,可独立分析并解决复杂工程问题 6、良好的跨团队沟通与推动能力加分项: 1、主导或深度参与过主流评测框架(如 OpenCompass、DeepEval、LangSmith 等)的开发 2、有 Agent / Workflow 研发经验,理解 Agent 评测原理(任务完成率、工具调用准确率等)及指标设计 3、有高质量评测数据集的设计与管理经验 4、对模型幻觉、安全性、红队测试有研究或实战我们希望你 1、追结果、重落地,不满足于"做完",而是"做好、做透" 2、主动思考多于被动执行,想到就能动手做到,不推诿、不等靠 3、对细节敏感,一个小 bug 就可能让版本对比失真,你得能揪出来 4、认同评测是 AI 产品的生命线,愿意用极致严谨支撑产品做到业内顶尖
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作