欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
岗位职责:
1. 多模态大模型(VLM)基座训练:
1-1负责 UrbanVLM 基座模型的架构设计、预训练(Pre-training)与指令微调(SFT)。
1-2深入优化视觉编码器(基于 ViT-Large 架构)与语言模型(LLM)的对齐模块,重点提升模型对复杂开放场景的深层语义理解、常识推理与长程规划能力。
1-3构建标准化的意图下发与调度接口,确保 UrbanVLM 的宏观决策能够与下游的 VLA(视觉-语言-动作)、VLN(视觉-语言-导航)以及 WAM(世界动作模型)实现低延迟、高可靠的认知协同。
2. 具身 Agent 架构与前沿技术研究:
2-1负责 UrbanVLM 的 Agentic 架构研发,探索并落地前沿的具身智能体工作流。
2-2研究多模态工具调用(Function Calling / Tool-use)机制,将底层的技能基元(Skill Primitives)、WAM 的未来前向预测、以及各类外部数据源(如高精语义地图、市政 SOP 知识图谱)封装为大模型可调用的工具,实现复杂长程作业任务的自动化拆解与调度。
3. 基于 RL 的多模态对齐与长程推理(VLM+RL):
3-1负责 VLM 的偏好对齐工作(RL),将人类专家或物理仿真环境的反馈注入模型,消除 VLM 在复杂业务决策中的逻辑幻觉。
3-2前沿探索: 将强化学习引入 VLM 的多模态思维链(CoT)训练中,通过过程奖励机制(PRM)或 Outcome 奖励,提升模型在长程任务编排和逻辑推理能力。
4. 多模态数据引擎与高质量指令集建设:
4-1主导构建面向具身智能场景的高质量多模态训练数据集(包含复杂场景理解与逻辑推演、行业 SOP 规范、宏观技能调度)。
4-2利用大模型辅助、合成数据(Synthetic Data)生成及多模态数据清洗策略,打造支撑 VLM 认知能力持续跃迁的数据飞轮。
5. 极致的模型量化与推理优化:
5-1与工程团队紧密配合,负责 VLM 的端侧或云端高效部署,解决 KV Cache 优化、低比特量化(AWQ/GPTQ)等工程瓶颈,确保模型在具身闭环控制中的高效推理。
岗位要求:
1. 基础背景:
1-1计算机、人工智能相关专业硕士及以上学历。
1-2VLM技术研究或落地相关经验: 在一线互联网公司(如多模态搜索/推荐/生成业务)、自动驾驶或具身智能领域,有明确的 VLM 模型训练落地经验与业务产出(非纯 API 调用或浅层应用)。
1-3深入理解且拆解过主流开源 VLM 架构(如 LLaVA 系列, Qwen-VL, InternVL 等),对其代码实现有源码级的掌控力,能快速复现或修改源码进行高并发实验。
2. VLM + RL 经验优先考虑:
2-1熟悉且实际跑通过 LLM / VLM 的 RLHF 或 DPO 全流程。
2-2有过基于强化学习优化大模型推理能力(如基于 RL 的 CoT 训练、多模态 Reward Model 训练),清楚其中训练过程中的坑点与解决策略。
2-3熟知 DeepSeek-R1、OpenAI o1 等在 Test-Time Compute 与 RL 结合方向的最新演进理念。
3. 编程与 AI 工程:
3-1AI Coding : 习惯且熟练使用Codex、Claude Code 等 AI 辅助编程工具,具备极高的代码产出效率与“用 AI 构建 AI”的工作方式。
3-2精通 PyTorch,熟练使用大规模分布式训练框架(Megatron-LM, DeepSpeed, FSDP),对显存优化、算子融合、通信瓶颈有深度排查与调优经验。
3-3熟悉大模型推理加速框架(如 vLLM, TensorRT-LLM)。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录岗位职责:
1. 多模态大模型(VLM)基座训练:
1-1负责 UrbanVLM 基座模型的架构设计、预训练(Pre-training)与指令微调(SFT)。
1-2深入优化视觉编码器(基于 ViT-Large 架构)与语言模型(LLM)的对齐模块,重点提升模型对复杂开放场景的深层语义理解、常识推理与长程规划能力。
1-3构建标准化的意图下发与调度接口,确保 UrbanVLM 的宏观决策能够与下游的 VLA(视觉-语言-动作)、VLN(视觉-语言-导航)以及 WAM(世界动作模型)实现低延迟、高可靠的认知协同。
2. 具身 Agent 架构与前沿技术研究:
2-1负责 UrbanVLM 的 Agentic 架构研发,探索并落地前沿的具身智能体工作流。
2-2研究多模态工具调用(Function Calling / Tool-use)机制,将底层的技能基元(Skill Primitives)、WAM 的未来前向预测、以及各类外部数据源(如高精语义地图、市政 SOP 知识图谱)封装为大模型可调用的工具,实现复杂长程作业任务的自动化拆解与调度。
3. 基于 RL 的多模态对齐与长程推理(VLM+RL):
3-1负责 VLM 的偏好对齐工作(RL),将人类专家或物理仿真环境的反馈注入模型,消除 VLM 在复杂业务决策中的逻辑幻觉。
3-2前沿探索: 将强化学习引入 VLM 的多模态思维链(CoT)训练中,通过过程奖励机制(PRM)或 Outcome 奖励,提升模型在长程任务编排和逻辑推理能力。
4. 多模态数据引擎与高质量指令集建设:
4-1主导构建面向具身智能场景的高质量多模态训练数据集(包含复杂场景理解与逻辑推演、行业 SOP 规范、宏观技能调度)。
4-2利用大模型辅助、合成数据(Synthetic Data)生成及多模态数据清洗策略,打造支撑 VLM 认知能力持续跃迁的数据飞轮。
5. 极致的模型量化与推理优化:
5-1与工程团队紧密配合,负责 VLM 的端侧或云端高效部署,解决 KV Cache 优化、低比特量化(AWQ/GPTQ)等工程瓶颈,确保模型在具身闭环控制中的高效推理。
岗位要求:
1. 基础背景:
1-1计算机、人工智能相关专业硕士及以上学历。
1-2VLM技术研究或落地相关经验: 在一线互联网公司(如多模态搜索/推荐/生成业务)、自动驾驶或具身智能领域,有明确的 VLM 模型训练落地经验与业务产出(非纯 API 调用或浅层应用)。
1-3深入理解且拆解过主流开源 VLM 架构(如 LLaVA 系列, Qwen-VL, InternVL 等),对其代码实现有源码级的掌控力,能快速复现或修改源码进行高并发实验。
2. VLM + RL 经验优先考虑:
2-1熟悉且实际跑通过 LLM / VLM 的 RLHF 或 DPO 全流程。
2-2有过基于强化学习优化大模型推理能力(如基于 RL 的 CoT 训练、多模态 Reward Model 训练),清楚其中训练过程中的坑点与解决策略。
2-3熟知 DeepSeek-R1、OpenAI o1 等在 Test-Time Compute 与 RL 结合方向的最新演进理念。
3. 编程与 AI 工程:
3-1AI Coding : 习惯且熟练使用Codex、Claude Code 等 AI 辅助编程工具,具备极高的代码产出效率与“用 AI 构建 AI”的工作方式。
3-2精通 PyTorch,熟练使用大规模分布式训练框架(Megatron-LM, DeepSpeed, FSDP),对显存优化、算子融合、通信瓶颈有深度排查与调优经验。
3-3熟悉大模型推理加速框架(如 vLLM, TensorRT-LLM)。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作