欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
岗位职责:1、主导端侧AI推理引擎的架构设计与研发开发工作,支撑各类深度学习模型、大模型在嵌入式及车载端侧平台的高效落地部署。2、负责Qwen、DeepSeek、Llama等主流大模型的端侧全链路推理加速优化,落地量化压缩、算子加速、投机采样、动态批处理、运行时调度等核心加速技术。3、深入研究TensorRT、vLLM、llama.cpp、SGLang等主流推理引擎底层机制,结合业务需求完成框架二次开发、定制改造与性能专项优化。4、基于CUDA、HVX等硬件加速能力,完成异构计算资源的统筹调度与深度榨取,持续提升端侧大模型推理速度、降低延时与显存占用。5、输出标准化的推理引擎架构设计文档、性能分析报告、端侧部署方案,保障引擎迭代规范、可落地、可复用。任职要求:1、硕士及以上学历,计算机、人工智能、电子信息、自动化、软件工程等相关专业,基础理论扎实。2、精通C/C++、Python编程语言,深入理解计算机体系结构,熟悉CPU、GPU、NPU硬件特性,具备跨平台推理调度与计算加速开发能力。3、熟悉TensorRT、vLLM、llama.cpp、SGLang等至少一种推理引擎底层原理,具备推理引擎定制开发、改造优化实战经验。4、熟练掌握大模型端侧推理加速核心技术,熟悉INT4/INT8量化、KV Cache优化、动态批处理、投机采样等主流优化方案。5、具备扎实的CUDA编程与GPU性能优化能力,了解DSP(HVX)、NPU开发技术者优先。6、具备优秀的工程实践、问题攻坚与技术沉淀能力,学习能力强,善于跟进端侧大模型前沿技术,具备良好的团队协作与技术落地推进能力。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录岗位职责:1、主导端侧AI推理引擎的架构设计与研发开发工作,支撑各类深度学习模型、大模型在嵌入式及车载端侧平台的高效落地部署。2、负责Qwen、DeepSeek、Llama等主流大模型的端侧全链路推理加速优化,落地量化压缩、算子加速、投机采样、动态批处理、运行时调度等核心加速技术。3、深入研究TensorRT、vLLM、llama.cpp、SGLang等主流推理引擎底层机制,结合业务需求完成框架二次开发、定制改造与性能专项优化。4、基于CUDA、HVX等硬件加速能力,完成异构计算资源的统筹调度与深度榨取,持续提升端侧大模型推理速度、降低延时与显存占用。5、输出标准化的推理引擎架构设计文档、性能分析报告、端侧部署方案,保障引擎迭代规范、可落地、可复用。任职要求:1、硕士及以上学历,计算机、人工智能、电子信息、自动化、软件工程等相关专业,基础理论扎实。2、精通C/C++、Python编程语言,深入理解计算机体系结构,熟悉CPU、GPU、NPU硬件特性,具备跨平台推理调度与计算加速开发能力。3、熟悉TensorRT、vLLM、llama.cpp、SGLang等至少一种推理引擎底层原理,具备推理引擎定制开发、改造优化实战经验。4、熟练掌握大模型端侧推理加速核心技术,熟悉INT4/INT8量化、KV Cache优化、动态批处理、投机采样等主流优化方案。5、具备扎实的CUDA编程与GPU性能优化能力,了解DSP(HVX)、NPU开发技术者优先。6、具备优秀的工程实践、问题攻坚与技术沉淀能力,学习能力强,善于跟进端侧大模型前沿技术,具备良好的团队协作与技术落地推进能力。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作