欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!

网站地图
上海招聘网

上海站[切换城市]
  • 职位
    • 公司
    • 职位
  • 上海招聘网 www.shrszp.net 提示:

    确认
    上海招聘网 上海招聘网 > 招聘列表 > 招聘详情 >

    基于大模型异构分布式推理性能优化研究

    基于大模型异构分布式推理性能优化研究

    职位月薪:面议

    基于大模型异构分布式推理性能优化研究

    职位月薪: 面议

    • 岗位类别:
    • 招聘类型: 全职
    • 工作经验: 10年以上
    • 工作地点: 上海市
    • 学历要求: 本科
    • 招聘人数: 1人
      福利待遇:
    • 五险一金
    • 优质平台
    • 法定节假日休息
    • 年终奖

    收藏 收藏 小程序 小程序 岗位分享 微信分享

    聊一聊 和TA聊一聊  投递简历 投个简历

    联系方式

    联系人:深圳市腾讯计算机系统有限公司

    联系电话:152****5633

    点击查看
    打电话联系前先投递一份简历,面试成功率提高60%!

    (联系我时,请说是在上海易职邦上看到的)

    职位描述

    课题背景:随着大模型技术的快速发展,模型架构日趋多样化——从稠密Transformer到稀疏MoE,从纯文本到多模态融合,从单轮问答到具备深度推理能力的Reasoning Model——部署模型的规模越来越大,相关服务的QPS也在不断增加,服务的任务种类也在不断增多且各不相同,例如文本摘要服务、对话与Agent服务、图片/视频生成服务、深度推理服务等。各种服务对推理引擎的挑战也各不相同。同样是长序列,文本摘要服务的输入Prompt通常很长,因此TTFT是关键;对话与Agent服务更关注TPOT与多轮交互延迟;图片/视频生成服务则更强调E2E Latency;而Reasoning Model需要支持超长思维链输出,对Decode吞吐提出极高要求。即使是短序列,遇到长序列时也会产生P99问题。这些问题结合当前Prefill和Decode两阶段不同的计算特性、PD分离等新型架构模式的成熟落地、以及日益增大的模型体量与部署规模,给大模型推理引擎和服务带来了巨大挑战。与此同时,推理引擎的性能最终依赖于底层算子的执行效率,而传统由工程师针对每种硬件平台(NVIDIA GPU、国产NPU等)手工编写和调优算子的模式,已难以跟上模型结构快速迭代与多硬件生态并存的节奏。本课题的目标是设计开发一款面向通用场景的分布式大模型推理引擎,同时探索构建一套面向多硬件平台的高性能算子DSL及自动调优编译器,实现从推理服务调度到底层算子生成的全栈极致优化。课题挑战: 1、在通用场景下,面对不同长度、不同模态和不同种类的大模型请求服务(包括MoE动态路由、超长上下文、多模态混合、深度推理等),满足各自的TTFT、TPOT及P99要求; 2、在上述前提条件下,做到最大化资源利用率,通过PD分离、Speculative Decoding、KV Cache智能管理等技术将单Token的成本降到最低; 3、探索面向多硬件平台的算子DSL与编译优化技术,支持从统一算子描述自动生成多后端高性能代码,降低算子开发与跨平台适配成本,使编译生成的算子性能逼近专家手工优化水平。 1. 深入理解主流大模型架构,包括Transformer及其注意力机制变体(MHA/GQA/MLA等)、MoE稀疏架构、以及多模态相关模型(ViT、VAE、Diffusion等),能够针对不同架构特点进行推理优化。 2. 扎实的系统编程与GPU编程能力,熟练使用C/C++和Python,至少掌握CUDA/CUTLASS/Triton中的一种;熟悉MLIR/LLVM编译基础设施或有AI编译器开发经验者优先。 3. 熟悉大模型推理引擎的核心技术,包括Attention优化(FlashAttention系列、FlashDecoding等)、KV Cache管理(PagedAttention等)、量化部署(GPTQ/AWQ/FP8等),并有vLLM、SGLang、TensorRT-LLM等主流框架的实际使用或开发经验。 4. 具备分布式推理系统设计与优化经验,理解PD分离、Speculative Decoding、Chunked Prefill等架构模式,熟悉TP/SP/EP/CP等并行策略,能针对不同业务场景进行调度与资源优化。 5. 了解高性能网络通信技术(RDMA、NVLink、NVSwitch等),能在多机多卡集群环境下进行通信性能调优。

    二维码微信扫一扫,及时了解投递状态
    头像您目前还没有登录:立即登录

    课题背景:随着大模型技术的快速发展,模型架构日趋多样化——从稠密Transformer到稀疏MoE,从纯文本到多模态融合,从单轮问答到具备深度推理能力的Reasoning Model——部署模型的规模越来越大,相关服务的QPS也在不断增加,服务的任务种类也在不断增多且各不相同,例如文本摘要服务、对话与Agent服务、图片/视频生成服务、深度推理服务等。各种服务对推理引擎的挑战也各不相同。同样是长序列,文本摘要服务的输入Prompt通常很长,因此TTFT是关键;对话与Agent服务更关注TPOT与多轮交互延迟;图片/视频生成服务则更强调E2E Latency;而Reasoning Model需要支持超长思维链输出,对Decode吞吐提出极高要求。即使是短序列,遇到长序列时也会产生P99问题。这些问题结合当前Prefill和Decode两阶段不同的计算特性、PD分离等新型架构模式的成熟落地、以及日益增大的模型体量与部署规模,给大模型推理引擎和服务带来了巨大挑战。与此同时,推理引擎的性能最终依赖于底层算子的执行效率,而传统由工程师针对每种硬件平台(NVIDIA GPU、国产NPU等)手工编写和调优算子的模式,已难以跟上模型结构快速迭代与多硬件生态并存的节奏。本课题的目标是设计开发一款面向通用场景的分布式大模型推理引擎,同时探索构建一套面向多硬件平台的高性能算子DSL及自动调优编译器,实现从推理服务调度到底层算子生成的全栈极致优化。课题挑战: 1、在通用场景下,面对不同长度、不同模态和不同种类的大模型请求服务(包括MoE动态路由、超长上下文、多模态混合、深度推理等),满足各自的TTFT、TPOT及P99要求; 2、在上述前提条件下,做到最大化资源利用率,通过PD分离、Speculative Decoding、KV Cache智能管理等技术将单Token的成本降到最低; 3、探索面向多硬件平台的算子DSL与编译优化技术,支持从统一算子描述自动生成多后端高性能代码,降低算子开发与跨平台适配成本,使编译生成的算子性能逼近专家手工优化水平。 1. 深入理解主流大模型架构,包括Transformer及其注意力机制变体(MHA/GQA/MLA等)、MoE稀疏架构、以及多模态相关模型(ViT、VAE、Diffusion等),能够针对不同架构特点进行推理优化。 2. 扎实的系统编程与GPU编程能力,熟练使用C/C++和Python,至少掌握CUDA/CUTLASS/Triton中的一种;熟悉MLIR/LLVM编译基础设施或有AI编译器开发经验者优先。 3. 熟悉大模型推理引擎的核心技术,包括Attention优化(FlashAttention系列、FlashDecoding等)、KV Cache管理(PagedAttention等)、量化部署(GPTQ/AWQ/FP8等),并有vLLM、SGLang、TensorRT-LLM等主流框架的实际使用或开发经验。 4. 具备分布式推理系统设计与优化经验,理解PD分离、Speculative Decoding、Chunked Prefill等架构模式,熟悉TP/SP/EP/CP等并行策略,能针对不同业务场景进行调度与资源优化。 5. 了解高性能网络通信技术(RDMA、NVLink、NVSwitch等),能在多机多卡集群环境下进行通信性能调优。

    二维码微信扫一扫,及时了解投递状态
    头像您已有可投递的在线简历:点击投递
    简历完成度50%,完善简历才能找到好工作:完善简历

    公司介绍

    企业尚未更新

    工作地点

    地址上海市

    查看地图

    看了此职位的人还会看
    查看更多相似的职位 >>

    公司信息 公司信息

    头像

    深圳市腾讯计算机系统有限公司

    ecruit_type} 全职

    人力资源服务 人力资源服务

    500-999 500-999人

    广东省,深圳市;北京市;上海市;浙江省,杭州市 广东省,深圳市;北京市;上海市;浙江省,杭州市

    查看所有职位

    公司信息 给我留言

    推荐职位 相关公司推荐

    • 头像

      上海欧伦森塑胶科技有限公司

      热招5个职位
      查看
    • 头像

      上海乔安贝恩家政服务有限公司

      热招3个职位
      查看
    • 头像

      福州宏格达尔信息科技有限公司

      热招1个职位
      查看
    • 头像

      凯莫(上海)教育科技有限公司

      热招2个职位
      查看
    • 头像

      上海勤博集装箱服务有限公司

      热招2个职位
      查看
    二维码

    扫描二维码及时订阅职位

    最新职位信息第一时间知晓

    上海兼职招聘

    • 扫码下载APP

      上海招聘网APP
    • 扫码进小程序

      上海招聘网小程序

    服务信息

    联系电话: 13916151478 杨老师

    服务时间:08:00-18:00

    上海人才招聘 | 上海招聘网 | 上海找工作 | 上海招聘 | 上海人才招聘网

    Copyright 2012-2022 上海招聘网 All Rights Reserved

    详细地址:江西省南昌市青山湖区高新大道万象汇9号楼7楼

    版权所有:江西易职邦网络科技有限公司

    ICP证:赣ICP备2021008707号-3 赣公网安备 36010202000584号

    技术支持:南昌传爱网络科技有限公司

    关注公众号

    服务时间08:00-24:00

    微信公众号

    微信公众号

    招聘交流群

    招聘交流群

    微信小程序

    微信小程序

    微信扫一扫

    面试通知

    收藏

    简历

    足迹

    微信求职

    关注公众号

    掌握最新求职动态

    微信公众号

    小程序

    进入小程序

    随时随地找工作

    小程序