欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
任职要求:- 2027届本科及以上毕业生,计算机、软件工程、人工智能等相关专业,具备扎实的计算机基础。- 熟练掌握 C/C++ 与 Python,具备良好的系统软件开发习惯与工程能力。- 深入理解前沿 LLM 结构及 Prefill/Decode 阶段的计算访存特征,了解 KV Cache、Continuous Batching 等推理基本原理。- 熟悉至少一种推理框架(vLLM/SGLang/TensorRT-LLM/ONNXRuntime 等)/深度学习引擎(PyTorch/JAX);具备异构并行计算、分布式系统、高性能网络或云原生调度中至少一项的知识或项目经验。- 熟悉性能建模与性能分析方法,能够估算模型的算力/访存/通信开销并定位系统瓶颈;具备良好的学习沟通能力与团队协作精神。加分项:- 有推理引擎的开发或优化经验(并行策略、调度、图优化、显存管理、低比特计算等),或对 vLLM/SGLang 等开源项目有代码贡献者优先。- 掌握 FlashAttention/FlashDecoding、投机采样、Chunked Prefill、PD/AF 分离、计算通信 Overlap 等大模型推理优化技术者优先。- 具备性能建模或仿真相关经验(如 Roofline 分析、Analytical Model、成本模型构建等),能够从量化分析结果中提炼优化方向者优先。- 熟悉 NVIDIA/AMD/国产等异构芯片架构特点,有 CUDA/Triton/CUTLASS 使用经验,或熟悉 NCCL、InfiniBand/RoCE 等集合通信与高性能网络者优先。- 有大模型量化(FP8/INT4、GPTQ/AWQ 等)、稀疏化、蒸馏或长上下文优化的算法实践经验,具备精度—性能联合调优经验者优先。- 有多模态/文生图/视频生成/3D 生成等模型的推理加速实战经验;在 OSDI、SOSP、MLSys、NeurIPS 等顶会发表论文,或有超算/程序设计竞赛优异成绩者优先。加入曦望,你将获得什么:- 难得的创造机会:参与 AI 推理 GPU 和算力基础设施从 0 到 1 到 N 的真实建设。- 真问题、真战场、大空间:解决成本、稳定性、规模化落地中的关键问题,在核心岗位承担真实责任。- 顶级人才共事:和行业优秀的工程、架构、产品与业务团队一起做复杂系统。- 简单坦诚的文化:被信任、讲事实、少内耗,专业高效地把事做成。- 长期回报与保障:有竞争力的薪酬激励、token 补贴、补充商保、员工及家人体检、晚餐与夜间出行支持等。你将参与曦望AI推理芯片及软硬件系统的核心研发工作,把底层技术能力推进到可验证、可交付、可规模化应用的真实场景。岗位职责:- 在自研国产芯片平台上,参与大模型推理引擎的架构设计与研发,支持 LLM/多模态等模型,为线上产品提供高并发、高可靠、高可扩展的推理服务。- 参与 LLM/VLM/扩散模型的极致推理加速,运用低比特量化、投机采样、稀疏化、计算通信 Overlap、图优化等技术,显著提升吞吐与时延表现。- 参与数据/张量/流水/序列/专家等多维并行推理与分布式优化,负责请求调度、PD/AF 分离、KV Cache 管理与显存池化等方向,持续降低线上推理成本。- 参与大模型推理性能建模与仿真工作,从模型结构、并行策略到集群配置等维度评估推理性能表现,为系统选型与优化方向提供量化依据。- 从模型算法视角参与软硬协同优化:结合模型结构特点设计量化/蒸馏/草稿模型等算法方案,完成精度对齐与效果评测,在性能与效果间取得最优平衡。- 与算法、业务及底层算子/编译器团队紧密协作,推动模型—引擎—芯片的联合优化;跟踪前沿推理技术并完成预研与落地。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录任职要求:- 2027届本科及以上毕业生,计算机、软件工程、人工智能等相关专业,具备扎实的计算机基础。- 熟练掌握 C/C++ 与 Python,具备良好的系统软件开发习惯与工程能力。- 深入理解前沿 LLM 结构及 Prefill/Decode 阶段的计算访存特征,了解 KV Cache、Continuous Batching 等推理基本原理。- 熟悉至少一种推理框架(vLLM/SGLang/TensorRT-LLM/ONNXRuntime 等)/深度学习引擎(PyTorch/JAX);具备异构并行计算、分布式系统、高性能网络或云原生调度中至少一项的知识或项目经验。- 熟悉性能建模与性能分析方法,能够估算模型的算力/访存/通信开销并定位系统瓶颈;具备良好的学习沟通能力与团队协作精神。加分项:- 有推理引擎的开发或优化经验(并行策略、调度、图优化、显存管理、低比特计算等),或对 vLLM/SGLang 等开源项目有代码贡献者优先。- 掌握 FlashAttention/FlashDecoding、投机采样、Chunked Prefill、PD/AF 分离、计算通信 Overlap 等大模型推理优化技术者优先。- 具备性能建模或仿真相关经验(如 Roofline 分析、Analytical Model、成本模型构建等),能够从量化分析结果中提炼优化方向者优先。- 熟悉 NVIDIA/AMD/国产等异构芯片架构特点,有 CUDA/Triton/CUTLASS 使用经验,或熟悉 NCCL、InfiniBand/RoCE 等集合通信与高性能网络者优先。- 有大模型量化(FP8/INT4、GPTQ/AWQ 等)、稀疏化、蒸馏或长上下文优化的算法实践经验,具备精度—性能联合调优经验者优先。- 有多模态/文生图/视频生成/3D 生成等模型的推理加速实战经验;在 OSDI、SOSP、MLSys、NeurIPS 等顶会发表论文,或有超算/程序设计竞赛优异成绩者优先。加入曦望,你将获得什么:- 难得的创造机会:参与 AI 推理 GPU 和算力基础设施从 0 到 1 到 N 的真实建设。- 真问题、真战场、大空间:解决成本、稳定性、规模化落地中的关键问题,在核心岗位承担真实责任。- 顶级人才共事:和行业优秀的工程、架构、产品与业务团队一起做复杂系统。- 简单坦诚的文化:被信任、讲事实、少内耗,专业高效地把事做成。- 长期回报与保障:有竞争力的薪酬激励、token 补贴、补充商保、员工及家人体检、晚餐与夜间出行支持等。你将参与曦望AI推理芯片及软硬件系统的核心研发工作,把底层技术能力推进到可验证、可交付、可规模化应用的真实场景。岗位职责:- 在自研国产芯片平台上,参与大模型推理引擎的架构设计与研发,支持 LLM/多模态等模型,为线上产品提供高并发、高可靠、高可扩展的推理服务。- 参与 LLM/VLM/扩散模型的极致推理加速,运用低比特量化、投机采样、稀疏化、计算通信 Overlap、图优化等技术,显著提升吞吐与时延表现。- 参与数据/张量/流水/序列/专家等多维并行推理与分布式优化,负责请求调度、PD/AF 分离、KV Cache 管理与显存池化等方向,持续降低线上推理成本。- 参与大模型推理性能建模与仿真工作,从模型结构、并行策略到集群配置等维度评估推理性能表现,为系统选型与优化方向提供量化依据。- 从模型算法视角参与软硬协同优化:结合模型结构特点设计量化/蒸馏/草稿模型等算法方案,完成精度对齐与效果评测,在性能与效果间取得最优平衡。- 与算法、业务及底层算子/编译器团队紧密协作,推动模型—引擎—芯片的联合优化;跟踪前沿推理技术并完成预研与落地。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作