欢迎访问上海招聘网!本站为上海找工作求职者提供上海人才招聘、上海人才市场、上海人才网等岗位信息!


职位月薪: 面议
岗位职责: 关键词:MLSys, MLInfer, Heterogeneous Computing, Compiler Optimization, NVIDIA Thor, Real-time Inference 在 L4/L5 级自动驾驶的演进中,算力不再是唯一的瓶颈,能效比(Performance per Watt)与确定性低延迟(Deterministic Low Latency)才是决胜关键。我们致力于打破传统深度学习框架的黑盒限制,从芯片指令集到上层应用逻辑,重新定义端侧 AI 的运行效率。如果你渴望在物理极限边缘跳舞,欢迎加入我们。 核心预研课题方向 我们将围绕 “极致加速” 与 “异构协同” 两大主线,设立以下挑战性课题: 1. Efficient AI 算法 研究内容: 结合当前Physical AI领域端到端大模型算法结构设计,提供端侧更高效的backbone或head,或注意力机制算法,优化ViT、DiT或迭代新网络; 设计端侧带宽瓶颈、内存瓶颈下的高效算法模型结构,如sparse attention/flashattention/linear attention等; 2. 跨异构平台的AI 编译器设计、端侧高效推理加速器 背景:车载计算单元日益复杂,包含 CPU (ARM/x86)、GPU (CUDA) 及专用 NPU/ASIC。如何在一个统一的编译流中调度这些异构资源是行业难题。 研究内容: 中间表示(IR)创新:基于MLIR做端侧推理的vllm,设计支持多后端统一抽象的高级 IR,打通从 PyTorch/TensorFlow 到 C++/CUDA/OpenCL 的全自动代码生成路径,加速端侧推理和调度优化。 自动调优(Auto-tuning):mlir/tvm-tensorrt 开发基于强化学习或贝叶斯优化的算子搜索器,针对特定硬件缓存层级(L1/L2/Shared Memory)自动寻找最优分块(Tiling)与并行策略。 端到端编译:实现从模型图到二进制指令的零拷贝优化,消除框架 overhead,达成 C++ 到 CUDA 内核生成的全链路性能逼近理论峰值。 任职要求: 我们寻找这样的你 学历背景:计算机科学、电子工程、应用数学等相关专业博士或杰出硕士,有顶级会议(OSDI, MLSys, ASPLOS, ISCA, CVPR, ICCV)论文发表者优先。 核心技术栈: 精通 C++/CUDA 编程,具备深厚的计算机体系结构知识(流水线、缓存一致性、SIMD/SIMT)。 熟练掌握至少一种主流深度学习编译器框架(TVM, MLIR, XLA, Triton, TensorRT),一种主流推理框架(sglang、vllm等)并有源码修改或插件开发经验。 对 NVIDIA GPU 架构(Ampere/Hopper/Blackwell)或主流 NPU 指令集有深刻理解。 特质: 极客精神:不满足于调用 API,热衷于挖掘底层性能极限,享受将推理速度提升 10% 带来的成就感。 系统思维:能够从全局视角看待算法、软件与硬件的协同设计。
微信扫一扫,及时了解投递状态
您目前还没有登录:立即登录岗位职责: 关键词:MLSys, MLInfer, Heterogeneous Computing, Compiler Optimization, NVIDIA Thor, Real-time Inference 在 L4/L5 级自动驾驶的演进中,算力不再是唯一的瓶颈,能效比(Performance per Watt)与确定性低延迟(Deterministic Low Latency)才是决胜关键。我们致力于打破传统深度学习框架的黑盒限制,从芯片指令集到上层应用逻辑,重新定义端侧 AI 的运行效率。如果你渴望在物理极限边缘跳舞,欢迎加入我们。 核心预研课题方向 我们将围绕 “极致加速” 与 “异构协同” 两大主线,设立以下挑战性课题: 1. Efficient AI 算法 研究内容: 结合当前Physical AI领域端到端大模型算法结构设计,提供端侧更高效的backbone或head,或注意力机制算法,优化ViT、DiT或迭代新网络; 设计端侧带宽瓶颈、内存瓶颈下的高效算法模型结构,如sparse attention/flashattention/linear attention等; 2. 跨异构平台的AI 编译器设计、端侧高效推理加速器 背景:车载计算单元日益复杂,包含 CPU (ARM/x86)、GPU (CUDA) 及专用 NPU/ASIC。如何在一个统一的编译流中调度这些异构资源是行业难题。 研究内容: 中间表示(IR)创新:基于MLIR做端侧推理的vllm,设计支持多后端统一抽象的高级 IR,打通从 PyTorch/TensorFlow 到 C++/CUDA/OpenCL 的全自动代码生成路径,加速端侧推理和调度优化。 自动调优(Auto-tuning):mlir/tvm-tensorrt 开发基于强化学习或贝叶斯优化的算子搜索器,针对特定硬件缓存层级(L1/L2/Shared Memory)自动寻找最优分块(Tiling)与并行策略。 端到端编译:实现从模型图到二进制指令的零拷贝优化,消除框架 overhead,达成 C++ 到 CUDA 内核生成的全链路性能逼近理论峰值。 任职要求: 我们寻找这样的你 学历背景:计算机科学、电子工程、应用数学等相关专业博士或杰出硕士,有顶级会议(OSDI, MLSys, ASPLOS, ISCA, CVPR, ICCV)论文发表者优先。 核心技术栈: 精通 C++/CUDA 编程,具备深厚的计算机体系结构知识(流水线、缓存一致性、SIMD/SIMT)。 熟练掌握至少一种主流深度学习编译器框架(TVM, MLIR, XLA, Triton, TensorRT),一种主流推理框架(sglang、vllm等)并有源码修改或插件开发经验。 对 NVIDIA GPU 架构(Ampere/Hopper/Blackwell)或主流 NPU 指令集有深刻理解。 特质: 极客精神:不满足于调用 API,热衷于挖掘底层性能极限,享受将推理速度提升 10% 带来的成就感。 系统思维:能够从全局视角看待算法、软件与硬件的协同设计。
企业尚未更新
上海市
扫描二维码及时订阅职位
最新职位信息第一时间知晓
上海兼职招聘
360行任你挑选
分秒必争直达HR
谁看我简历早知道
请使用微信【扫一扫】
关注「上海易职邦招聘」公众号完成登录
客服电话:400-765-0056
竭诚为您服务
服务时间08:00-24:00
微信小程序
面试通知
收藏
简历
足迹
微信求职
关注公众号
掌握最新求职动态
小程序
进入小程序
随时随地找工作