职位详情
职位描述
- 参与基于 SGLang 框架的大模型推理引擎设计与核心模块研发,支撑 Transformer、MoE、DiffusionLLM 等多种架构及 LLM/VLM 类模型的高效推理能力
- 应用编译优化、低比特计算、投机采样、稀疏计算、分布式推理等手段,提升大模型推理效率并减少部署开销,同时增强系统稳定性与使用便捷性
- 面向 GPU/AI 芯片架构(含自研硬件平台),实施精细化性能调优,改进算子实现、内存调度、KV Cache 管理等关键组件
- 联动算法、产品及业务团队,推进多类模型应用场景下的端到端系统性能优化工作
- 跟踪大模型推理领域前沿技术动态,积极参与 SGLang 及相关开源社区的建设与代码贡献
职位要求:
- 计算机、人工智能等相关专业本科及以上学历,具有扎实的计算机体系结构与并行计算理论基础
- 熟练掌握 C/C++、Python 编程语言,熟悉常用性能剖析与调试工具的使用
- 了解主流推理框架并具备实际工程经验,如 SGLang、vLLM、TensorRT-LLM、lightllm 等
- 掌握 GPU/AI 芯片编程方法及常用加速库(如 cuBLAS、cuDNN、Cutlass 等),理解模型并行、流水线并行、NVLINK/GPU 通信等高性能计算机制
- 具备大模型推理系统开发、算子级优化、模型压缩或量化、分布式部署与资源调度经验者优先考虑
- 有参与或向 SGLang、vLLM 等推理框架开源项目提交代码经历者优先录用
- 参与基于 SGLang 框架的大模型推理引擎设计与核心模块研发,支撑 Transformer、MoE、DiffusionLLM 等多种架构及 LLM/VLM 类模型的高效推理能力
- 应用编译优化、低比特计算、投机采样、稀疏计算、分布式推理等手段,提升大模型推理效率并减少部署开销,同时增强系统稳定性与使用便捷性
- 面向 GPU/AI 芯片架构(含自研硬件平台),实施精细化性能调优,改进算子实现、内存调度、KV Cache 管理等关键组件
- 联动算法、产品及业务团队,推进多类模型应用场景下的端到端系统性能优化工作
- 跟踪大模型推理领域前沿技术动态,积极参与 SGLang 及相关开源社区的建设与代码贡献
职位要求:
- 计算机、人工智能等相关专业本科及以上学历,具有扎实的计算机体系结构与并行计算理论基础
- 熟练掌握 C/C++、Python 编程语言,熟悉常用性能剖析与调试工具的使用
- 了解主流推理框架并具备实际工程经验,如 SGLang、vLLM、TensorRT-LLM、lightllm 等
- 掌握 GPU/AI 芯片编程方法及常用加速库(如 cuBLAS、cuDNN、Cutlass 等),理解模型并行、流水线并行、NVLINK/GPU 通信等高性能计算机制
- 具备大模型推理系统开发、算子级优化、模型压缩或量化、分布式部署与资源调度经验者优先考虑
- 有参与或向 SGLang、vLLM 等推理框架开源项目提交代码经历者优先录用
2026-08-23 14:08
IP属地:上海
职位福利
本科3-5年

阿里云计算有限公司
不需要融资 · 10000人以上


鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
5-8万元/月
C/C++3-5年硕士编译器开发经验C++分布式经验OpenGLRedis算子优化cuda 编程Linux开发/部署经验Python
上海 徐汇区







