职位详情
职位描述
1. 深入理解主流AI芯片与服务器架构,分析硬件加速特性及内部拓扑结构,输出硬件优化实践方案与调优指导,充分释放硬件性能潜力。
2. 结合主流LLM推理框架(如sglang/vLLM)以及大模型结构和计算特征,通过软硬件协同设计与技术创新(包括但不限于硬件算子优化、显存管理、并行策略等),完成新服务器平台的端到端性能评估与优化。
3. 提供面向具体场景的定制化优化能力,识别并突破大模型在各类业务应用中的性能瓶颈,快速制定满足实际需求的性能提升方案。
4. 熟练掌握系统级调优与Profiling工具(如nsys/ncu系列、通用工具Perf、火焰图等),具备系统性能分析与瓶颈定位能力,并能结合硬件特性实现软件层面的适配与优化。
职位要求
1. 熟悉sglang/vLLM/Pytorch等主流LLM推理框架,具备二次开发或深度优化经验(如KV Cache优化、编译优化、Speculative执行、量化、DeepEP等相关技术)。
2. 具备良好的沟通协作与项目推动能力,能够与多背景团队高效协同工作。
如下经验优先:
1. 具备性能调优实践经验,有在新硬件平台上进行sglang/vLLM适配与优化的经历,对Qwen /DeepSeek 类模型进行过性能优化者优先
1. 深入理解主流AI芯片与服务器架构,分析硬件加速特性及内部拓扑结构,输出硬件优化实践方案与调优指导,充分释放硬件性能潜力。
2. 结合主流LLM推理框架(如sglang/vLLM)以及大模型结构和计算特征,通过软硬件协同设计与技术创新(包括但不限于硬件算子优化、显存管理、并行策略等),完成新服务器平台的端到端性能评估与优化。
3. 提供面向具体场景的定制化优化能力,识别并突破大模型在各类业务应用中的性能瓶颈,快速制定满足实际需求的性能提升方案。
4. 熟练掌握系统级调优与Profiling工具(如nsys/ncu系列、通用工具Perf、火焰图等),具备系统性能分析与瓶颈定位能力,并能结合硬件特性实现软件层面的适配与优化。
职位要求
1. 熟悉sglang/vLLM/Pytorch等主流LLM推理框架,具备二次开发或深度优化经验(如KV Cache优化、编译优化、Speculative执行、量化、DeepEP等相关技术)。
2. 具备良好的沟通协作与项目推动能力,能够与多背景团队高效协同工作。
如下经验优先:
1. 具备性能调优实践经验,有在新硬件平台上进行sglang/vLLM适配与优化的经历,对Qwen /DeepSeek 类模型进行过性能优化者优先
2026-09-30 15:01
IP属地:北京
职位福利
硕士3-5年编译器开发经验cudaC++C分布式经验OpenGLRedis算子优化Python

阿里云计算有限公司
不需要融资 · 10000人以上


鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >










