职位详情
1. 负责灵骏集群AI系统的性能分析与优化工作,支撑客户在多种AI作业场景下,于不同芯片平台及多规模集群中的适配与性能提升,能够高效地通过工具化或产品化手段识别系统瓶颈,并输出针对性优化方案;
2. 面向主流深度学习框架、分布式训练及模型部署等典型场景,开展算子性能、通信效率、内存使用率等核心指标的调优,持续提升集群整体运行效能;
3. 构建AI系统性能模型与仿真环境,搭建如Roofline模型等分析工具,利用仿真结果指导系统架构设计与资源规划,为集群建设提供数据依据;同时输出最优训练与部署配置建议,帮助用户实现高性能实践;
4. 主导性能分析工具的开发与维护,实现系统级性能监控、瓶颈诊断与优化效果验证,输出专业分析报告,为团队及客户提供可靠的技术支持与优化指导。
职位要求
1. 掌握深度学习框架(如PyTorch),熟悉分布式训练与推理技术栈(如DeepSpeed、FSDP、Megatron、vLLM、SGLang);
2. 熟悉AI系统常用性能分析工具(如Nsight、PyTorch Profiler等);
3. 具备性能建模与仿真实践经验,了解Roofline模型等典型性能分析方法;
4. 有参与多模态生成式AI场景性能优化经验,或具备国产芯片平台性能调优背景者优先。
2. 面向主流深度学习框架、分布式训练及模型部署等典型场景,开展算子性能、通信效率、内存使用率等核心指标的调优,持续提升集群整体运行效能;
3. 构建AI系统性能模型与仿真环境,搭建如Roofline模型等分析工具,利用仿真结果指导系统架构设计与资源规划,为集群建设提供数据依据;同时输出最优训练与部署配置建议,帮助用户实现高性能实践;
4. 主导性能分析工具的开发与维护,实现系统级性能监控、瓶颈诊断与优化效果验证,输出专业分析报告,为团队及客户提供可靠的技术支持与优化指导。
职位要求
1. 掌握深度学习框架(如PyTorch),熟悉分布式训练与推理技术栈(如DeepSpeed、FSDP、Megatron、vLLM、SGLang);
2. 熟悉AI系统常用性能分析工具(如Nsight、PyTorch Profiler等);
3. 具备性能建模与仿真实践经验,了解Roofline模型等典型性能分析方法;
4. 有参与多模态生成式AI场景性能优化经验,或具备国产芯片平台性能调优背景者优先。
2026-08-18 12:55
IP属地:浙江杭州
职位福利
本科3-5年机器学习分布式训练大模型算法pytorchPyTorch Profilerdeepseed大数据处理工具(Spark/Hadoop/Hive)模型加速/性能优化

阿里云计算有限公司
不需要融资 · 10000人以上

工作地址

鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
4.5-7.5万元/月
深度学习3-5年硕士图像算法分布式训练算法工程化经验多模态算法自然语言处理算法大模型算法优秀开源项目经历嵌入式开发深度学习经验发表算法相关优秀论文C/C++机器学习TensorFlow/PyTor
杭州 西湖区





