职位详情
1. 负责灵骏集群AI系统性能的分析与优化,支撑客户在多种AI作业场景下,于不同芯片平台及各类规模集群中的适配与性能提升,能够高效地通过工具化或产品化手段识别性能瓶颈,并提出切实可行的优化方案;
2. 面向主流深度学习框架、分布式训练及模型部署等典型场景,开展算子性能、通信效率、内存使用率等核心指标的调优工作,持续提升集群整体运行效能;
3. 构建AI系统性能模型并实施仿真,开发包括Roofline模型在内的性能分析工具,利用仿真结果指导系统架构设计和资源调度策略,为集群建设提供数据依据,同时推荐最优训练与部署配置,帮助用户实现高性能实践;
4. 主导性能分析工具的研发与迭代,实现系统级性能监控、瓶颈诊断和优化效果验证,输出专业性能分析报告,为团队及客户提供技术建议与支持。
职位要求
1. 熟悉深度学习框架(如PyTorch)以及分布式训练与推理框架(如DeepSpeed、FSDP、Megatron、vLLM、SGLang);
2. 掌握常用AI系统性能分析工具(如Nsight、PyTorch Profiler等);
3. 具备性能建模与仿真能力,了解Roofline模型等典型性能分析方法;
4. 有参与多模态生成式AI场景性能优化经验,或具备国产化芯片平台性能调优经历者优先。
2. 面向主流深度学习框架、分布式训练及模型部署等典型场景,开展算子性能、通信效率、内存使用率等核心指标的调优工作,持续提升集群整体运行效能;
3. 构建AI系统性能模型并实施仿真,开发包括Roofline模型在内的性能分析工具,利用仿真结果指导系统架构设计和资源调度策略,为集群建设提供数据依据,同时推荐最优训练与部署配置,帮助用户实现高性能实践;
4. 主导性能分析工具的研发与迭代,实现系统级性能监控、瓶颈诊断和优化效果验证,输出专业性能分析报告,为团队及客户提供技术建议与支持。
职位要求
1. 熟悉深度学习框架(如PyTorch)以及分布式训练与推理框架(如DeepSpeed、FSDP、Megatron、vLLM、SGLang);
2. 掌握常用AI系统性能分析工具(如Nsight、PyTorch Profiler等);
3. 具备性能建模与仿真能力,了解Roofline模型等典型性能分析方法;
4. 有参与多模态生成式AI场景性能优化经验,或具备国产化芯片平台性能调优经历者优先。
2026-08-18 14:53
IP属地:北京
职位福利
本科3-5年机器学习分布式训练大模型算法pytorchPyTorch Profilerdeepseed大数据处理工具(Spark/Hadoop/Hive)模型加速/性能优化

阿里云计算有限公司
不需要融资 · 10000人以上


鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
1.5-3万元/月
深度学习3-5年硕士发表算法相关优秀论文C/C++团队管理经验机器学习图像算法大模型算法算法工程化经验强化学习参加算法相关竞赛/获奖Python
北京 朝阳区









