职位详情
阿里云智能-深度学习训练系统研发专家-北京,杭州
职位描述
基础平台开发-机器学习岗位
● 负责PAI平台深度学习框架的技术研发,涵盖MoE模型的大规模训练架构、多模态训练体系、RLHF训练流程等方向,服务通义实验室及阿里集团内多个业务场景;参与基模型Pretrain、SFT等关键训练阶段的性能调优工作;
● 专注于提升各类模型训练任务在不同阶段的极致吞吐能力,能系统性分析训练负载各环节耗时瓶颈,并提出针对性优化方案,包括算子级优化、通信效率提升、分布式策略改进等技术路径;
● 主导超大规模训练系统的稳定性建设,通过多种机制增强训练任务的实际产出效率,打造高效的异常发现与自动恢复能力,保障大规模训练过程的流畅性和可靠性;
● 参与训练框架对多元硬件后端的支持与适配优化工作。
职位要求
● 具备扎实的工程实现能力,良好的编码规范,精通Python/C++语言及常见设计模式,拥有复杂软件系统的设计、开发与调试经验;
● 掌握深度学习基本理论,熟悉Transformer结构,了解主流大语言模型与多模态模型的核心特性;
● 熟悉PyTorch等常用深度学习框架,深入理解Megatron、DeepSpeed、JAX等训练系统的架构差异与关键技术细节;
● 具备良好的沟通表达能力和团队协作精神,善于知识共享;拥有快速学习新技术的能力和持续探究技术难题的韧性;
● 理解计算机体系结构原理,在异构计算优化(GPGPU/x86/ARM)领域有实践经验,熟悉高性能网络通信机制,具备分布式训练策略调优背景;
职位描述
基础平台开发-机器学习岗位
● 负责PAI平台深度学习框架的技术研发,涵盖MoE模型的大规模训练架构、多模态训练体系、RLHF训练流程等方向,服务通义实验室及阿里集团内多个业务场景;参与基模型Pretrain、SFT等关键训练阶段的性能调优工作;
● 专注于提升各类模型训练任务在不同阶段的极致吞吐能力,能系统性分析训练负载各环节耗时瓶颈,并提出针对性优化方案,包括算子级优化、通信效率提升、分布式策略改进等技术路径;
● 主导超大规模训练系统的稳定性建设,通过多种机制增强训练任务的实际产出效率,打造高效的异常发现与自动恢复能力,保障大规模训练过程的流畅性和可靠性;
● 参与训练框架对多元硬件后端的支持与适配优化工作。
职位要求
● 具备扎实的工程实现能力,良好的编码规范,精通Python/C++语言及常见设计模式,拥有复杂软件系统的设计、开发与调试经验;
● 掌握深度学习基本理论,熟悉Transformer结构,了解主流大语言模型与多模态模型的核心特性;
● 熟悉PyTorch等常用深度学习框架,深入理解Megatron、DeepSpeed、JAX等训练系统的架构差异与关键技术细节;
● 具备良好的沟通表达能力和团队协作精神,善于知识共享;拥有快速学习新技术的能力和持续探究技术难题的韧性;
● 理解计算机体系结构原理,在异构计算优化(GPGPU/x86/ARM)领域有实践经验,熟悉高性能网络通信机制,具备分布式训练策略调优背景;
2026-08-17 13:19
IP属地:北京
职位福利
本科3-5年机器学习自然语言处理算法Python分布式训练算法工程化经验

阿里云计算有限公司
不需要融资 · 10000人以上


鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
3.5-6.5万元/月
高性能计算工程师3-5年硕士深度学习强化学习大模型算法自然语言处理算法多模态算法模型加速/性能优化运筹优化并行计算
北京 朝阳区
2.8-5.5万元/月
高性能计算工程师3-5年本科深度学习大模型算法模型加速/性能优化自然语言处理算法多模态算法C/C++Python算法工程化经验发表算法相关优秀论文参加算法相关竞赛/获奖
北京 朝阳区
2.8-5.5万元/月
高性能计算工程师3-5年本科深度学习大模型算法自然语言处理算法多模态算法C/C++Python分布式训练算法工程化经验发表算法相关优秀论文参加算法相关竞赛/获奖
北京 朝阳区






