职位详情
职位描述:
1. 承担GPU分布式训练系统的设计与实现,持续优化主流训练框架(如PyTorch、TensorFlow)在分布式环境下的通信性能,加速大规模模型(如大语言模型、计算机视觉大模型等)的训练进程。
2. 主导高性能计算网络的调优工作,围绕RDMA、NVLink等高速互联技术,突破网络带宽限制,优化通信延迟并解决数据分片难题,确保多节点GPU集群间通信高效稳定。
3. 持续监控分布式训练系统的运行状态,及时发现并处理系统异常,涵盖节点故障恢复、任务容错机制、资源调度冲突等问题,有效减少训练中断情况。
4. 联合算法团队推进分布式优化策略在实际业务中的应用落地(如大模型预训练、微调等场景),提供关键技术支撑,并根据反馈持续迭代改进方案。
职位要求:
1. 本科及以上学历,计算机、电子信息、软件工程等相关专业背景,具备3年以上从事GPU分布式训练或高性能计算领域的工作经验。
2. 熟悉至少一种深度学习框架的分布式架构(如PyTorch DDP、Horovod),拥有在多节点GPU集群上部署与性能调优的实际项目经历。
3. 掌握计算网络协议及体系结构(如RDMA、TCP/IP、Infiniband),能够独立开展网络性能测试、瓶颈分析并实施有效的优化措施。
4. 熟练使用C++/Python进行开发,熟悉Linux环境及Shell脚本编程,具备容器化技术(Docker、K8s)部署分布式训练任务者优先考虑。
5. 具备较强的系统问题排查能力,可快速定位内存泄漏、网络丢包、节点宕机等故障,有大规模GPU集群运维经验者更具优势。
6. 有参与千亿参数以上大模型分布式训练优化,或具备AI加速芯片(如A100/H100)性能调优实践经验者优先录用。
1. 承担GPU分布式训练系统的设计与实现,持续优化主流训练框架(如PyTorch、TensorFlow)在分布式环境下的通信性能,加速大规模模型(如大语言模型、计算机视觉大模型等)的训练进程。
2. 主导高性能计算网络的调优工作,围绕RDMA、NVLink等高速互联技术,突破网络带宽限制,优化通信延迟并解决数据分片难题,确保多节点GPU集群间通信高效稳定。
3. 持续监控分布式训练系统的运行状态,及时发现并处理系统异常,涵盖节点故障恢复、任务容错机制、资源调度冲突等问题,有效减少训练中断情况。
4. 联合算法团队推进分布式优化策略在实际业务中的应用落地(如大模型预训练、微调等场景),提供关键技术支撑,并根据反馈持续迭代改进方案。
职位要求:
1. 本科及以上学历,计算机、电子信息、软件工程等相关专业背景,具备3年以上从事GPU分布式训练或高性能计算领域的工作经验。
2. 熟悉至少一种深度学习框架的分布式架构(如PyTorch DDP、Horovod),拥有在多节点GPU集群上部署与性能调优的实际项目经历。
3. 掌握计算网络协议及体系结构(如RDMA、TCP/IP、Infiniband),能够独立开展网络性能测试、瓶颈分析并实施有效的优化措施。
4. 熟练使用C++/Python进行开发,熟悉Linux环境及Shell脚本编程,具备容器化技术(Docker、K8s)部署分布式训练任务者优先考虑。
5. 具备较强的系统问题排查能力,可快速定位内存泄漏、网络丢包、节点宕机等故障,有大规模GPU集群运维经验者更具优势。
6. 有参与千亿参数以上大模型分布式训练优化,或具备AI加速芯片(如A100/H100)性能调优实践经验者优先录用。
2026-08-23 14:59
IP属地:浙江杭州
职位福利
硕士3-5年

阿里云计算有限公司
不需要融资 · 10000人以上

工作地址

鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
3.5-6.5万元/月
算法工程师3-5年硕士发表算法相关优秀论文C/C++图像算法深度学习大模型算法算法工程化经验参加算法相关竞赛/获奖模型加速/性能优化Python
杭州 西湖区
2-4万元/月
算法工程师1-3年本科语音算法搜索算法分布式训练深度学习大模型算法自然语言处理算法多模态算法算法工程化经验并行计算优秀开源项目经历推荐算法SQL发表算法相关优秀论文C/C++强化学习Pytho
杭州 西湖区







