职位详情
岗位职责
●Kubernetes运维–设计、运行并优化AWS、GoogleCloud以及本地多集群的大规模
Kubernetes环境;根据需要扩展至Azure或OracleCloud。
●InfrastructureasCode–使用Terraform/Pulumi管理全部基础设施,遵循GitOps工作
流。
●CI/CD–维护自动化构建与发布流水线,实现安全回滚。
●GPU集群管理–负责NVIDIA驱动、MIG分区、自动扩缩容及固件更新;如有需要,支持
AMDGPU。
●可观测性–运营并扩展Prometheus+Grafana,制定SLI/SLO,并自动化容量监控。
●事故响应–参与值班轮值,主导事后复盘,持续完善运行手册。
●标准化与赋能–建立统一的SRE流程,向团队传授最佳实践。
任职要求
●精通Kubernetes内核及大规模集群运维,包含云端与本地部署。
●熟练掌握AWS和GoogleCloud;了解Azure或OracleCloud或Lambda、Nebius等
GPU云更佳。
●精通Terraform、GitOps工具(ArgoCD等)以及CI/CD流水线。
●深入理解Linux系统与网络原理。
●具备NVIDIAGPU集群管理经验;熟悉AMD/ROCm体系者优先。
●熟练使用Prometheus与Grafana栈并能应对大规模场景。
●良好的中英文书面与口头沟通能力,能适应跨时区协作。
●Kubernetes运维–设计、运行并优化AWS、GoogleCloud以及本地多集群的大规模
Kubernetes环境;根据需要扩展至Azure或OracleCloud。
●InfrastructureasCode–使用Terraform/Pulumi管理全部基础设施,遵循GitOps工作
流。
●CI/CD–维护自动化构建与发布流水线,实现安全回滚。
●GPU集群管理–负责NVIDIA驱动、MIG分区、自动扩缩容及固件更新;如有需要,支持
AMDGPU。
●可观测性–运营并扩展Prometheus+Grafana,制定SLI/SLO,并自动化容量监控。
●事故响应–参与值班轮值,主导事后复盘,持续完善运行手册。
●标准化与赋能–建立统一的SRE流程,向团队传授最佳实践。
任职要求
●精通Kubernetes内核及大规模集群运维,包含云端与本地部署。
●熟练掌握AWS和GoogleCloud;了解Azure或OracleCloud或Lambda、Nebius等
GPU云更佳。
●精通Terraform、GitOps工具(ArgoCD等)以及CI/CD流水线。
●深入理解Linux系统与网络原理。
●具备NVIDIAGPU集群管理经验;熟悉AMD/ROCm体系者优先。
●熟练使用Prometheus与Grafana栈并能应对大规模场景。
●良好的中英文书面与口头沟通能力,能适应跨时区协作。
2025-10-25 07:29
IP属地:北京

北京茁瑞科技有限公司

工作地址

鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
1.5-3万/月
运维工程师3-5年本科GolangJava大数据运维经验运维开发/DevOps运维开发经验自动化运维Python/Shell
北京 朝阳区
1.5-2.5万/月
运维工程师3-5年本科网络运维实施交付运维通信相关专业大数据运维经验系统运维Python/Shell计算机相关专业网络安全相关经验运维经验
北京 朝阳区







