搜索
登录注册

职位详情

核心职责:

1. 硬件与数据中心运维
负责服务器(x86/GPU)、网络设备、存储阵列的安装部署、运行监控、故障定位及性能调优
维护数据中心基础环境(供电/散热/布线),制定并实施硬件容灾策略(多节点冗余设计、备件热替换)
通过 IPMI/iDRAC/BMC 实现远程硬件管控,定期更新固件与驱动版本

2. 云原生与K8S运维
搭建并维护大规模K8S集群(涵盖裸金属与虚拟化混合架构),优化资源调度机制与容器运行效率
解决 GPU/NVMe/RDMA 等专用硬件在K8S环境中的适配问题,开发Device Plugin以扩展设备支持能力
构建 CI/CD 流水线,实现算法模型的自动发布与硬件资源的动态调配

3. 自动化与监控体系
编写自动化脚本(Python/Go/Ansible),完成硬件配置管理、日志采集与告警响应
建设统一监控系统(Prometheus+Zabbix),全面覆盖硬件状态(温度/功耗)与K8S集群健康度
研发运维工具链,支持硬件故障自恢复与K8S集群弹性伸缩

4. 跨团队协作
协助算法团队优化训练任务执行效率,排查分布式训练(PyTorch DDP/MPI)中的底层资源瓶颈
联合安全团队落地硬件级防护措施(固件完整性校验、带外管理网络隔离)

任职要求:
硬性技能

硬件层:
具备3年以上服务器及数据中心运维经验,深入理解 x86/GPU 架构与常见故障处理流程
掌握网络协议(TCP/IP/VLAN)和存储技术(RAID/NAS/SAN)的基本原理与应用

软件层:
熟练运维 K8S 集群(网络/存储/安全策略配置),持有CKA/CKAD认证者优先考虑
至少掌握一种编程语言(Python/Go/Shell),可独立开发自动化运维工具
熟悉基础设施即代码理念(IaC),具备 Terraform/Ansible 实践经验

加分项
有 AI或大数据平台 运维背景,了解 NVIDIA GPU-Operator 或 Kubeflow 技术栈
知晓主流算法框架(TensorFlow/PyTorch)对硬件资源的需求特点
获得 RHCE/NVIDIA/CCNP 等相关技术认证

软性素质
具备系统化思考能力,能兼顾硬件可靠性与云原生迭代速度
注重技术文档沉淀,善于与不同团队高效协作

我们提供:
技术挑战:深度参与AI算力基础设施建设,接触混合云与边缘计算等前沿场景
福利体系:五险一金、年度体检、带薪年假、技术培训等
2025-12-13 14:39
IP属地:湖北武汉

职位福利

本科3-5年网络运维Docker硬件大数据运维经验系统运维K8S桌面运维计算机相关专业网络安全相关经验运维经验IDC机房运维Kubernetes
企业发布信息图
北京数慧时空信息技术有限公司
未融资 · 100-499人
鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >
下载鱼泡直聘APP

附近适合您的职位

5-7千/月
运维工程师1-3年大专光传输otn
武汉 江夏区
7千-1万/月
运维工程师1-3年学历不限SQLOracleSQL ServerMySQL系统运维应用运维
武汉 江夏区
4-6千/月
运维工程师经验不限大专实施交付运维
武汉 江夏区
运维工程师
300-500元/天
兼职运维工程师1-3年大专实施交付运维网络安全相关经验
武汉 江夏区
1.2-1.3万/月
运维工程师3-5年大专openstack
武汉 江夏区
4-5千/月
运维工程师经验不限大专电工证空调专业机房运维电子/电气/自动化相关专业制冷证
武汉 江夏区
4-5千/月
运维工程师经验不限学历不限网络运维实施交付运维系统运维
武汉 江夏区
6千-1万/月
运维工程师3-5年本科ERP系统MES系统PLM系统CRM系统SQL Server
武汉 江夏区
8千-1.1万/月
运维工程师5-10年本科DBA运维开发/DevOps故障分析电站Python/Shell光伏数据开发实施交付运维MySQL/Oracle大数据运维经验风电系统运维运维开发经验
武汉 江夏区
4-5千/月
运维工程师1年以下中专/中技机房运维
武汉 江夏区