职位详情
岗位职责:
1、持续评估并优化现有监控体系的覆盖范围及告警质量,提升告警准确率与有效性,降低误报和漏报情况,推进告警向精准化、智能化方向演进。
2、统筹外包团队开展7×24小时监控值守工作,制定值班规则与标准操作流程(SOP),并监督执行落地。
3、定期牵头召开告警评审会议,协同开发、运维等相关方优化告警触发条件与判断逻辑。
4、在重大线上故障中担任应急指挥角色,协调多方资源推动业务快速恢复;主导或深度参与各级故障复盘,确保根因分析深入彻底,杜绝形式化归因。
5、输出高质量的故障复盘文档,清晰记录整改任务、责任人及完成时限,强效跟进各项改进措施的实施进度,构建问题闭环管理机制。
6、搭建并完善涵盖监控管理、故障响应、事后复盘的全链路运维管理体系,推动应急预案、运维规范及知识库建设,全面提升团队应急处置效率。
7、通过关键指标数据分析(如MTTR平均修复时间、故障频次等)评估流程改进成效,并据此持续迭代优化工作机制。
8、负责外包值班团队的工作质量监督与绩效考核,提供技术指导与培训支持,系统性提升团队专业能力。
9、发挥桥梁作用,高效联动产品、研发、测试、运维等多方角色,协同保障系统稳定运行。
岗位要求:
1、计算机类相关专业本科及以上学历;具备5年以上互联网或软件行业运维/SRE/技术支持工作经验,其中至少包含2年团队管理或外包团队协作经验,有大型系统运维实践者优先。
2、拥有丰富的大型系统线上故障排查与处理经验,曾担任故障应急指挥角色者优先考虑。
3、熟练掌握Zabbix、Prometheus、Grafana、Open-Falcon、Nightingale等至少一种主流监控工具的技术原理,具备策略调优能力。
4、熟悉容器技术(Docker/K8s)及常用中间件(Nginx/Redis/Kafka/MQ)的运行机制,掌握Shell/Python/Go等至少一门脚本语言,可独立编写自动化脚本解决常规问题。
5、思维敏捷,条理清晰,擅长逻辑推理与抽象建模,具备出色的沟通协调能力和团队合作意识,同时具有较强的文档撰写与数据整理分析能力。
6、具备高度自我驱动力,责任心强,目标导向明确,善于跨团队推动事项落地,能在高压环境下保持高效工作状态。
1、持续评估并优化现有监控体系的覆盖范围及告警质量,提升告警准确率与有效性,降低误报和漏报情况,推进告警向精准化、智能化方向演进。
2、统筹外包团队开展7×24小时监控值守工作,制定值班规则与标准操作流程(SOP),并监督执行落地。
3、定期牵头召开告警评审会议,协同开发、运维等相关方优化告警触发条件与判断逻辑。
4、在重大线上故障中担任应急指挥角色,协调多方资源推动业务快速恢复;主导或深度参与各级故障复盘,确保根因分析深入彻底,杜绝形式化归因。
5、输出高质量的故障复盘文档,清晰记录整改任务、责任人及完成时限,强效跟进各项改进措施的实施进度,构建问题闭环管理机制。
6、搭建并完善涵盖监控管理、故障响应、事后复盘的全链路运维管理体系,推动应急预案、运维规范及知识库建设,全面提升团队应急处置效率。
7、通过关键指标数据分析(如MTTR平均修复时间、故障频次等)评估流程改进成效,并据此持续迭代优化工作机制。
8、负责外包值班团队的工作质量监督与绩效考核,提供技术指导与培训支持,系统性提升团队专业能力。
9、发挥桥梁作用,高效联动产品、研发、测试、运维等多方角色,协同保障系统稳定运行。
岗位要求:
1、计算机类相关专业本科及以上学历;具备5年以上互联网或软件行业运维/SRE/技术支持工作经验,其中至少包含2年团队管理或外包团队协作经验,有大型系统运维实践者优先。
2、拥有丰富的大型系统线上故障排查与处理经验,曾担任故障应急指挥角色者优先考虑。
3、熟练掌握Zabbix、Prometheus、Grafana、Open-Falcon、Nightingale等至少一种主流监控工具的技术原理,具备策略调优能力。
4、熟悉容器技术(Docker/K8s)及常用中间件(Nginx/Redis/Kafka/MQ)的运行机制,掌握Shell/Python/Go等至少一门脚本语言,可独立编写自动化脚本解决常规问题。
5、思维敏捷,条理清晰,擅长逻辑推理与抽象建模,具备出色的沟通协调能力和团队合作意识,同时具有较强的文档撰写与数据整理分析能力。
6、具备高度自我驱动力,责任心强,目标导向明确,善于跨团队推动事项落地,能在高压环境下保持高效工作状态。
2026-07-18 14:28
IP属地:北京
职位福利
本科5-10年

中电信人工智能科技(北京)有限公司
不需要融资 · 1000-9999人

工作地址

鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >











