职位详情
岗位职责:
负责数据平台部门的故障运营管理相关工作,主要包括:牵头组织故障复盘会议、审核故障报告内容、跟踪故障待办事项进展、基于故障记录构建分析数据体系,以及推动稳定性文化的落地实施(如变更规范、定级标准、红黄线规则等)
任职要求:
故障管理与运营经验:
1、具有2年以上互联网或科技类企业运维、SRE、技术运营或相近岗位工作经验。
2、掌握互联网行业故障全生命周期管理流程,涵盖故障发现、应急响应、升级通报、复盘总结、整改推进及闭环管理等环节。
3、曾独立主导或深度参与重大故障复盘过程,熟练运用5Why、根因分析等分析方法。
数据分析与报告能力:
1、具备较强的数据分析与归纳能力,能从大量故障数据中识别关键问题、共性特征和发展趋势。
2、可独立完成故障分析报告的撰写、审阅与质量把控,确保报告结构严谨、原因清晰、改进方案具体且可落地。
3、有使用SQL、Excel/Google Sheets等工具进行数据处理,并借助BI平台(如Tableau)搭建和维护故障数据看板的实际经验。
技术理解与流程认知:
1、了解数据平台常用组件(如Hadoop、Spark、Kafka、Flink、OLAP引擎等),能够理解技术团队在复盘中的专业讨论。
2、熟悉软件开发流程与运维体系,对变更控制、监控告警、容量管理、高可用设计等稳定性保障机制有深入认知。
3、具备良好的流程制度编写与优化能力,能主导或参与《变更规范》《故障定级标准》《运维红黄线》等制度的制定与迭代。
综合素质要求(软技能):具备良好的沟通协调能力、推动执行能力,以及严密的逻辑思维和风险防范意识
负责数据平台部门的故障运营管理相关工作,主要包括:牵头组织故障复盘会议、审核故障报告内容、跟踪故障待办事项进展、基于故障记录构建分析数据体系,以及推动稳定性文化的落地实施(如变更规范、定级标准、红黄线规则等)
任职要求:
故障管理与运营经验:
1、具有2年以上互联网或科技类企业运维、SRE、技术运营或相近岗位工作经验。
2、掌握互联网行业故障全生命周期管理流程,涵盖故障发现、应急响应、升级通报、复盘总结、整改推进及闭环管理等环节。
3、曾独立主导或深度参与重大故障复盘过程,熟练运用5Why、根因分析等分析方法。
数据分析与报告能力:
1、具备较强的数据分析与归纳能力,能从大量故障数据中识别关键问题、共性特征和发展趋势。
2、可独立完成故障分析报告的撰写、审阅与质量把控,确保报告结构严谨、原因清晰、改进方案具体且可落地。
3、有使用SQL、Excel/Google Sheets等工具进行数据处理,并借助BI平台(如Tableau)搭建和维护故障数据看板的实际经验。
技术理解与流程认知:
1、了解数据平台常用组件(如Hadoop、Spark、Kafka、Flink、OLAP引擎等),能够理解技术团队在复盘中的专业讨论。
2、熟悉软件开发流程与运维体系,对变更控制、监控告警、容量管理、高可用设计等稳定性保障机制有深入认知。
3、具备良好的流程制度编写与优化能力,能主导或参与《变更规范》《故障定级标准》《运维红黄线》等制度的制定与迭代。
综合素质要求(软技能):具备良好的沟通协调能力、推动执行能力,以及严密的逻辑思维和风险防范意识
2026-09-04 15:13
IP属地:北京
职位福利
大专1-3年大数据运维经验

北京联和利泰科技股份有限公司
不需要融资 · 1000-9999人

工作地址

鱼泡安全保障
如遇到办证收费、刷单、传销、诱导买车等违规行为,请立即向鱼泡直聘投诉举报投诉举报 >

附近适合您的职位
1.5-1.8万元/月
运维工程师5-10年本科VMwareDocker系统运维运维开发/DevOpsIAASOpenstackPython/Shell私有云英语运维经验Kubernetes
北京 海淀区










