招聘公告 · 职位检索 · 央国企/事业单位/名企

资深系统运维工程师(SRE方向)

单位:网易类别:技术类型:社招地点:杭州市更新:2026-09-24

岗位信息

招聘单位网易
部门/事业群技术保障部
所属产品网易职能
工作地点杭州市
学历要求本科
经验要求5-10年
招聘人数1
官方更新时间1789724968000

职位描述

1、负责基础设施日常运维,包括 NAS 存储、AD 域控、OpenStack/VM/K8s 虚拟化与容器编排平台的集群管理、扩容、故障排查与性能调优,保障服务链路不中断;

2、定义并跟踪系统 SLO/SLI(设备可用性、服务响应延迟等),控制错误预算,通过混沌工程(ChaosBlade/LitmusChaos 等)、灾备演练提升系统韧性;

3、使用 Terraform/Ansible 实现基础设施即代码(IaC),开发 Python/Go 自动化工具覆盖部署、配置、巡检、故障自愈全流程,减少人工操作;

4、建设并维护全链路可观测性体系,整合 Prometheus/Grafana + ELK(或 OpenSearch/Loki)栈,覆盖指标、日志、链路追踪,实现从基础设施到业务层的全链路监控,确保故障及时发现、快速响应;

5、参与虚拟化与容器编排平台优化,主导容量规划与资源调度优化,在保障性能前提下降低硬件与资源成本;

6、负责核心数据库及中间件(MySQL、PostgreSQL、Redis、ES、O2)的日常运维支撑,熟悉 OWL2 运维管控平台,能独立完成配置管理、版本升级、备份恢复、性能分析等日常操作;

7、响应用户及项目需求,与游戏/网络/IT 团队紧密协作,输出系统层技术支持与运维解决方案,推动跨部门协作事项落地;

8、探索并实践 AI 辅助运维,利用大模型提升故障诊断、脚本开发、日志分析等场景效率;

9、持续优化运维流程,建立技术文档与团队知识库,关注业界前沿动态。

任职要求

1、计算机相关专业本科及以上学历,5 年以上 SRE / 系统运维经验,游戏行业 SRE 运维经验、熟悉游戏研发生产流程者优先;

2、熟练运维 NAS 存储、AD 域控、OpenStack/VM 虚拟化平台,有 K8s 容器编排平台管理经验者优先;

3、熟练使用 Terraform/Ansible,具备 IaC 落地经验,了解 GitOps(ArgoCD/Flux)等云原生交付流程者优先;

4、熟练使用 Prometheus/Grafana 体系,熟悉 Zabbix 等传统监控平台,能独立设计监控指标与告警策略,有全链路可观测性(指标 + 日志 + 链路追踪)建设经验者优先;

5、精通 Python/Go 任一编程语言,能独立开发复杂自动化脚本与工具;

6、具备 MySQL/PostgreSQL/Redis/ES/O2 等数据库及中间件的基本运维能力,熟悉 OWL2 平台;

7、自驱力强,具备良好的跨团队沟通与项目推动能力,较强的学习能力与简报输出能力,可接受必要的线上应急响应;

8、有 AI Coding / AI 辅助运维实践经验优先。