岗位介绍:
负责关键业务系统与基础设施的稳定性、可观测性、自动化与运维效率,用工程化方式管监控、变更、故障与性能,推动 SLO/SLI,持续降故障影响和人工 toil。
你会做:
建设监控/告警/日志/链路,加快发现与定位
定义并落地 SLO/SLI/错误预算,用数据驱动可用性与容量优化
高可用与容灾、故障响应与 RCA 闭环;On-call 重大事件
用代码和自动化管配置、发布、扩缩容,减少重复劳动
(加分方向)Splunk 平台架构、数据采集解析与可观测能力建设
我们希望你有:
5 年+ SRE / DevOps / 平台 / 基础设施相关经验
扎实 Linux + 网络,熟悉分布式架构排障与性能分析
亲手搭过可观测性体系;Python / Go / Shell 自动化
至少一项:CI/CD、配置管理、容器或云基础设施,变更风险可控
中英文沟通顺畅,能扛 On-call 和快节奏协作
加分: 大规模分布式可靠性 / SLO 体系、Splunk 集群与 SPL、K8s/中间件高可用、Prometheus/Grafana/OTel、制造业或汽车行业 SRE 经验