高级运维工程师 (SRE)
产品研发找几位想 "把大规模集群运维做到极致" 的伙伴
云计算基础设施算力调度
工作地点:北京
我们不信 "运维就是救火值班" 那套 —— 在这里,你要思考的是 "大规模 K8s 集群" 怎么从百节点走向更高可用、Golang 怎么把重复劳动沉淀成自动化平台与工具链、全链路监控怎么把隐患拦在故障爆发之前。希望你用热爱理解技术,用脑洞拆解场景,用执行力把 "未来可能这样" 变成 "现在就能用"。
岗位职责
- 1负责大规模 Kubernetes 集群及底层基础设施的架构设计、自动化部署、日常维护与容量规划。
- 2负责自动化运维平台及工具链的开发(主要使用 Golang),提升集群交付与设备硬件测试验证的效率。
- 3负责全链路监控体系建设、复杂故障排查(涉及系统内核、网络协议栈等)与应急响应,保障基础设施高可用。
任职要求
- 1深入理解 Kubernetes 架构与核心组件原理,具备大规模(百节点以上)生产环境的实战经验,熟练掌握 K8s 故障排查。
- 2熟练掌握 **Golang** 或 Python,能够独立开发各类自动化运维脚本、Operator 或 API 网关服务。
- 3扎实的网络基础,熟悉容器网络(如 Cilium, Calico),了解数据中心网络架构(如 BGP, Spine-Leaf 拓扑)。
- 4熟悉 Linux 系统底层原理,精通 Shell 脚本,熟练使用常见的 CI/CD 及云原生生态工具。
在这儿你会收获
- 深度参与大规模 K8s 集群与底层基建架构落地,沉淀云原生高可用运维、容量规划与生产故障应急实战能力。
- 基于 Go 开发运维自动化平台与工具链,提升运维工程化、平台化研发能力。
- 搭建全链路监控体系,深耕 Linux 内核、数据中心网络、容器网络问题排查,强化复杂疑难问题定位解决能力。