核心优势
9 年+基础设施与稳定性工程经验
3 年+专注运维开发平台建设,以 Go 为核心语言主导从 0 到 1 构建 CI/CD 调度引擎、可观测性体系与自动化运维平台,推动运维从"人力驱动"向"平台驱动"转型
SRE 方法论落地
建立 SLO/SLI 指标体系与故障分级机制,推动可用性从 99.5% 提升至 99.9%(实际达成);主导跨机房容灾方案设计,RPO <5min / RTO <30min
平台工程实践
自研 Go 运维开发平台,覆盖 CI/CD 调度、日志采集、监控 SDK、运维 API 全链路,20+ 运维操作平台化,运维操作效率 ↑80%,人力成本 ↓40%
NPDP + ACP 双认证
兼具产品思维与敏捷管理能力,擅长将业务需求转化为可落地技术方案
技术输出
独立撰写《现代运维实践指南》电子书(25 篇 / 28 万字),覆盖 SRE、可观测性、混沌工程、平台工程、FinOps 全场景
技术博客
独立运营「SRE 工程实践」博客站(sre.wang),持续输出 SRE、云原生、Linux 内核、容器编排、可观测性、自动化等领域实战文章,中英文双语同步发布
技术栈
💻 语言
📦 容器 & 编排
🔄 CI/CD & GitOps
📊 可观测性
💾 数据 & 中间件
🛠️ IaC & 自动化
☁️ 云 & 安全
工作经历
为多家企业客户规划并落地 DevOps 平台,覆盖 CI/CD、可观测性、微服务治理与容灾体系。
180,000+ 运营车辆 | 200+ 城市 | 8,700+ 企业客户
9 年电商运营,从零搭建 5 家企业电商项目,团队 30 人,年销售额合计 5,000万+。2017 年转型技术领域,业务视角成为后续运维平台建设的独特优势。
项目经历
- 技术选型:Go(高并发、单二进制部署、跨平台),采用 Gin + gRPC 微服务架构
- CI/CD 调度引擎:基于 DAG 任务编排,支持并行/串行/条件分支,插件化扩展
- 可观测性 SDK:日志采集 Agent + Metrics 上报 + 分布式链路追踪(Prometheus + Jaeger)
- 运维 API 平台:20+ 运维操作 RESTful 化,前端 Web 界面
- 容灾方案:跨机房容灾架构,数据同步 + 自动故障切换
- 120+ 微服务 Docker 化 + K8s 迁移,Jenkins Pipeline 重构 CI/CD
- 3 个月完成全量迁移零故障,扩缩容 25min → 1min,发布效率 ↑50%
- 安全基线加固、最小权限管控、漏洞扫描、应急响应 SOP
- 高危漏洞发现即修复率 100%,安全事件 ↓80%,通过等保 2.0 审计
- 引入蓝鲸平台,主导 GitLab + K8s 集成适配,标准化 30+ 作业流程
- 提前 2 个月交付,产研效率 ↑30%
技术输出
《现代运维实践指南》—— 独立撰写
2026.06 — 至今 | 持续更新
融合谷歌 SRE 核心理念,覆盖运维与安全全场景的系统性技术专著。25 篇 · 28 万字 · 7 大模块
SRE 体系 · 可观测性 · 云原生 & 平台工程 · 安全 & 合规 · 混沌工程 · AIOps · FinOps
「SRE 工程实践」博客 —— 独立运营
2023.12 — 至今 | 持续更新
独立运营 SRE 技术博客(sre.wang),持续输出 SRE、Linux 内核、容器编排、可观测性、自动化等领域实战文章。中英文双语同步发布
SRE 基础 · 监控告警 · 容器化部署 · 云原生 · Linux 系统运维 · 自动化脚本 · CI/CD · IaC
教育 & 证书
🎓 大专
平职学院 · 机电一体化
2004 — 2007
🏆 NPDP
产品经理认证
2023 年
📜 ACP
敏捷项目管理认证
2022 年
联系方式
扫码添加微信,欢迎交流