项目经历
角色:项目负责人
主导集团云原生平台建设与云上项目迁移工作,统筹技术选型、架构设计、跨团队协同与风险管控。负责集团云原生平台建设、云上项目迁移、CI/CD 体系建设、日志监控落地和云上安全防护工作。项目围绕老 k8s 集群项目迁移、新云原生项目建设、云下系统容器化改造、腾讯云 TSF(微服务平台)项目迁移四条路径展开,支撑集团业务系统向统一 K8S、DevOps 和 GitOps 体系迁移。
- 主导集团云原生平台建设,完成约 24 套业务系统、60 套环境的云上运行和统一管理,覆盖老 K8s 集群迁移、新项目落地、云下系统改造和 TSF 迁移等场景。
- 牵头完成老 k8s 集群项目迁移,累计迁移 9 个项目、19 套环境,保障迁移期间无重大业务中断。
- 支撑新云原生项目标准化落地,累计完成 10 个新项目、27 套环境建设,统一接入 K8S 集群、CI/CD、日志系统和 Prometheus,实现新项目上线初期即具备标准化部署、日志采集和监控告警能力。
- 完成云下传统系统容器化改造,梳理部署方式、依赖组件和数据存储,设计 CI/CD 流水线,实现从代码提交到 K8S 部署的自动化闭环。
- 完成腾讯云 TSF(微服务平台)项目迁移与平台初始化,负责资源采购、K8S 集群导入、应用初始化、部署组配置和迁移方案制定,并解决 ES 快照迁移、黑盒容器反复重启等复杂问题。
- 建设 GitOps 能力,完成 Coding、账号、Jenkins 项目迁移,通过 Gitlab CI 渲染 K8s YAML 和 Argocd 两种方式实现 K8S 集群部署环境一致性与变更可追溯。
- 完成 GitLab 平台和 Runner 组件搭建,打通构建服务器、镜像仓库与 K8S 集群链路,编写 GitLab CI/CD 标准化模板。同时部署并接入 Sonar 质量门禁,提升交付可信度与上线稳定性。
- 沉淀核心项目 CI/CD 模板,统一分支策略、构建流程、镜像命名和发布入口,累计为 26 个项目搭建 100 多条流水线。
- 优化生产发布稳定性,增加健康探针、优雅退出脚本和用户无感知发布配置,降低生产变更风险。
- 落地日志系统,制定统一采集规范,完成 22 个项目、56 个日志 Topic 接入,实现云上、云下、国内、海外系统日志的集中采集、检索和权限管控。
- 优化日志结构化和索引能力,通过正则提取 traceId、level、timestamp、message 等字段并建立索引,提升日志查询和故障定位效率。并在此基础上建设日志可视化和告警能力,实现 QPS、错误率、PV/UV、响应时间、Top 错误日志、接口超时等指标分析。
- 基于 Prometheus + Grafana 建设可观测体系,核心系统全部接入 APM 监控。
- 推进集团 WAF 和堡垒机的选型和规模化落地。
- 负责腾讯云、AWS、VMware、Confluence、JumpServer、Maven、Nacos、XXL-job、skywalking 等基础平台维护,参与堡垒机接入、权限审计、云资源治理、资产盘点、软件采购评估等平台运维工作。
- 实施 SRE 稳定性策略,提升集群自愈能力,降低误操作风险。
角色:项目基础建设负责人
主导基础设施架构设计与全生命周期交付,统筹协调 AWS 云资源、网络、安全、中间件及 DevOps 能力建设,保障平台高可用、低延迟、强合规的全球化服务能力。CWN (www.cargoworldnetwork.com) 是面向全球货代联盟成员的跨境业务协作平台,由美设国际集团主导建设,目标是为 GA 客户和联盟 Member 提供在线询报价、下单、货况追踪、船期查询、报表等能力。
- 承担 CWN 平台从测试到生产的基础设施建设,完成环境规划、网络打通、中间件部署、流水线、域名智能解析、SFTP 和基础运维能力落地。
- 参与设计 CWN 平台基础架构,支撑 GA 客户、联盟 Member、美设内部系统及第三方系统之间的业务连接。
- 落地 AWS 跨区域私有网络互联方案,通过 VPC Peering 打通跨区域 VPC,支撑跨大洲私网访问数据库与 Kafka。
- 负责跨区域路由、安全组、访问策略和连通性验证,降低公网暴露风险和跨境链路不稳定问题。
- 负责 CWN CI/CD 流水线设计,完成代码构建、镜像打包、制品推送、测试环境部署和生产发布流程配置。
- 完成域名智能解析方案配置,根据访问区域和业务链路规划解析策略,提升跨境访问体验。
角色:项目负责人
主导人脸识别平台从传统架构向云原生架构的平滑演进,完成核心模块容器化改造与 K8s 集群纳管。该平台主要用于存储和分析上游系统采集的员工图片信息。
- 通过使用 Docker 和 k8s 完成平台迁移,实现了系统的高可用性与弹性扩展,提升了平台的整体可靠性。
- 使用 Go 语言及 k8s kubebuilder 框架开发 Operator 云原生数据库,实现了数据库的自动化维护。
- 对"图像分片"和"图像分析"两个业务组件进行了云原生改造,结合 Shell 脚本和 k8s 的 CronJob 功能,实现了对这两个组件的动态状态维护。
- 使用 Python Flask 框架开发 k8s Webhook,实现自动注入 Sidecar 容器,并打通了 EFK 全流程的日志采集和分析能力。
负责交通银行人力资源系统的日常维护,确保系统的高可用性和数据安全,并支持项目的敏捷开发流程和 CI/CD。
- 维护并优化覆盖全行 100000+ 员工和退休职工的人资系统,确保系统的稳定性和性能。在任职期间,系统保持了 99.9% 的可用性。
- 实施基于 Gitlab 的分支管理策略,并配合自研的工程作业平台、云管平台和 IMMS 平台执行手动与自动化发布,确保发布的镜像和代码版本一致。
- 通过基于 Jenkins,配置容器化应用的部署流程,并通过 Canary 发布策略,减少了发布对生产环境的影响。同时通过实施自动化回归测试,覆盖了关键业务和 UI 接口,提升了系统发布的可靠性。
- 通过云管平台和制品库管理 Docker 镜像等制品,保障了部署过程中镜像版本的一致性和安全性。
- 通过 Docker 的多阶段构建和镜像优化技术,减少了应用容器的镜像体积,将容器启动时间缩短了 15%,同时提高了容器镜像的安全性。
- 通过 Cronjob 实施每日数据备份,并定期进行恢复测试,确保数据可恢复性达到 100%。
- 通过 K8s 的 HPA 动态扩缩,实现了系统资源的自动化调配,保证了在高峰期系统可以自动扩展,系统的容错性与可扩展性显著增强。
- 通过 K8s 的资源调度机制,优化了 Pod 的分配策略,确保在高负载的情况下系统资源的高效利用,达到了 95% 的资源使用率。
- 通过 Prometheus 和 Grafana 进行系统监控,设置了关键指标的告警机制并绑定交融通和内部邮箱,确保系统在出现异常情况时能够及时反应。
- 通过整合 EFK,确保所有 Pod 的日志可追溯性,极大提升排查效率。
教育背景
新西兰奥克兰大学(QS 65)
| 信息技术 | 全日制硕士
2023.06 - 2025.05
主修课程:Data Mining and Big Data 数据挖掘和大数据 (A+), Advanced Information Security 高级信息安全 (A), Software Tools and Techniques 软件工具和技术 (A-), IT Consultancy IT 咨询 (A-), Information Systems Research 信息系统研究 (A-) 等
上海建桥学院
| 计算机科学与技术 | 全日制本科
2010.09 - 2014.06
主修课程:数据库原理、操作系统、计算机网络、嵌入式 Linux、网络集成等
自我评价
我专注云原生运维方向,有从 0 到 1 主导企业云原生体系建设和百级流水线落地的完整经验,能够在复杂 IT 环境中提供稳定、高效的技术支持。
我注重细节与持续改进,善于结合业务需求和用户反馈优化系统功能,提升运维效率和用户体验。面对复杂问题和突发情况,我具备较强的分析判断和应急处理能力,能够在高压环境下快速制定有效方案。
同时,我关注 AI 技术在运维场景中的应用,推动运维工作向智能化、精细化发展。
未来希望继续发挥技术优势,助力企业 IT 基础设施优化、业务增长和数字化转型。