让运维职责清晰可见
规划部署之后的工作。
应用上线会带来实际问题:谁可以修改环境,哪些信号提示故障,服务应如何恢复?在配置基础设施或调整发布流程之前,我们先审查应用及其依赖关系。工作范围会明确日常任务,以及需要处理问题时由谁负责响应。
可以从计划上线、服务器迁移,或现有配置中的运行问题开始。
云基础设施搭建
根据软件依赖的服务,配置应用环境、网络与访问控制。记录配置方式,并考虑预期资源使用量和未来配置变更。
- 应用环境
- 网络与访问配置
- 基础设施文档
CI/CD 与部署流程
建立可重复执行的发布流程,纳入适合应用的构建步骤、检查与审批。明确环境之间的流转方式,以及在可行时如何恢复到先前版本。
- 构建与发布流水线
- 发布检查与审批
- 回滚规划
服务器管理
组织服务器配置、系统维护和运行监控。约定哪些告警重要、由谁接收,以及如何调查应用或基础设施问题。
- 服务器配置
- 监控与告警处理
- 维护程序
迁移、备份与恢复
规划应用和数据迁移,并纳入验证与备用步骤。配置约定的备份流程,按照范围内的场景检查恢复程序。
- 应用与数据迁移
- 备份配置
- 还原与恢复检查
发布流程示例
让每次部署都有可复核的路径。
设想一个目前通过手动服务器命令部署的应用。发布流水线可以构建版本、执行约定检查,再将其放入审查环境。完成必要审批后才部署到生产环境。监控与回滚说明会提前准备,数据库变更则另行制定处理方式。
- 区分开发环境与生产环境权限。
- 明确允许发布所需的检查和审批。
- 考虑无法仅靠恢复代码撤销的变更。
- 构建使用约定的代码版本创建发布包。
- 验证执行检查并审查准备好的应用。
- 部署将获批版本发布到生产环境。
- 监控检查系统信号并调查异常变化。
此处为部署流程示意;检查、审批和恢复选项取决于具体应用。
基础设施交付
交付运维团队能够理解的配置。
通过验证与文档,让实施成果与负责使用它的人员衔接起来。
审查环境
梳理应用、数据存储、依赖和访问。讨论发布频率、恢复需求及反复出现的问题,以确定优先级与限制条件。
您将获得的成果环境评估与工作计划配置与检查
实施约定的基础设施、发布流程和监控。检查访问、部署和恢复场景,并记录与运营相关的结论。
您将获得的成果已配置环境与验证记录记录责任分工
准备日常任务、告警和变更操作说明。约定您的团队及持续支持服务各自的责任,包括支持覆盖范围和升级处理安排。
您将获得的成果运维指南与明确的支持范围
能否改进现有云或服务器配置?
可以。我们审查现有环境和您希望解决的问题。工作可以聚焦当前环境中的配置、部署自动化、监控或备份。只有需求足以支持时,才考虑迁移。
不重建应用,能否自动化部署?
在某些情况下,可以围绕现有构建和发布流程引入部署自动化。定义工作之前,需要审查应用配置、数据变更和外部依赖。
持续服务器管理包含什么?
范围可以涵盖约定的维护、监控和问题调查。访问、责任、覆盖范围和升级处理会针对环境记录在案。备份安排、恢复预期和任何服务级别,都需要在协议中明确。
您的下一步
您的应用环境需要改变什么?
请介绍现有配置、计划发布内容或反复出现的问题。我们可以定义所需的基础设施工作。
