第 5 章 · 日常运维 SOP
本章目标:沉淀 日/周/月巡检、结构化日志、容量信号、变更单 与值班升级路径;可直接作为 demo-mall 团队 SOP 模板;结合小紫 AI 运维助手 提升巡检效率。
学时建议:2~2.5 小时(含 1 小时跟练)
前置:ops-deploy ch07 可观测性(可先读本章表格,ch07 补告警细节);小紫云计算 全菜单熟悉度。
5.1 场景说明
| 项目 | 内容 |
|---|---|
| 背景 | demo-mall prod 已上线;运维需每日 09:00 巡检,避免「用户先于我们发现问题」 |
| 痛点 | 巡检靠记忆,漏看备份;生产发布无变更单被审计点名 |
| 你的角色 | 值班运维(第一周 On-call 见习) |
| 本章任务 | 完成一轮 8 项日检;用 AI 助手拉 ERROR 日志;填写完整变更单 |
| 约束 | prod 无变更单不发布;P0 15min 必须响应(详见 ch13) |
5.2 学完你能
| 能力 | 验收标准 |
|---|---|
| 日检 SOP | 独立完成 8 项并记录结果 |
| 日志规范 | 说出 prod 四级日志策略与 JSON 字段 |
| 容量信号 | 五项阈值对应动作与章节 |
| 变更单 | 填写含回滚命令的完整变更单 |
| 值班升级 | P0~P3 定义与升级路径 |
| AI 辅助 | 用 AI 运维助手生成巡检 Markdown 表 |
5.3 SOP 体系总览
| 类型 | 频率 | 负责人 | 产出 |
|---|---|---|---|
| 日检 | 每日 09:00 | 值班运维 | 巡检表 |
| 周检 | 每周一 | 运维负责人 | 容量+备份报告 |
| 月检 | 每月 | SRE | 证书、配额、成本 |
| 变更 | 按需 | 执行人+复核人 | 变更单 |
| 应急 | 事件驱动 | On-call | 故障报告(ch06) |
5.4 逐步跟练 · 第一步:每日巡检(约 40 分钟)
打开 运维 → 监控告警、集群管理、管理 → 备份恢复,按表逐项检查 prod-app:
| # | 检查项 | 入口 | 正常标准 | 异常处理 |
|---|---|---|---|---|
| 1 | 节点 Ready | 集群管理 → 节点 | 100% Ready | ch06 节点剧本 / ch13 |
| 2 | 核心 Deployment | 应用部署 → prod-app | Available=Desired | 查 Events / 日志 |
| 3 | Pod 重启 | 系统容器 → prod-app | 24h 重启 <3/服务 | OOM/探针 ch04 |
| 4 | PVC 使用率 | 存储 / Longhorn | <80% | 扩容 ch11 |
| 5 | 未处理告警 | 运维 → 监控告警 | P0/P1=0 | 按 runbook ch07 |
| 6 | 备份任务 | 管理 → 备份恢复 | 24h 内成功 | ch11 |
| 7 | 证书过期 | Ingress TLS 详情 | >30 天 | cert-manager 续期 |
| 8 | 镜像拉取 | Pod Events | 无 ImagePullBackOff | Registry / Secret |
AI 辅助话术(控制台 AI 运维助手):
按 demo-mall 日检表巡检 prod-app Namespace,输出 Markdown 表格,列:检查项、结果、备注。
你应该看到:8 行表格,异常项标红或附注;P0/P1 告警为 0 或已有工单号。
记录模板:
## 日检 2026-08-20 prod-app
| # | 项 | 结果 | 备注 |
|---|-----|------|------|
| 1 | 节点 | ✅ | 3/3 Ready |
| ... | ... | ... | ... |
| 签核 | 值班:张三 | 复核:李四 | |
5.5 逐步跟练 · 第二步:日志规范与排障(约 30 分钟)
prod 日志级别策略:
| 级别 | 用途 | prod 默认 |
|---|---|---|
| ERROR | 需人工介入 | 必采集 |
| WARN | 需关注 | 必采集 |
| INFO | 业务关键路径 | 采样或全量 |
| DEBUG | 排障 | 关闭(临时开需变更单) |
结构化 JSON 示例:
{
"ts": "2026-08-18T10:00:00Z",
"level": "ERROR",
"service": "demo-api",
"traceId": "a1b2c3d4",
"msg": "payment timeout",
"userId": "u***"
}
步骤:
- 系统容器 → demo-api Pod → 日志 → 筛选 ERROR
- 复制一行含
traceId的日志 - AI 助手:「统计 prod-app demo-api 最近 1 小时 ERROR Top5 消息」
你应该看到:ERROR 条数可计数;Top5 若含 payment timeout 可关联支付依赖(PaaS Redis/RabbitMQ)。
规范:userId 脱敏;日志保留 ≥30 天(合规见 架构 ch17)。