第 6 章 · 集群管理、资源池与备份
场景说明
应用和系统容器都跑起来了,但出现三类「集群级」问题:
- Nginx NodePort 在节点上
curl通,外网浏览器不通 → 多半是 节点防火墙; - MySQL PVC 扩容报错「存储池不足」→ 要看 资源池(Longhorn);
- 明天要做 kubeadm 升级,今晚必须先 备份 Namespace。
本章走 管理 菜单:把集群从「能跑 Pod」变成「能对外、能存盘、能恢复、能观测」。
学完你能
| 能力 | 说明 |
|---|---|
| 用集群管理调副本 / 重启 | 原生资源视角 |
| 安装 metrics-server / Longhorn | 集群插件 + 巡检 |
| 放行 NodePort | 节点防火墙诊断 |
| 备份与恢复 | Namespace YAML、etcd 快照 |
| 扩容 PVC 前查池子 | 资源池剩余容量 |
6.1 管理菜单一览
| 菜单 | 作用 |
|---|---|
| 集群管理 | Namespace、Deployment 扩缩、Pod 删除、滚动重启 |
| 节点管理 | 节点列表、标签、污点、Ready 与容量 |
| 节点扩缩容 | Worker 加入 / 缩容 |
| 节点防火墙 | NodePort 放行、对外访问诊断 |
| 备份恢复 | Namespace YAML、etcd 快照、定时策略 |
| 维修巡检 | 控制面 / CNI / 监控 / HA 巡检与修复 |
| 集群插件 | metrics-server、Longhorn、Ingress 等 |
| 资源池 | Longhorn 存储池与磁盘配盘 |
6.2 跟练 A:新集群首检(巡检 + 插件)
目标:让 运维 → 集群监控 有 CPU / 内存指标。
| 步骤 | 操作 |
|---|---|
| 1 | 管理 → 维修巡检 → 一键巡检 |
| 2 | 若提示 metrics-server 缺失 → 一键修复 或到 集群插件 安装 |
| 3 | 可选:安装 Longhorn(后续 PVC 需要) |
| 4 | 回到 运维 → 集群监控 刷新 |
你应该看到什么
- 巡检结果绿色或带可修复项
- 监控页 节点 CPU / 内存 有百分比,不再仅提示「metrics-server 未就绪」
- 集群插件 列表对应项状态为已安装或 Running
技巧
- 国内环境:插件安装时可搜 国内镜像源(35+ 项)
- 大镜像安装久:支持 后台继续,最长等待约 2 小时
- Longhorn 配盘时可 排除 Master,仅 Worker 贡献磁盘
6.3 跟练 B:NodePort 外网不通
场景:第 4 / 5 章映射了 NodePort,本机浏览器超时。
| 步骤 | 操作 |
|---|---|
| 1 | 记录 NodePort 端口号与节点 IP |
| 2 | 管理 → 节点防火墙 |
| 3 | 选择节点与端口 → 放行 |
| 4 | 点击 诊断,查看 SSH 地址匹配、端口探测结果 |
你应该看到什么
- 诊断通过:外网
http://节点IP:NodePort可访问 - 诊断失败:页内给出原因(SSH 不可达、端口仍被 iptables 拦等)
常见错误:只改 K8s Service 未改节点防火墙 — 系统容器、应用部署暴露 NodePort 后 务必在此验证。