下载工作台
小紫云计算

集群管理、资源池与备份

试读上半部分 · 解锁后可读全文

第 6 章 · 集群管理、资源池与备份


场景说明

应用和系统容器都跑起来了,但出现三类「集群级」问题:

  1. Nginx NodePort 在节点上 curl 通,外网浏览器不通 → 多半是 节点防火墙
  2. MySQL PVC 扩容报错「存储池不足」→ 要看 资源池(Longhorn)
  3. 明天要做 kubeadm 升级,今晚必须先 备份 Namespace

本章走 管理 菜单:把集群从「能跑 Pod」变成「能对外、能存盘、能恢复、能观测」。


学完你能

能力说明
用集群管理调副本 / 重启原生资源视角
安装 metrics-server / Longhorn集群插件 + 巡检
放行 NodePort节点防火墙诊断
备份与恢复Namespace YAML、etcd 快照
扩容 PVC 前查池子资源池剩余容量

6.1 管理菜单一览

菜单作用
集群管理Namespace、Deployment 扩缩、Pod 删除、滚动重启
节点管理节点列表、标签、污点、Ready 与容量
节点扩缩容Worker 加入 / 缩容
节点防火墙NodePort 放行、对外访问诊断
备份恢复Namespace YAML、etcd 快照、定时策略
维修巡检控制面 / CNI / 监控 / HA 巡检与修复
集群插件metrics-server、Longhorn、Ingress 等
资源池Longhorn 存储池与磁盘配盘

6.2 跟练 A:新集群首检(巡检 + 插件)

目标:让 运维 → 集群监控 有 CPU / 内存指标。

步骤操作
1管理 → 维修巡检 → 一键巡检
2若提示 metrics-server 缺失 → 一键修复 或到 集群插件 安装
3可选:安装 Longhorn(后续 PVC 需要)
4回到 运维 → 集群监控 刷新

你应该看到什么

  • 巡检结果绿色或带可修复项
  • 监控页 节点 CPU / 内存 有百分比,不再仅提示「metrics-server 未就绪」
  • 集群插件 列表对应项状态为已安装或 Running

技巧

  • 国内环境:插件安装时可搜 国内镜像源(35+ 项)
  • 大镜像安装久:支持 后台继续,最长等待约 2 小时
  • Longhorn 配盘时可 排除 Master,仅 Worker 贡献磁盘

6.3 跟练 B:NodePort 外网不通

场景:第 4 / 5 章映射了 NodePort,本机浏览器超时。

步骤操作
1记录 NodePort 端口号与节点 IP
2管理 → 节点防火墙
3选择节点与端口 → 放行
4点击 诊断,查看 SSH 地址匹配、端口探测结果

你应该看到什么

  • 诊断通过:外网 http://节点IP:NodePort 可访问
  • 诊断失败:页内给出原因(SSH 不可达、端口仍被 iptables 拦等)

常见错误:只改 K8s Service 未改节点防火墙 — 系统容器、应用部署暴露 NodePort 后 务必在此验证


以下内容需解锁后阅读

试读已结束。解锁本章 ¥5.00,或开通年度会员畅读全部教程。
年度会员 ¥199.00/年; 小紫 AI 工作台有效会员 ¥99.00/年

正文仅在服务端鉴权后下发,未付费无法获取下半部分内容。