跳至内容
下卷:运维管理

下卷:运维管理

本卷导读:下卷面向 DBA、平台工程师与生产负责人,沿着“规划交付—高可用与备份—安全接入—可观测运营—迁移升级—事故恢复与复盘”的路径,把 PostgreSQL 知识转化为可持续运行的数据库服务能力。

本卷定位

从生产服务规划到日常运营、事故恢复与改进

本页是位于顶层导航中的导读与索引页,不是章节父目录。下面各章仍与本页并列,使用独立的顶层 URL;读者既可以按本卷路径顺序学习,也可以直接进入任意章节。

本卷索引

第四篇:规划——建设可交付的 PostgreSQL 服务

ch19 开天辟地:环境规划与部署基线

从工作负载、服务目标和责任边界出发,规划并验收 L2 生产仿真环境,而不是从一份默认配置开始。

ch20 狡兔三窟:高可用拓扑与容灾目标

把复制、选主、故障域和业务 RPO/RTO 连接起来,通过一次可重复的切换演练证明高可用。本章同时作为全书架构型样章。

ch21 未雨绸缪:备份体系与恢复演练

从恢复目标反推备份、WAL 归档、保留和异地策略,并用隔离恢复证明备份可用。

ch22 四通八达:服务接入、连接池与路由

让客户端连接到“具有明确语义的服务”,而不是某台机器;掌握连接预算、池化模式、读写路由与失效行为。

ch23 固若金汤:认证、授权与数据安全

从威胁模型出发建立身份、最小权限、传输保护、行级安全与审计;把连接池会话语义纳入安全设计。

ch24 纲举目张:SLO、SOP 与组织治理

在建设告警之前定义“什么算服务正常、谁负责、证据在哪里、发生变化如何处置”,产出 ch25 的观察与告警契约。

第五篇:运营——用证据驱动日常维护与演进

ch25 望闻问切:监控体系与可观测诊断

实现 ch24 的观察契约,把指标、日志、SQL 统计和告警连接为可行动的诊断系统,而不是堆叠面板。

ch26 胸有成竹:容量规划与压测基线

用可复现工作负载测量资源需求、噪声与余量,形成容量模型;不把一次 pgbench 数字包装成普适性能。

ch27 精益求精:参数调优与资源治理

以已证实的瓶颈为起点,理解参数的资源机制、作用域和变更风险;拒绝无上下文的“万能参数模板”。

ch28 除旧布新:VACUUM、冻结与膨胀治理

把 MVCC 留下的空间债、事务年龄和索引完整性变成可预测的维护工作,并完成分区生命周期触点。

ch29 移花接木:逻辑复制、迁移与异构同步

理解逻辑复制、CDC 和数据搬迁的状态机,用校验与可回退切换完成迁移,而不是把“数据能流动”误当成迁移成功。

ch30 推陈出新:版本升级与回滚策略

把升级视为应用、数据库、扩展、排序规则和平台共同参与的迁移项目,通过彩排决定前滚或回退。

第六篇:出山——按响应目标演练恢复与改进

ch31 事件分级、现场保护与应急决策——枕戈待旦

建立所有事故共用的指挥、保护、取证、变更与升级框架;兼顾单人值守和团队协同,并学会怀疑第一个症状。

ch32 PITR 与误操作恢复——妙手回春

在隔离环境中确定恢复目标、执行 PITR、验证业务正确性并安全回切。本章同时作为全书事故型样章。

ch33 故障切换与集群重建——力挽狂澜

区分数据库、复制、网络与 DCS 故障,选择切换或重建路径,避免脑裂和错误时间线。

ch34 过载保护与资源故障判型——李代桃僵

从资源症状进入,第一步区分流量型与保留型;只对流量型执行限流、取消、摘流和降级,对保留型实施安全保护并路由到正确章节。

ch35 数据抢救与工程取证——起死回生

面对页、索引、排序规则或逻辑不一致时先保护原始证据,再区分检测、修复、抽取与重建;不把危险技巧包装成常规运维。

ch36 事故复盘、控制固化与平台演进——举一反三

把一次恢复变成长期能力:解释因果链、修复控制缺口、验证改进,并为下一轮架构和版本演进建立优先级。

前后衔接

最后更新于