备份与灾难恢复(BCP/DRP)

备份与恢复基础

备份与灾难恢复是任何网络安全策略的关键组成部分。 随着勒索软件攻击以及(自然或技术性)灾难的增加,拥有健全的 BCP(Business Continuity Planning)与 DRP(Disaster Recovery Planning)计划至关重要。

RTO 与 RPO:基本概念

RTO (Recovery Time Objective)

定义:灾难发生后可接受的最长不可用时间

示例:RTO 为 4 小时表示系统必须在 4 小时内恢复

影响:决定解决方案所需的紧迫性与投入

RPO (Recovery Point Objective)

定义:以时间衡量的最大可丢失数据量

示例:RPO 为 1 小时表示备份必须每小时进行一次

影响:决定备份频率与复制技术

关键性等级:

  • Tier 1(关键):RTO < 1h、RPO < 15min - 同步复制
  • Tier 2(重要):RTO 4-8h、RPO 1h - 频繁增量备份
  • Tier 3(普通):RTO 24h、RPO 24h - 每日备份

3-2-1 备份规则

数据保护的黄金策略:

  • 3 三份副本的数据:生产环境 + 2 份备份
  • 2 两种不同介质:磁盘、磁带、云
  • 1 一份异地副本:地理上分离

现代演进:3-2-1-1-0
+ 1 份不可变副本(防勒索软件)
+ 0 个恢复错误(定期测试)

备份类型

1. 完全备份(Full)

  • 优点:恢复简单且快速
  • 缺点:速度慢,占用大量空间
  • 用途:每周或每月作为 baseline

2. 增量备份

  • 优点:快速,节省空间
  • 缺点:恢复需要 full 加上所有增量备份
  • 用途:在多次 full 之间每日或每小时进行

3. 差异备份

  • 优点:恢复比增量备份更简单
  • 缺点:在下一次 full 之前持续增长
  • 用途:当 restore 简单性至关重要时每日进行

4. 快照与复制

  • 快照:时间点(point-in-time)副本,可即时恢复
  • 同步复制:零数据丢失(RPO=0)
  • 异步复制:地理分布

技术与解决方案

On-Premises

  • Veeam Backup & Replication:虚拟化环境的领袖产品
  • Commvault, Veritas NetBackup:Enterprise backup platforms
  • Acronis Cyber Protect:备份 + 集成反恶意软件
  • Dell EMC Data Domain:Deduplicated backup appliances

Cloud-Based

  • AWS Backup:面向 AWS 服务的集中备份
  • Azure Backup:与 Azure 服务集成
  • Google Cloud Backup:GCP 自动备份
  • Druva, Backblaze B2:Cloud-native backup solutions

数据库

  • MySQL/PostgreSQL:pg_dump, mysqldump + point-in-time recovery
  • MongoDB:mongodump, Ops Manager backup
  • SQL Server:Native backup + Always On Availability Groups
  • Oracle RMAN:面向 Oracle 环境的 Recovery Manager

勒索软件防护

防勒索软件的备份:

  • 不可变性:Object lock (S3), WORM storage, immutable backups
  • Air-gapping:与网络断开连接的离线备份
  • 凭证分离:Backup admins ≠ domain admins
  • MFA:访问备份的多因素认证
  • 版本控制:多个版本用于感染前恢复
  • 扫描:恢复前对备份进行反恶意软件扫描
  • 告警:检测大量修改(可能的加密)

Disaster Recovery Planning

  • DR Site:二级数据中心或云区域
  • Failover Automation:脚本或自动编排
  • Runbooks:逐步恢复文档
  • 优先级排序:基于关键性的恢复顺序
  • 依赖关系:系统间相互依赖的映射图
  • Network Configuration:面向 DR 的 DNS, VPN, firewall rules
  • Communication Plan:利益相关者、客户、团队

恢复测试

测试类型(至少每年执行一次):

  • Tabletop Exercise:对计划进行理论讨论而不执行
  • Restore Testing:在隔离环境中恢复样本
  • Partial Failover:非关键系统的 failover
  • Full DR Test:完整 failover(通常在 maintenance window 中进行)
  • Chaos Engineering:有意注入的故障

重要:未经测试的备份不是备份。如果没有定期测试, 故障会在需要使用时才被发现。

最佳实践

  • [OK] 实施 3-2-1-1-0 规则
  • [OK] 为每个系统定义明确的 RTO/RPO
  • [OK] 不可变备份以防护勒索软件
  • [OK] 每季度进行恢复测试
  • [OK] 备份故障的监控与告警
  • [OK] 备份加密(at rest 与 in transit)
  • [OK] 最新的 runbooks 文档
  • [OK] 权限分离(backup admin ≠ domain admin)
  • [OK] 符合合规要求的保留(LGPD、SOX 等)
  • [OK] 地理分布的 DR site