备份与灾难恢复(BCP/DRP)
备份与恢复基础
备份与灾难恢复是任何网络安全策略的关键组成部分。 随着勒索软件攻击以及(自然或技术性)灾难的增加,拥有健全的 BCP(Business Continuity Planning)与 DRP(Disaster Recovery Planning)计划至关重要。
RTO 与 RPO:基本概念
RTO (Recovery Time Objective)
定义:灾难发生后可接受的最长不可用时间
示例:RTO 为 4 小时表示系统必须在 4 小时内恢复
影响:决定解决方案所需的紧迫性与投入
RPO (Recovery Point Objective)
定义:以时间衡量的最大可丢失数据量
示例:RPO 为 1 小时表示备份必须每小时进行一次
影响:决定备份频率与复制技术
关键性等级:
- Tier 1(关键):RTO < 1h、RPO < 15min - 同步复制
- Tier 2(重要):RTO 4-8h、RPO 1h - 频繁增量备份
- Tier 3(普通):RTO 24h、RPO 24h - 每日备份
3-2-1 备份规则
数据保护的黄金策略:
- 3 三份副本的数据:生产环境 + 2 份备份
- 2 两种不同介质:磁盘、磁带、云
- 1 一份异地副本:地理上分离
现代演进:3-2-1-1-0
+ 1 份不可变副本(防勒索软件)
+ 0 个恢复错误(定期测试)
备份类型
1. 完全备份(Full)
- 优点:恢复简单且快速
- 缺点:速度慢,占用大量空间
- 用途:每周或每月作为 baseline
2. 增量备份
- 优点:快速,节省空间
- 缺点:恢复需要 full 加上所有增量备份
- 用途:在多次 full 之间每日或每小时进行
3. 差异备份
- 优点:恢复比增量备份更简单
- 缺点:在下一次 full 之前持续增长
- 用途:当 restore 简单性至关重要时每日进行
4. 快照与复制
- 快照:时间点(point-in-time)副本,可即时恢复
- 同步复制:零数据丢失(RPO=0)
- 异步复制:地理分布
技术与解决方案
On-Premises
- Veeam Backup & Replication:虚拟化环境的领袖产品
- Commvault, Veritas NetBackup:Enterprise backup platforms
- Acronis Cyber Protect:备份 + 集成反恶意软件
- Dell EMC Data Domain:Deduplicated backup appliances
Cloud-Based
- AWS Backup:面向 AWS 服务的集中备份
- Azure Backup:与 Azure 服务集成
- Google Cloud Backup:GCP 自动备份
- Druva, Backblaze B2:Cloud-native backup solutions
数据库
- MySQL/PostgreSQL:pg_dump, mysqldump + point-in-time recovery
- MongoDB:mongodump, Ops Manager backup
- SQL Server:Native backup + Always On Availability Groups
- Oracle RMAN:面向 Oracle 环境的 Recovery Manager
勒索软件防护
防勒索软件的备份:
- 不可变性:Object lock (S3), WORM storage, immutable backups
- Air-gapping:与网络断开连接的离线备份
- 凭证分离:Backup admins ≠ domain admins
- MFA:访问备份的多因素认证
- 版本控制:多个版本用于感染前恢复
- 扫描:恢复前对备份进行反恶意软件扫描
- 告警:检测大量修改(可能的加密)
Disaster Recovery Planning
- DR Site:二级数据中心或云区域
- Failover Automation:脚本或自动编排
- Runbooks:逐步恢复文档
- 优先级排序:基于关键性的恢复顺序
- 依赖关系:系统间相互依赖的映射图
- Network Configuration:面向 DR 的 DNS, VPN, firewall rules
- Communication Plan:利益相关者、客户、团队
恢复测试
测试类型(至少每年执行一次):
- Tabletop Exercise:对计划进行理论讨论而不执行
- Restore Testing:在隔离环境中恢复样本
- Partial Failover:非关键系统的 failover
- Full DR Test:完整 failover(通常在 maintenance window 中进行)
- Chaos Engineering:有意注入的故障
重要:未经测试的备份不是备份。如果没有定期测试, 故障会在需要使用时才被发现。
最佳实践
- [OK] 实施 3-2-1-1-0 规则
- [OK] 为每个系统定义明确的 RTO/RPO
- [OK] 不可变备份以防护勒索软件
- [OK] 每季度进行恢复测试
- [OK] 备份故障的监控与告警
- [OK] 备份加密(at rest 与 in transit)
- [OK] 最新的 runbooks 文档
- [OK] 权限分离(backup admin ≠ domain admin)
- [OK] 符合合规要求的保留(LGPD、SOX 等)
- [OK] 地理分布的 DR site
