备份做好了,但恢复过吗?90%的企业从没演练过
作者:郑成功 备份做了三年,勒索病毒一来,恢复时全坏了 上个月,一个做电商的朋友打电话给我,声音都是抖的。 他们公司服务器中了勒索病毒,所有业务系统全部瘫痪。老板一拍桌子:“怕什么,我们有备份!” IT主管赶紧登录备份系统,准备恢复数据。结果你猜怎么着? 三年的备份,全部不可用。 有的是备份文件损坏
作者:郑成功
备份做了三年,勒索病毒一来,恢复时全坏了
上个月,一个做电商的朋友打电话给我,声音都是抖的。
他们公司服务器中了勒索病毒,所有业务系统全部瘫痪。老板一拍桌子:“怕什么,我们有备份!”
IT主管赶紧登录备份系统,准备恢复数据。结果你猜怎么着?
三年的备份,全部不可用。
有的是备份文件损坏,有的是恢复脚本没更新,还有的是备份策略配置错误——备份倒是天天在做,但备的是一堆“废数据”。
最讽刺的是,他们花了几十万买的备份系统,界面一看还挺高大上。可惜从来没人验证过,这些备份到底能不能用。
最后,他们交了赎金。更惨的是,交了赎金也没全部恢复,因为加密太彻底了。
说实话,这种事我见得太多了。不查不知道,一查吓一跳——Gartner有个数据:超过60%的企业在发生灾难时,无法从备份中成功恢复数据。而IDC的报告更直白:90%的企业从未对备份做过恢复验证。
说白了,备份不做验证,就等于没做。
为什么90%的企业从来不搞恢复演练?
我接触过不少企业的IT负责人,聊起这个事,理由翻来覆去就那么几个:
“备份运行得好好的,从来没出过问题啊。”
这话我听过不下二十次。问题在于,备份系统正常不代表恢复能成功。备份文件写到磁盘上,可能中间就出了差错。磁盘坏了、文件校验出问题了、版本不兼容了……出问题的可能性,比你想象的要多得多。
“恢复演练太麻烦,怕影响生产业务。”
这个理由听着合理,其实是个伪命题。后面我会讲,现在的技术完全可以做到恢复演练和生产业务完全隔离,互不影响。
“不知道怎么做,也没人教。”
这个我理解。很多小公司连专职的IT人员都没有,更别提懂容灾演练的了。但不做演练,出事就是灭顶之灾。
“我们数据量太大了,演练一次要恢复好几天。”
这个确实是个问题。但话说回来,你不需要每次都恢复全部数据。关键业务系统的数据,优先验证,这总做得到吧?
之前有个客户,制造业的,他们IT主管跟我说:“备份系统我们买了三年,从来没做过恢复测试。因为每次提这个事,老板就说‘系统不是运行得好好的吗?别折腾了’。”
后来呢?后来他们真的中了勒索病毒,恢复不了,直接停产两周。损失有多大?够买几十套备份系统了。
恢复演练的正确姿势
我踩过坑,后来慢慢摸索出一套靠谱的方法。核心就三条:
第一,用备份副本拉起一个隔离环境。
千万别在生产环境里搞恢复演练。现在主流做法是:从备份副本创建一个虚拟的、隔离的恢复环境。在这个环境里验证数据完整性和应用可用性。验证完了,环境直接删除,对生产业务零影响。
第二,设定明确的演练范围和验收标准。
别上来就说“我要演练恢复”。你得想清楚:今天恢复哪几个系统?恢复到什么程度?是只要数据能读出来就行,还是要求应用能正常启动、业务能跑通?
验收标准也要量化:恢复时间目标(RTO)达标了没?数据丢失量(RPO)在可接受范围内吗?
第三,定期演练,至少每季度一次。
我建议最低频率是:核心业务系统每季度一次,非核心业务每半年一次。有条件的,每月一次也不为过。别嫌烦,真出事的时候,你会发现演练的价值是备份系统本身的十倍。
不同等级的演练,别一上来就搞全站容灾
很多公司一开始就想搞全站容灾切换演练,结果搞得鸡飞狗跳,最后不了了之。
正确做法是分等级、循序渐进:
文件级恢复验证:最简单的。挑一个备份文件,恢复出来看看能不能正常打开。验证数据完整性即可。适合频繁做,比如每周一次。
应用级恢复验证:稍微复杂一点。把某个应用的完整备份恢复到隔离环境,启动应用,测试核心功能是否正常。比如恢复一个数据库,然后跑几个查询看看结果对不对。适合每季度一次。
全站容灾切换演练:最复杂,也最接近真实灾难场景。模拟整个数据中心宕机,把所有业务切换到灾备中心。这个半年或一年做一次就够了,但必须做。
之前有个金融客户,他们每季度做一次应用级演练,每年做一次全站切换演练。结果有一年演练的时候发现,核心交易系统的恢复脚本有个bug,导致数据恢复后账不平。要是真出事了,这个bug能让他们赔到破产。
恢复演练 ≠ 生产中断
这是个巨大的误解。很多人一想到演练,就以为要停机、要影响业务,所以能拖就拖。
其实现在的技术早就解决了这个问题。
举个例子,CDM(拷贝数据管理)技术可以从备份数据直接生成一个独立的、可读写的副本。这个副本可以挂载到任何一台测试服务器上,和生产环境完全隔离。演练的时候,业务照常运行,用户没有任何感知。
我之前用过一个方案,就是用这种技术做演练的。每次演练,只要在管理界面上点几下,系统自动从备份副本创建一个隔离环境。演练结束,一键销毁。整个过程,生产系统连个屁都没放。
所以,别再拿“怕影响业务”当借口了。技术早就不背这个锅了。
最小可行演练方案
如果你从来没做过恢复演练,别一上来就想搞大。我给你一个最小可行方案:
1. 选一个核心业务系统,比如ERP或者数据库。
2. 从备份副本创建一个隔离环境,恢复这个系统的数据。
3. 验证数据完整性:看看数据能不能读出来、应用能不能正常启动。
4. 跑两个核心业务操作:比如查个订单、做个报表。
5. 记录恢复耗时:从开始恢复到验证完成,花了多长时间。
6. 写一份简单的演练报告:成功了就记下步骤和耗时,失败了就分析原因并修复。
整个流程,熟练的话一两个小时就能搞定。别再说没时间了。
最后说一句
备份恢复演练,就像给自己的系统买了一份保险。平时看着没用,真出事的时候,它能救命。
我之前帮客户做容灾方案的时候,中科热备的工程师跟我聊过一个案例:他们有个客户,每季度做一次恢复演练,有一次演练发现备份数据有损坏,及时修复了。三个月后,这个客户真的中了勒索病毒,但因为演练发现了问题,恢复非常顺利,业务中断不到半小时。
而那个花了几十万买备份、从来没做过演练、最后交了赎金的电商公司,现在每周五下午雷打不动做一次恢复演练。
血的教训,比什么道理都管用。
从今天开始,给你的备份做个“体检”吧。别等到真的出事,才后悔没做。