搞定靠谱灾备技术方案,别等出事才拍大腿
为什么九成中小企业的灾备技术方案都是摆设
说实话我上个月帮一个电商朋友收拾烂摊子。他那托管服务器的机房线路被工程车挖断了,整层楼断电三天。他拍着胸脯跟我说,没事,我做了备份,存在同机房另一台服务器上呢。结果呢?全没了。最后花了小两百万找专业数据恢复,才捞回不到七成的订单数据。
很多人对灾备的理解还停留在「我存了备份就行」。差远了。备份是把数据存下来,灾备是出事儿之后能立刻把业务拉起来,让用户该买东西买东西,该办公办公,不能整个公司停摆等着恢复数据。
现在等保合规要求很多行业必须做灾备,不少公司就随便找个服务商搭个花架子,应付完检查就扔那儿落灰。服务商也乐意赚这个快钱,反正钱拿到手,出不出事谁管你。
企业机房同城灾备中心部署实景图
我见过最离谱的案例,一家做本地生活的公司,灾备服务器和生产服务器插在同一个UPS上。整个机房跳闸停电,两台一起挂。灾备成了陪葬。说出去都没人信,可这种事儿真的天天发生。
不同规模企业,怎么选适配自己的灾备技术方案
别听服务商瞎忽悠,上来就给你推百万级的双活方案。适合你的才是最便宜也最有用的。
十来人的小团队,业务就是个官网、小程序,或者小型电商店铺。犯不上砸几十万建本地灾备中心。现在云厂商的云原生多可用区灾备方案,一年几千块就能搞定。数据自动同步到不同城市的可用区,一个机房出问题,DNS自动切到另一个,用户根本感觉不到中断。成本低,维护也不用你管,香得很。
年营收几千万到几个亿的中型企业,有核心业务系统——比如连锁零售的收银系统,生产厂的ERP,或者医院的挂号系统。那最低标准也要做两地三中心灾备架构。
中型企业两地三中心灾备架构拓扑图
简单说就是,本地放生产中心,同城几十公里外建一个灾备中心,应付火灾、停电这种局部故障,RPO能控制在十分钟以内,RTO也就个把小时,足够用了。再远一点,几百公里外另一个城市放一个异地灾备中心,应付地震、洪水这种毁灭性灾害,哪怕本地全没了,异地也能把业务拉起来。
至于银行、证券、头部互联网这种巨头,业务停一分钟损失都几百万上千万,那直接上多活架构,两个中心同时跑业务,哪个出问题另一个直接接,用户完全没感知。当然成本高,但是值。
不过话说回来,我见过太多年营收才千万的公司,被服务商忽悠着花几百万做双活,完全没必要。你就算停两个小时,能损失多少?算算账,真的犯不上。
踩过无数坑才总结出来的灾备落地准则
踩过无数坑才总结出来的灾备落地准则
第一,一定要定期演练。
多少公司灾备做完,网线一插就再也不管了,三五年都不做一次恢复演练。真出事儿了你才发现,数据同步三个月前就断了,备份磁盘早就坏了,加密密钥找不到了……我之前碰过一个区里的政务单位,系统崩了要恢复,灾备盘拿出来读都读不出来,放五年了,潮都霉了。你说离谱不离谱?
哪怕半年练一次,花个一两天时间,也比真出事了抓瞎强。这是底线。
第二,一定要根据业务定RPO和RTO,别追求所谓的「零中断零丢失」。RPO就是你最多能丢多久的数据,RTO就是你最多能停多久的业务。你的官网,停一天都没多大影响,允许丢一天的数据,那选冷备份就行,成本比秒级恢复低几十倍。你的核心支付系统,那肯定要分钟级的,该花钱就得花。搞反了,要么成本爆炸,要么出事儿凉凉。
第三,一定要留一份离线物理备份。现在勒索病毒太猖狂了,你所有备份都连在网上,黑客把你生产备份一起加密了,你照样哭。至少留一份物理隔离的备份,不连公司内网,黑客碰不到,哪怕全被加密了,这份也能救你命。
最后提一句,现在混合云灾备是真的香。核心敏感数据放本地灾备,非核心的日志、存档放云灾备,成本降一大块,安全也有保障,大部分企业这么玩都合适。
灾备这东西,一辈子不用最好,但不能没有。更不能摆个样子放在那当摆设。真到出事那天,它是你能抓住的最后一根稻草。