一、异地容灾主要备份三种数据: 1、DB数据 2、操作系统 3、日志信息 二、恢复时间不能超过30分钟 三、图中为DB的备份方式,DB总的有四份备份:生产存储一份、移动硬盘一份、备份存储一份、灾备存储一份...备份方式为,平时通过生产系统的介质服务器传输到移动硬盘,通过CS传输数据到灾备中心的介质服务器,在通过介质服务器传输到备份存储、灾备存储。...生产中心发生异常时的DB切换方式为,将移动硬盘迅速转移挂载到灾备中心的介质服务器,然后再发起恢复 四、日常对OS进行每日备份,通过CS传输到灾备中心的介质服务器,再发送给备份存储和灾备存储,即OS的备份有三份...:生产存储、备份存储、灾备存储 五、日志的备份和OS一样 六、恢复切换步骤:日志恢复、OS恢复、修改IP和主机名、移动硬盘转移挂载 七、本地恢复 image.png 八、两地传输带宽的计算要考虑每日数据增量
异地数据备份挑战相对同城数据备份,异地数据冷备主要挑战是成本,主要是跨地域之数据传输带宽成本。...异地数据冷备方案2.1 API实现方案数据备份:云平台的数据库数据备份均为同地域,因此需要将该备份数据上传到异地COS存储桶。...2)通过url将备份下载到本地 3)调用cos上传api,将本地的备份文件上传到异地cos桶 4)按照备份业务规则,周期性的执行上面1-3步骤,将备份存储到异地COS存储桶。...2.3 数据库备份服务数据库备份服务拥有一套完整的数据备份和数据恢复解决方案,具备实时增量备份以及快速的数据恢复能力,同时具备异地容灾能力。...异地数据冷备案例3.1 异地冷备方案以某在线商城为例,涉及数据产品为mysql,reids以及cos,结合云平台的能力,具体方案架构如下:图片方案要点说明:数据备份:基于数据恢复的rto时长,mysql
异地双活的数据同步 异地双活的数据中心距离通常超过百公里,网络延迟显著增加且稳定性挑战更大。因此,强一致性难以实现,普遍采用最终一致性(Eventual Consistency) 模型。...共享存储或数据库主从模式 单元化架构(按用户/业务分片) 成本 专线成本较高,但存储配置可能更简单 异步复制带宽成本相对较低,但架构复杂度和改造成本高 主要优势 高可用、数据零丢失(RPO=0)、故障切换迅速 城市级容灾...(如核心交易系统),同城双活更合适。...若能接受短暂数据不一致(如社交feed、商品库存),异地双活可行。 2、容灾等级要求:同城双活可应对机房级故障。若需防范城市级灾难(如地震、大规模停电),则需异地双活。...异地双活带宽成本可能更低,但架构复杂度和改造投入通常更高。 4、技术能力:异地双活,尤其单元化改造,对技术团队的设计、开发、运维能力要求极高。
今天跟大家分享的题目为《CKV+异地容灾探索和实践》。CKV+是一个兼容redis协议的内存数据库,现在大部分用户对内存数据库的要求越来越高,对一致性、异地容灾等方面也提出更高的要求。...现有系统可能会区分为一个CA,或者AP,或者CP等。对于分布式系统来说,数据一定是分布式存储的,因此“分区容忍性”这一点是必须要满足。...04CKV+单活多可用区异地容灾实践 CKV+为了满足不同的容灾要求,已上线了单活多可用区特性,支持不同容灾级别: 单可用区:机架级容灾能力。 同地域多可用区:机架、可用区级容灾能力。...跨地域多可用区:跨城际容灾。 默认的情况下,CKV+的容灾级别是跨机架容灾,保证主备分片必须跨机架,避免一个机架掉电导致主备分片都不可用的问题。...05CKV+多活架构异地容灾探索 异地单活虽然提供了不同的容灾级别,甚至不同可用区提供了读能力,但只能在主可用区执行写操作。
广义的容灾,可以认为是业务连续性计划当中的灾难恢复,即能够容忍灾难的能力,如何在灾难发生时,保证生产业务系统的不间断运行,需要我们健全快速容错 / 故障切换能力,即容灾能力,包含了常态化容灾建设以及针对能力进行的周期性演练验收...与同城容灾不同,异地容灾会有一个选择过程:先判断同城资源,如果同城资源不够,再考虑区域间的容灾策略。...字节海外容灾 由于海外业务的特殊性,我们的容灾架构首先采用了异地模式,然后发展成为异地加同城的双重容灾模式。...因此,在海外,先同城后异地不一定是最佳默认策略,我们可以考虑利用海外的天然特点,例如时区来做容灾的第一判断依据,根据事故发生时的时区特点来决策,第一优先级是同城容灾,或者是异地切流,因为容量是我们容灾首要考虑的因素...在国内容灾和海外容灾方面,我们目前都在采用同城容灾加异地多活的模式,并且我们正在持续不断地完善整体的容灾能力建设。
金融核心系统,通常要求奔着5级、6级去。有个现成样本,深圳建成"两地三中心"容灾体系,500米同城双活加50公里异地备份,系统可用性做到99.99%,恢复时间缩到10分钟以内。...异地灾备端,多数方案建议手动启动,别让误判把业务切错地方。最后是演练,很多人栽在这一步。只建不练,等于没有。我见过灾备系统建好两年没演练,真到用的时候,复制链路早就断了。...六、案例复盘:银行怎么做异地容灾讲个真实案例。西部某省级银行的国际结算系统,属于典型核心业务,容灾要求很高。他们做了同城双中心,8个节点,同城走全同步复制。...多次容灾演练下来,RTO平均不到30秒,RPO=0。这个成绩,满足了银行业“灾难恢复能力5级”的要求。这套系统跑在KingbaseES上。...九、异地容灾高频问题常问的几个问题,我放在一起答。演练频率是最常被问到的,至少每半年一次有预告演练,每年一次无预告突击演练,金融核心系统通常要求每季度至少一次切换演练。
具体技术架构如下:图片在本方案中,不涉及备份技术方案,详情请参考之前容灾系列的备份方案。方案要点说明如下:1)业务调度:目前通过DNS统一调度,调度路线设置通过地区或者运营商为区分。...3)容灾成本:业务备份的资源成本,具体可参考之前容灾文章系列。4)业务恢复:可用区粒度的极端故障,基于云平台同城双活架构可实现RTO秒级切换恢复业务。...详细技术架构图如下:图片在本方案中,不涉及备份技术和AS弹性扩容的技术细节,详情请参考之前容灾系列的备份方案。方案要点说明如下:1)业务调度:同方案一保持一致。...详细技术架构如下:图片在本方案中,不涉及备份技术和AS弹性扩容的技术细节,详情请参考之前容灾系列的备份方案。...方案要点说明如下:1)业务调度:于方案二保持一致1)业务部署:相对于方案二,增加了数据双向同步,各个地域中心均具有全局数据能力,提升容灾的RTO指标,同时不同业务数据要有唯一主键来保证数据一致性。
在至少有一个Leader存在的前提下,进行Zookeeper的在线增量、在线减量、在线迁移 在全过程中ZooKeeper不停止服务
数据存储容灾建设主要从数据可靠性和业务稳定性两个维度阐述。这两者有哪些区别呢?...1.数据可靠性 1.1 云硬盘(CBS) 云硬盘采用三副本的分布式机制,系统确认数据在三个副本中都完成写入后才会返回写入成功的响应。...另外CBS分布式存储系统和快照系统是完全独立不同存储体系,来进一步提升平台数据可靠性。...https://cloud.tencent.com/document/product/362/16312 2.将CBS数据上传异地COS,调用cos分块上传接口。...例如COS如果开启了异地复制,业务可以临时读异地存储桶,虽然存在访问延时,只是影响用户体验,不会造成业务持续不可用;如果是CBS通过挂载新盘通过快照恢复,或者通过使用大内存机器周期性将核心数据读到内存供业务临时访问等等
数据同步以及异地容灾是确保数据可用性和连续性的重要手段。YashanDB作为一款高可用的数据库系统,采用多种部署架构和存储管理优化策略,为数据同步与异地容灾提供了全面的解决方案。...本文旨在解析YashanDB在数据同步与异地容灾方面的技术原理、优势和最佳实践,帮助企业更好地理解并应用这些技术。1....异地容灾方案同样重要的是YashanDB的异地容灾机制,对于数据的安全性、可靠性至关重要。3.1 级联备份级联备份模式中,多个备库形成层级结构。...技术建议与最佳实践对于企业使用YashanDB处理数据同步与异地容灾,以下技术建议和最佳实践值得考虑:选择合适的部署架构,确保根据业务需求综合考虑高可用性和成本效益。...结论YashanDB通过高效的同步手段和异地容灾策略,为企业提供了强有力的数据保护和服务可用性保障。通过了解并应用上述核心技术和最佳实践,企业可以更好地应对数据安全和业务连续性挑战。
一、什么是云容灾?在数字化时代,企业的业务系统承载着关键的生产和运营任务,任何系统故障或数据丢失都可能造成严重的经济损失。...云容灾在云容灾出现之前,企业通常采用传统容灾方案,如自建异地灾备中心或租用灾备机房。...维护复杂度高:传统容灾系统的管理、监控、演练和切换操作需要大量专业人员投入。...例如,企业可以在云端模拟宕机情况,测试系统在不同故障场景下的恢复能力,并优化灾备策略。四、案例分析:某金融企业的灾备升级背景某大型金融企业依赖传统容灾方案,在本地数据中心部署了一套灾备系统。...:在云端部署异地灾备中心,利用云存储进行数据备份,并启用云计算资源进行业务恢复。
IDC时代,业务对网络容灾参与较少,主要依赖数据中心网络容灾建设程度;当到了云的时代,云服务商将底层网络能力产品化后,云上客户更多参与网络容灾建设,提升业务稳定性。...2.网络容灾复杂度 同城或者异地容灾建设,网络层面因素主要有三个: 1)跨区或者跨地域网络延时,对上层业务影响。 网络延时,通过优化基础设施手段是非常有限的,毕竟受限于实际物理距离和光速。...2)跨区或者跨地域云基础设施容灾能力。 通常云服务厂家数据中心建设均有容灾能力,这里建议还是选择大厂。 3)IDC到云上网络高可用建设。...混合云容灾模式,这里考虑到IDC和云上线路容灾情况,一般建议两条专线接入不同的POP点来进行容灾建设;同时建立VPN或者GRE公网逃生通道来紧急恢复业务。...image.png 3.2 混合云网络容灾 混合云网络容灾分为两个部分: 1)idc和云机房之间线路容灾,主要线路分为专线和VPN。
加州AI硬件抢劫案警示:中科热备异地容灾的真实距离 写这篇文章,是给那些正在纠结“要不要把容灾中心挪远一点”的运维负责人看的。...距离怎么定:100公里是底线,不是拍脑袋 说到异地容灾,第一个绕不开的问题就是:离多远算“异地”?我见过不少企业的“异地容灾”,实际上就是同城另一个区的机房,直线距离18公里。...这对数据库来说可能还能忍,但对高并发的交易系统,延迟会直接吃掉吞吐量。 异步复制就宽松多了。主中心写完就返回,后台慢慢往容灾中心传。代价是RPO不为零,可能是几秒,也可能是几分钟。...部署清单:五步把异地容灾落地 如果你现在就要动手做异地容灾,我建议按下面这五步走,顺序别乱。 第一步:评估物理威胁面。...演练完必须做反向同步,把容灾端的数据拉回主中心,这个环节最容易暴露出配置问题。 最常见的错误:把同城多机房当异地容灾 最后说一个我反复跟客户强调的点:同城多机房不是异地容灾。
其中,本地的存储网络连接的主备高可用适用于近距离的容灾建设,受距离限制较大;异地远距离的主备高可用,则会存在极小的数据延时。...2.容灾级别与能力 容灾系统按保护级别可分为:数据级容灾、应用级容灾、业务级容灾。...2.1数据级容灾 数据级容灾是指通过建立异地灾备中心,做数据的远程备份,在灾难发生之后要确保原有的数据不会丢失或者遭到破坏,但在数据级容灾这个级别,发生灾难时应用是会中断的。...在数据级容灾方式下,所建立的异地灾备中心可以简单地把它理解成一个远程的数据备份中心。数据级容灾的恢复时间比较长,但是相比其他容灾级别来讲它的费用比较低,而且构建实施也相对简单。...应用级容灾生产中心和异地灾备中心之间的数据传输是采用异类的广域网传输方式;同时应用级容灾系统需要通过更多的软件来实现,可以使多种应用在灾难发生时可以进行快速切换,确保业务的连续性。
中科热备异地容灾切换实战手册 这篇文章写给谁看?写给那些负责核心业务系统、却被领导问过“如果机房断电了怎么办”的运维兄弟。也写给正在做年度容灾规划、却对切换时间心里没底的架构师。...先给个定义:异地容灾切换,就是当生产数据中心整体不可用时,把业务流量、存储、数据库在另一个物理位置重新拉起来的过程。...第一段:故障检测延迟 断电之后,监控系统自己也趴了。如果你依赖生产中心的监控告警,那大概率是收不到的。真正能发出告警的,是异地部署的探针或者第三方监控节点。...异地容灾切换SOP:把每一步都写成命令 下面这套SOP是我们给一个中等规模互联网公司做的,他们核心系统日请求量大约3000万,生产在苏州,灾备在南京,两地直线距离约220公里。...我们有一家医疗行业的客户,灾备系统建好之后两年没演练,第一次演练时发现存储复制链路因为一次防火墙升级被中断了三个月,灾备端的数据还停留在三个月前。这个发现让他们后怕了很久。
去年写过一篇《做容灾,冷备是不是个好方案?》,当时提出来,冷备或者主备,其实并不是一个理想的方案,而且绝大多数情况下,只能是一个心理安慰,真正发生故障的情况下,这样的容灾模式根本起不到作用。...最近,公有云又出了些大故障,各大群和朋友圈又开始沸沸扬扬,但是整体看下来,声音无非两种: 单站点不靠谱,要有容灾,出现这种情况就得马上切,所以回去赶紧建设容灾站点; 鸡蛋不能放在一个篮子里,单云不靠谱,...但现实是更为复杂的,因为用户业务系统产生的数据,有可能会被其它系统用到,比如商品库存这样的系统,这就要涉及异步消息和数据的同步问题,而数据同步不仅仅是一个技术问题,而是个物理问题,我们接下来讲。...既然要双活,必然会选择另一个跟当前机房有一定距离的机房(同城或异地),而且距离必须得拉开才有意义,如果都在一个园区里面,就没有任何容灾意义了。...我们可以得出的几个结论: 不管怎么选择容灾方案,我们自己的业务系统,从自身架构上,一定要支持单元化,一定要支持数据同步才行,如果这都不支持,讲双活和多活,就是特么的扯淡。
为了让企业能更好用好云平台的数据安全能力,本文重点云平台数据备份冷备能力,以腾讯云为例,主要从以下两个维度介绍:同城数据冷备能解决企业什么问题,达到怎么样业务容灾效果?...1.2 数据冷备挑战通常企业做数据冷备份面临难点,主要分为两部分:备份系统稳定性:系统能定时进行数据备份,同时能进行及时恢复。如果备份系统出现问题,相关人员能有效的感知并恢复的能力。...同城冷备份方案同城数据冷备方案主要依赖于云平台能力备份能力,对现有业务架构没有任何改造,方案架构如下:图片该方案核心要点说明:数据备份:云侧数据库mysql和redis在控制台设置数据备份参数,数据备份存储在COS,具备地域级别容灾...指标详细说明容灾能力具备同地域(不同可用区)数据备份能力,不具备不同地域的能力。...3.容灾演练能力建设,增加平时运维成本以及自动化工具开发功能。
序言 同城异地灾备,主要是用来进行备份容灾的,从而当一个数据中心挂了,另外一个数据中心经过切换之后,能让服务迅速的恢复。...随着业务的进一步发展,需要提供高可用水平,从而需要从单机房扩展为多机房,从而也就有了同城容灾。。。 对于运维来说,多一次升级,多一次变更,就会多一个故障,多一个锅。。。...热升级了解一下,不可预知的中断了解一下 同城异地最关键的点在于存储,存储如何跨机房使用,从而分为几个方面进行探讨: 1、 DNS解析 在业务大量使用DNS解耦的时候,而且使用双机房的时候
容灾(Disaster Tolerance)核心目标:保障业务连续性,允许数据最小化丢失实现手段:系统冗余+灾难检测+快速切换技术特征:需应对区域性灾难(如地震、火灾)典型场景:金融系统实时交易、医疗急救平台...灾难恢复(Disaster Recovery)阶段定位:灾难发生后的系统重建与容灾关系:现代容灾系统集成恢复功能二、容灾与备份的协同关系1. 功能互补性2....典型故障应对案例1:数据库误删操作容灾系统同步删除→需从备份恢复案例2:机房级火灾容灾系统接管业务→备份用于数据追溯三、企业灾备体系规划策略1. 风险评估矩阵2....典型建设路径初级阶段:本地备份+双机热备(中科热备HA方案)进阶阶段:同城双活+异地备份成熟阶段:多云容灾+区块链存证四、灾备技术体系详解1....医疗行业应用三甲医院HIS系统:容灾中心部署中科热备CDP技术实现诊疗业务零中断切换3.
冷备或者主备并不是一个理想的方案,而且绝大多数情况下,只能是一个心理安慰,真正发生故障的情况下,这样的容灾模式根本起不到作用。 原因我就不重复了,大家如果有兴趣可以直接看那篇文章。...最近,公有云又出了些大故障,各大群和朋友圈又开始沸沸扬扬,但是整体看下来,声音无非两种: 单站点不靠谱,要有容灾,出现这种情况就得马上切,所以回去赶紧建设容灾站点; 鸡蛋不能放在一个篮子里,单云不靠谱,...但现实是更为复杂的,因为用户业务系统产生的数据,有可能会被其它系统用到,比如商品库存这样的系统,这就要涉及异步消息和数据的同步问题,而数据同步不仅仅是一个技术问题,而是个物理问题,我们接下来讲。...既然要双活,必然会选择另一个跟当前机房有一定距离的机房(同城或异地),而且距离必须得拉开才有意义,如果都在一个园区里面,就没有任何容灾意义了。...我们可以得出的几个结论: 不管怎么选择容灾方案,我们自己的业务系统,从自身架构上,一定要支持单元化,一定要支持数据同步才行,如果这都不支持,讲双活和多活,就是特么的扯淡。