أساسيات الحوسبة السحابية

النسخ الاحتياطي والتعافي من الكوارث

ماذا يحدّ فعلياً هدف زمن الاستعادة (RTO) وهدف نقطة الاستعادة (RPO)، واستراتيجيات التعافي من الكوارث الأربع التي تختار بينها فرق السحابة حين لا يكفي التكرار داخل منطقة واحدة.

متوسط 19 دقائق 4 أهداف التعلّم
  1. عرّف هدف زمن الاستعادة (RTO) وهدف نقطة الاستعادة (RPO)، واشرح ما يحدّه كل واحد منهما
  2. اشرح كيف تؤتمت AWS Backup حماية البيانات عبر خطط النسخ والجداول وقواعد الاحتفاظ
  3. قارن استراتيجيات النسخ الاحتياطي والاستعادة، والإشعال التجريبي، والاستعداد الدافئ، والنشاط الكامل متعدد المواقع، من ناحية التكلفة والتعقيد وسرعة الاستعادة
  4. طبّق متطلبات RTO وRPO لسيناريو معيّن لاختيار استراتيجية التعافي من الكوارث المناسبة

حين لا يكفي التكرار داخل منطقة واحدة

غطّى الدرسان السابقان التكرار داخل Region واحدة: توزيع النسخ وقواعد البيانات عبر مناطق إتاحة كي لا يسقط عطل مركز بيانات واحد النظام كله. هذا يحميك من عطل عتاد أو انقطاع طاقة. لا يفعل شيئاً إن أفسد نشر سيء جدولاً في قاعدة بيانات، أو إن أظلمت منطقة جغرافية كاملة، وهي بالضبط الفجوة التي أشار إليها درس المناطق ومناطق الإتاحة سابقاً في هذا المقرر. هذا الدرس عن الخطة لهذا بالضبط: حين يكون العطل أكبر مما بُني تكرار مناطق الإتاحة لامتصاصه أصلاً.

سؤالان قبل أي خطة تعافٍ: كم من البيانات، وكم من الوقت متوقفاً

تبدأ كل خطة تعافٍ من الكوارث بالإجابة عن سؤالين منفصلين، والخلط بينهما هو الخطأ الأكثر شيوعاً بين الفرق.

هدف نقطة الاستعادة (RPO) يحدّ فقدان البيانات المقبول. يجيب عن "كم من البيانات نستطيع تحمّل فقدانها"، مقاساً كأقصى وقت مقبول بين الآن وآخر نقطة كان يمكن الاستعادة منها. RPO بمقدار 20 دقيقة يعني أن نسخك الاحتياطية أو تكرارك يجب أن يعملا كل 20 دقيقة على الأقل، وإلا خاطرت بفقدان أكثر مما يتحمّله العمل.

هدف زمن الاستعادة (RTO) يحدّ التوقف المقبول. يجيب عن "كم يمكن أن نبقى متوقفين"، مقاساً كأقصى تأخير مقبول بين بدء انقطاع واستعادة الخدمة. RTO بساعة واحدة يعني أن عملية الاستعادة كاملة، اكتشاف العطل، وتجهيز البنية التحتية، واستعادة البيانات، يجب أن تنتهي داخل تلك الساعة.

قاعدة بيانات طلبات لمتجر إلكتروني بـ RPO مقداره 20 دقيقة وRTO مقداره ساعة واحدة تعِد بشيئين مختلفين تماماً: فقدان 20 دقيقة على الأكثر من الطلبات، وساعة واحدة على الأكثر قبل أن يعود المتجر لاستقبال الطلبات مجدداً. تحقيق الاثنين معاً يتطلب هندسة مقصودة، وتحقيقهما بدقة أكبر يكلّف دائماً أكثر.

النسخ الاحتياطي: الأساس تحت كل استراتيجية

لا تعمل أي استراتيجية تعافٍ من الكوارث دون نسخ احتياطية موثوقة تحتها. توحّد AWS Backup هذا العمل عبر خدمات، EC2 وRDS وDynamoDB وEFS وغيرها، عبر خطط النسخ الاحتياطي: سياسات تحدد جداول وفترات احتفاظ. قد تجمع خطة نمطية قاعدة يومية، تأخذ نسخة كل ليلة وتحتفظ بكل نسخة شهراً واحداً، مع قاعدة شهرية، تأخذ نسخة مرة كل شهر وتحتفظ بها سنة كاملة. تُخصَّص الموارد لخطة عبر وسمها ببساطة، ويمكن للنسخ الاحتياطية أن تُنسَخ تلقائياً إلى Region مختلف على الجدول نفسه، وهذا بالضبط ما يحوّل نسخة احتياطية روتينية إلى المادة الخام التي تستطيع استراتيجية تعافٍ من الكوارث استخدامها فعلياً.

استراتيجيات التعافي من الكوارث الأربع، من الأرخص إلى الأغلى

مع النسخ الاحتياطية كأساس، يصبح السؤال كم من البنية التحتية تُبقيها عاملة في موقع ثانوي، والجاهزية تكلّف مالاً سواء وقعت الكارثة أم لا.

الاستراتيجيةما يعمل في المنطقة الثانوية قبل الكارثةالتكلفة النسبيةRTO/RPO النسبي
النسخ الاحتياطي والاستعادة (Backup and Restore)لا شيء؛ نسخ احتياطية فقط موجودة هناكالأدنىالأبطأ، وأعلى مخاطرة لفقدان بيانات
الإشعال التجريبي (Pilot Light)بيانات أساسية تتكرر حياً؛ الحوسبة تبقى مطفأة حتى التبديلمنخفضةأسرع، لكن البنية التحتية ما زالت تحتاج تشغيلاً وتوسيعاً
الاستعداد الدافئ (Warm Standby)نسخة مصغّرة لكن عاملة بالكامل من كامل المكدسمتوسطةأسرع أيضاً؛ يحتاج فقط للتوسّع لا النشر من الصفر
النشاط الكامل متعدد المواقع (Multi-Site Active/Active)المكدس الكامل، يخدم فعلاً حركة إنتاجية حيةالأعلىالأسرع؛ التبديل إعادة توجيه حركة، لا بناء أي شيء

يعيد النسخ الاحتياطي والاستعادة بناء كل شيء، البيانات والبنية التحتية، من الصفر بعد إعلان الكارثة، عادة عبر البنية التحتية كشيفرة، ولهذا يأخذ أطول وقت لكنه يكلّف الأقل يومياً. يُبقي الإشعال التجريبي طبقة البيانات متكررة باستمرار لكنه يترك بقية المكدس مطفأً، يحتاج تشغيلاً وتوسيعاً قبل أن يخدم حركة. يذهب الاستعداد الدافئ أبعد، ويُبقي نسخة أصغر من التطبيق الكامل عاملة بالفعل، بحيث تعني الاستعادة توسيع نشر قائم بدل نشره لأول مرة. يزيل النشاط الكامل متعدد المواقع خطوة التبديل تماماً: أكثر من Region يتعامل فعلاً مع حركة إنتاجية، فعطل مستوى Region يعني فقط إعادة توجيه الطلبات بعيداً عن Region التي لا تستطيع خدمتها.

مثال محلول: مطابقة الاستراتيجية بالمتطلب

لوحة تقارير داخلية تتحمّل عدة ساعات من التوقف وفقدان يوم كامل من البيانات دون أن يضر ذلك العمل بأي شكل قابل للقياس؛ النسخ الاحتياطي والاستعادة ليس مقبولاً فقط هنا، إنه القرار الهندسي الصحيح، لأن دفع ثمن استراتيجية أدفأ سيكون إنفاقاً لمال لم يطلبه المتطلب أبداً. خدمة توثيق مدفوعات هي الحالة المعاكسة: دقيقة توقف أو أي معاملة مفقودة أمر غير مقبول، وهذا يبرر تكلفة وتعقيد النشاط الكامل متعدد المواقع. لا فريق مخطئ هنا. طابق كل فريق الاستراتيجية بـ RTO وRPO اللذين يحتاجهما العمل فعلاً، وهذا بالضبط الهدف من وجود 4 استراتيجيات بدل التوجه دائماً للأغلى.

الحد الفاصل: النسخ الاحتياطي والاستعادة مقابل الإشعال التجريبي

هاتان الاستراتيجيتان الأكثر خلطاً، لأن كلتيهما تحفظ بياناتك آمنة في Region ثانٍ، وكلتاهما تبدو من الخارج مثل "لدينا نسخ احتياطية في مكان آخر". الفرق هو مصير الحوسبة. لا تملك النسخ الاحتياطي والاستعادة أي بنية تحتية جاهزة على الإطلاق؛ يُزوَّد كل شيء من البنية التحتية كشيفرة فقط بعد إعلان الكارثة. يُبقي الإشعال التجريبي جزءاً أساسياً حياً ومتكرراً باستمرار، غالباً طبقة البيانات وحدها، بينما تبقى بقية المكدس، خوادم التطبيق مثلاً، مطفأة تماماً حتى يُشعلها التبديل. ذلك الفرق الوحيد، هل يوجد شيء غير البيانات جاهز مسبقاً أصلاً، هو ما يفصل الاستراتيجية الأرخص عن التي تليها مباشرة.

النشاط-النشاط يعود، بمدى أكبر

النشاط الكامل متعدد المواقع ليست فكرة جديدة اخترعت خصيصاً للتعافي من الكوارث. إنها نمط النشط-النشط نفسه من الدرس السابق، حيث تخدم كل نسخة الحركة في آن واحد، ممدوداً من نطاق مناطق الإتاحة داخل Region واحدة إلى نطاق Regions كاملة. الآلية نفسها؛ الجغرافيا والمخاطر فقط أكبر.

الالتباس: النسخ الاحتياطية وحدها ليست خطة تعافٍ من الكوارث

من المغري معاملة "لدينا نسخ احتياطية ليلية تلقائية في Region ثانٍ" كأنها الشيء نفسه مثل "لدينا خطة تعافٍ من الكوارث". ليستا كذلك. نسخة احتياطية لم يستعد منها أحد قط فرضية عن شكل الاستعادة، لا دليل على أنها ستنجح. تملك الخطة الحقيقية إجراء استعادة موثّقاً ومُتدرَّباً عليه، وRTO معروفاً وافقت عليه الإدارة فعلياً. النسخ الاحتياطية ضرورية لكل استراتيجية من الاستراتيجيات الأربع أعلاه؛ لا تكفي وحدها لأي منها.

إشارات الامتحان: مطابقة سيناريو باستراتيجية

حين يقول السيناريو...يشير إلى
"حسّاس للتكلفة"، "يتحمّل ساعات أو أياماً من التوقف"النسخ الاحتياطي والاستعادة
"يجب أن تبقى البيانات الأساسية محدّثة، لكن تكلفة البنية التحتية الكاملة مصدر قلق"الإشعال التجريبي
"يحتاج استعادة أسرع من الإشعال التجريبي، عاملة بالفعل لكن مصغّرة"الاستعداد الدافئ
"لا يتحمّل أي توقف ملحوظ، والتكلفة ثانوية"النشاط الكامل متعدد المواقع
"أقصى فقدان بيانات مقبول"RPO
"أقصى توقف مقبول"RTO

إلى أين يقودك هذا

اختيار استراتيجية تعافٍ من الكوارث هو اختيار نقطة على مقياس بين التكلفة الثابتة وسرعة الاستعادة، لا البحث عن إجابة واحدة صحيحة؛ النقطة الصحيحة هي حيث يقع RTO وRPO الفعليان للعمل، لا أغلى منها. تجعل النسخ الاحتياطية كل استراتيجية ممكنة، لكن إجراء استعادة مُختبَراً وحده يحوّلها إلى خطة فعلية. يختم الدرس الأخير في هذا الموضوع بسؤال مختلف: كيف تكتشف فعلياً أن عطلاً وقع أصلاً، وماذا تعِد اتفاقية مستوى الخدمة الخاصة بمزوّد السحابة فعلياً حين لا تُوفى؟