ディザスタリカバリ
ディザスタリカバリ(DR)は、業務の中断を引き起こす壊滅的な事象の後に IT インフラを 迅速に復旧するための一連のポリシー、手順、ツールです。
ディザスタリカバリとは
ディザスタリカバリは、災害後に重要なシステム、データ、業務を復旧するためのプロセスの 計画と実行を含みます。データだけでなく運用環境全体の完全な復旧に 焦点を当てる点で、バックアップとは異なります。
DR は事業継続計画(BCP)の重要な構成要素であり、事業運営に必要な技術インフラの 復旧に特に焦点を当てています。
災害の種類
自然災害:地震、洪水、ハリケーン、火災。
技術的障害:ハードウェア障害、データ破損、ソフトウェアのバグ。
サイバー攻撃:Ransomware、DDoS、data wiper、妨害行為。
人的ミス:誤削除、設定ミス、運用上のミス。
インフラ障害:停電、ネットワーク障害、冷却の 問題。
RTO と RPO
Recovery Time Objective (RTO):インシデント後にサービスを復旧するために許容される最大時間。 必要な復旧の速度を決定します。
例:RTO が 4 時間とは、災害後に最大でも 4 時間以内に システムが稼働可能でなければならないことを意味します。
Recovery Point Objective (RPO):時間で測定される、許容される最大のデータ損失。 必要なバックアップ頻度を定義します。
例:RPO が 1 時間とは、許容可能な最大の損失が直近 1 時間のデータであることを意味します。
DR 戦略
Cold Site:最小限のインフラを備えた基本的な施設。使用前に完全な 構成が必要です。RTO:数日~数週間。コストは最も低い。
Warm Site:ハードウェアと接続性を備えた、部分的に構成された インフラ。データとアプリケーションのインストールが必要です。RTO:数時間~数日。コストは中程度。
Hot Site:本番環境の完全な複製で、常に稼働し 同期されています。ほぼ瞬時の failover。RTO:数分。コストは高い。
Cloud DR:複製と復旧にクラウドを利用します。柔軟性と スケーラビリティを備えます。RTO は構成に応じて変動します。
Disaster Recovery as a Service (DRaaS):クラウド上のマネージド DR サービス。
DR 計画の構成要素
Business Impact Analysis (BIA):重要なシステムと、利用不能となった場合の 影響を特定します。
Risk Assessment:さまざまな種類の災害の発生確率と影響を 評価します。
Recovery Procedures:復旧のための詳細な手順を段階的に示したもの。
Roles and Responsibilities:DR チームと明確な責任を定義します。
Communication Plan:災害中および災害後にどのように連絡するか。
Testing Schedule:定期的なテストと演習の計画。
DR 技術
データ複製:プライマリサイトと DR サイト間の同期または非同期。
Snapshots:システムとデータの point-in-time キャプチャ。
Failover Automation:システムが DR 環境への切り替えを自動化します。
Load Balancers:トラフィックを分散し、failover を容易にします。
Virtual Machine Replication:データセンター間での VM の複製。
Database Replication:データベースの継続的な複製。
復旧プロセス
1. 災害宣言:状況を評価し、DR 計画の発動を宣言します。
2. チームの招集:計画に従って DR チームを動員します。
3. Assessment:被害の範囲と影響を受けたシステムを評価します。
4. Failover:業務を DR 環境にリダイレクトします。
5. 復元:優先順位に従ってデータとアプリケーションを復元します。
6. 検証:復旧したシステムの機能をテストします。
7. 運用:プライマリが復旧する間、DR 環境で業務を維持します。
8. Failback:復旧後、業務をプライマリ環境に戻します。
DR テスト
DR 計画を検証するには、定期的なテストが不可欠です:
Tabletop Exercise:システムを起動せずに会議室で行うシミュレーション。
Walkthrough:チームとともに手順を詳細に確認すること。
Simulation Test:本番に影響を与えない完全なシミュレーション。
Parallel Test:本番と並行して DR 環境を起動します。
Full Interruption Test:本番を停止し、完全に DR で運用します。
推奨頻度:少なくとも年に 1 回、または重要な変更後。
商用ソリューション
Veeam Backup & Replication:仮想環境向けのバックアップと DR。
Zerto:VM とクラウド向けの継続的な複製と DR。
AWS Disaster Recovery:AWS 上の DR ソリューション。
Azure Site Recovery:Microsoft の DR as a Service。
VMware Site Recovery Manager:VMware 向けの DR オーケストレーション。
ベストプラクティス
- BIA に基づいて現実的な RTO と RPO を定義する
- 手順を詳細に文書化する
- 文書をオフラインでアクセス可能に保つ
- 定期的に、また変更後にテストする
- チームに DR 手順を訓練する
- 可能な限り自動化する
- 資産の最新の目録を維持する
- 計画を年次で見直し更新する
- 重要な第三者データについて DR を検討する
最終的な推奨事項
ディザスタリカバリは任意ではなく、避けられない事態に対する保険です。組織は自社のリスクプロファイルとシステムの重要性に応じた 適切な戦略に投資すべきです。定期的なテストは、 必要なときに計画が機能するかを検証する唯一の手段です。効果的な DR は データだけでなく、事業継続性と組織の評判をも保護します。
