データ重複排除が初めて世間の注目を集めたのは、今から約20年前のことだ。当時、Data Domain(現Dell/EMC)が「テープは死んだ」キャンペーンを展開し、初期の重複排除アプライアンスを発売した。
データ重複排除とは、ストレージの利用効率を最大化しながら、組織がより多くのバックアップデータをより長期間ディスク上に保持できるようにする仕組みだ。これにより、ディスクベースのバックアップの効率を高め、ストレージコストを削減し、データ保護の方法を変えられる。新しいデータと既存データを比較し、一意のブロックだけを転送することで冗長性を排除する。これにより、レプリケーションに必要な帯域幅を削減できる。
重複排除における主要なトレンドを5つ紹介する。
アプライアンスではなくソフトウェア
長年にわたり標準的だったのは、重複排除アプライアンスを2台購入する方法だ。1台をバックアップコピー用とし、コピーしたデータをもう1台にレプリケーションできるようにする。
このソリューションには確かな価値があるが、データ量が増えると扱いにくくなる可能性がある。そうなるとリストアに時間がかかり、コストが急増することもある。
現在では、あらかじめ構築されたアプライアンスを必要としない、ソフトウェアのみの重複排除も存在する。このようなソフトウェアは仮想マシン上で実行できる。ハードウェアソリューションも引き続き存在し、有効な用途がある。
柔軟性
データ重複排除をどこで、どのように実行するのが最善かについては、長年にわたり議論が続いてきた。ソース側で実行すべきだという意見もあれば、ターゲット側で実行する方がよいという意見もあった。同様に、インラインで実行すべきだと主張する人がいる一方、オフラインで実行すべきだという人もいた。それぞれの方式にはトレードオフがある。
現在の重複排除システムは進化し、組織の要件に最も適した重複排除方式をユーザーが選択できるようになっている。インライン、同時実行、ポストプロセスなどの重複排除方式を選べる製品が提供されている。
「ストレージやバックアップを重視するのであれば、圧縮と重複排除を実行する場所はターゲット側になる」と、StorageIO Groupのアナリスト、Greg Schulz氏は話す。
インライン重複排除は必要なストレージ容量を最小限に抑えるのに役立ち、小規模なストレージ構成やレプリケーション環境に最も適している傾向がある。同時実行型の重複排除では、バックアップジョブの完了を待つ必要がない。ポストプロセス型、つまりオフラインの重複排除では、重複排除処理をバックアッププロセスから切り離す。重複排除の前にバックアップデータを一時ディスク領域に書き込むため、バックアップの速度は重複排除の負荷に左右されない。バックアップ時間を短縮するには有効な方法だ。
しかし、データセットが大きくなると、ストレージ管理者はデータの保存と管理を難しくするサイロ化という課題に直面する。
Reed Solomon方式のデータレイアウト技術とデータレイクにより、顧客はペタバイト級の容量を利用できる。さらに、高速なインライン重複排除とデータ圧縮によって重複を排除する。より高速な処理が必要になる可能性があり、その答えがインライン重複排除になることもある。
「インライン重複排除は、ディスク上の使用容量を削減する大きなメリットをもたらす」と、Dell Technologiesで非構造化データストレージの製品マーケティング担当ディレクターを務めるBrian Henderson氏は話す。
「インライン圧縮、インライン重複排除、そしてより広いストレージプール上でのポストプロセス型重複排除を組み合わせることで、ストレージ効率を高めながらストレージコストを削減できる」
グローバル重複排除
前述のとおり、従来の重複排除は、2台のボックス間でデータを転送し、一方と他方を比較するものだった。現在のシステムでは、同じ機能をグローバルに実行できる。
例えばFalconStorは、バックアップウィンドウを短縮し、容量を最適化し、ストレージコストを削減するとともに、WANに必要な帯域幅を最小化する重複排除機能を備えた高性能なバックアップ・リカバリを提供している。同社のStorSafeは多数のソースからバックアップを受け取り、データをチャンク化、ハッシュ化、削減することで、オンプレミスやクラウドのオブジェクトストレージに低コストで保存できるようにする。
「レプリケーションされるのは、グローバルに一意なデータブロックだけだ」と、FalconStorのマーケティング担当バイスプレジデント、Chris Cummings氏は話す。
「グローバル重複排除により、中央リポジトリにレプリケーションする前にリモートオフィスの冗長データを排除できるため、必要な容量を最小化できる」
サブファイル重複排除
重複排除は、ファイルレベルでもサブファイルレベルでも実行できる。一部のシステムでは、完全なファイル同士を比較するシングルインスタンスストレージ(SIS)が使われる。そのため、わずかな変更が加えられただけでも、ファイル全体を再び保存しなければならない。
サブファイル型、つまりブロックベースの重複排除では、データをサブブロックに分割し、識別キーを割り当てることで効率を高める。同一のハッシュキーが2つ見つかった場合、それらのブロックは同一だと判断できる。
データブロックが重複排除リポジトリにすでに存在すると判定されると、そのブロックは、新しいサブブロックをリポジトリ内の既存ブロックにリンクするポインターに置き換えられる。
容量ベースの料金設定は避けるべき
現在、一部のサービスでは、データ量に加えて重複排除率のモデルに基づいて料金を設定している。重複ファイルを排除することで達成されるデータ削減量は、場合によっては20対1以上になるため、その処理にはコストがかかる可能性がある。
「顧客ごとにデータ量と重複排除のモデルを測定しようとすると、ITリソースを拘束し、利益を圧迫する」と、FalconStorのCummings氏は話す。
「最善の方法は、月額の固定料金を低く設定することだ」