Die Datendeduplizierung erregte erstmals vor fast 20 Jahren die Aufmerksamkeit der Öffentlichkeit, als Data Domain (heute Dell/EMC) seine Kampagne „Tape is dead“ startete und die ersten Deduplizierungs-Appliances auf den Markt brachte.
Bei der Datendeduplizierung geht es darum, die Speichernutzung zu maximieren und Unternehmen gleichzeitig zu ermöglichen, mehr Backup-Daten länger auf Festplatten vorzuhalten. Dies trägt dazu bei, die Effizienz festplattenbasierter Backups zu steigern, Speicherkosten zu senken und die Datensicherung grundlegend zu verändern. Dies wird erreicht, indem neue Daten mit bereits vorhandenen Daten verglichen und Redundanzen beseitigt werden, da nur eindeutige Blöcke übertragen werden. Dadurch sinkt die für die Replikation benötigte Bandbreite.
Hier sind fünf wichtige Trends bei der Deduplizierung:
1. Software statt Appliances
Viele Jahre lang bestand der Standard darin, zwei Deduplizierungs-Appliances zu kaufen – eine als Backup-Kopie, die kopierte Daten auf das andere Gerät replizieren konnte.
Diese Lösung hat durchaus ihre Vorteile, kann sich jedoch als unhandlich erweisen, wenn die Datenmengen steigen. Dann können Wiederherstellungen langsam werden und die Kosten in die Höhe schnellen.
Mittlerweile ist manche Deduplizierungssoftware ausschließlich softwarebasiert, sodass keine vorkonfigurierten Appliances erforderlich sind. Solche Software kann auf virtuellen Maschinen ausgeführt werden. Hardwarelösungen gibt es weiterhin und sie eignen sich für bestimmte Anwendungsfälle.
2. Flexibilität
Jahrelang wurde darüber gestritten, wo und wie sich eine Datendeduplizierung am besten durchführen lässt. Einige waren der Ansicht, sie müsse an der Quelle erfolgen, andere hielten die Durchführung am Ziel für besser. Ebenso bestanden manche darauf, dass sie inline erfolgen sollte, während andere eine Offline-Verarbeitung bevorzugten. Jeder Ansatz bringt Vor- und Nachteile mit sich.
Moderne Deduplizierungssysteme wurden so weiterentwickelt, dass Benutzer den Deduplizierungstyp auswählen können, der den Anforderungen ihrer Organisation am besten entspricht. Es gibt Produkte, die Optionen wie Inline-, gleichzeitige oder nachgelagerte Deduplizierung bieten.
„Wenn der Fokus auf dem Speicher oder dem Backup liegt, befindet sich der bevorzugte Ort für Komprimierung und Deduplizierung am Zielsystem“, sagte Greg Schulz, Analyst bei der StorageIO Group.
Die Inline-Deduplizierung trägt dazu bei, den Speicherbedarf zu minimieren, und eignet sich in der Regel am besten für kleinere Speicherkonfigurationen sowie Replikationsumgebungen. Bei der gleichzeitigen Deduplizierung muss nicht gewartet werden, bis die Backup-Aufträge abgeschlossen sind. Die nachgelagerte oder Offline-Deduplizierung entkoppelt die Deduplizierung von den Backup-Prozessen. Vor der Deduplizierung werden die Backup-Daten in einen temporären Festplattenspeicher geschrieben. Dies ist eine gute Möglichkeit, die Backup-Geschwindigkeit zu erhöhen, da sie von Deduplizierungs-Workloads nicht beeinträchtigt wird.
Mit dem Wachstum der Datensätze stehen Speicheradministratoren jedoch vor der Herausforderung von Datensilos, die das Speichern und Verwalten von Daten erschweren.
Eine Reed-Solomon-Datenlayouttechnik und ein Data Lake bieten Kunden Kapazitäten im Petabyte-Bereich mit schneller Inline-Deduplizierung und Datenkomprimierung zur Beseitigung von Duplikaten. Möglicherweise ist eine höhere Geschwindigkeit erforderlich – dann kann die Inline-Deduplizierung die Lösung sein.
„Die Inline-Deduplizierung bietet große Vorteile, weil sie den Speicherplatzbedarf auf der Festplatte reduziert“, sagte Brian Henderson, Director of Product Marketing für die Speicherung unstrukturierter Daten bei Dell Technologies.
„Die Kombination aus Inline-Komprimierung, Inline-Deduplizierung und nachgelagerter Deduplizierung über einen größeren Speicherpool senkt die Speicherkosten und steigert gleichzeitig die Speichereffizienz.“
3. Globale Deduplizierung
Wie bereits erwähnt, ging es bei der Deduplizierung früher darum, Daten zwischen zwei Geräten zu übertragen und die beiden miteinander zu vergleichen. Moderne Systeme können dieselbe Funktion nun global ausführen.
FalconStor beispielsweise bietet eine leistungsstarke Backup- und Recovery-Lösung, die Deduplizierung umfasst, um Backup-Fenster zu verkürzen, Kapazitäten zu optimieren, Speicherkosten zu senken und die Anforderungen an WAN-Verbindungen zu minimieren. Das Produkt StorSafe empfängt Backups aus zahlreichen Quellen, zerlegt und hasht sie und reduziert sie anschließend, sodass sie kostengünstig lokal oder in einem Cloud-Objektspeicher abgelegt werden können.
„Es werden nur global eindeutige Datenblöcke repliziert“, sagte Chris Cummings, VP of Marketing bei FalconStor.
„Die globale Deduplizierung stellt sicher, dass redundante Daten aus Außenstellen beseitigt werden, bevor sie in das zentrale Repository repliziert werden, und minimiert so den Speicherbedarf.“
4. Deduplizierung auf Unterdateiebene
Deduplizierung kann auf Datei- und Unterdateiebene erfolgen. In manchen Systemen wird Single-Instance Storage (SIS) eingesetzt, bei dem vollständige Dateien verglichen werden. Wird also eine geringfügige Änderung vorgenommen, muss die gesamte Datei erneut gespeichert werden.
Die Deduplizierung auf Unterdatei- oder Blockebene steigert die Effizienz, da die Daten in Unterblöcke aufgeteilt und mit einem Identifikationsschlüssel versehen werden. Werden zwei identische Hashschlüssel erkannt, sind die Blöcke identisch.
Sobald festgestellt wurde, dass ein Datenblock bereits im Deduplizierungs-Repository vorhanden ist, wird der Block durch einen Zeiger ersetzt, der den neuen Unterblock mit dem vorhandenen Block im Repository verknüpft.
5. Eine kapazitätsbasierte Preisgestaltung sollte vermieden werden
Einige aktuelle Dienste richten ihre Preise sowohl nach den Datenmengen als auch nach der Modellierung von Deduplizierungsraten, da die durch das Entfernen doppelter Dateien erzielte Datenreduzierung – in manchen Fällen im Verhältnis 20:1 oder höher – teuer sein kann.
„Wer versucht, für jeden Kunden Datenmengen und Deduplizierungsmodelle zu ermitteln, bindet IT-Ressourcen und schmälert den Gewinn“, sagte Cummings von FalconStor.
„Am besten ist es, einen festen niedrigen Monatspreis zu ermitteln.“