La déduplication des données a commencé à captiver le grand public il y a près de 20 ans, lorsque Data Domain (désormais Dell/EMC) a lancé sa campagne « tape is dead » et commercialisé les premières appliances de déduplication.
La déduplication des données consiste à optimiser l’utilisation du stockage tout en permettant aux organisations de conserver davantage de données de sauvegarde sur disque pendant plus longtemps. Cela contribue à améliorer l’efficacité des sauvegardes sur disque, à réduire les coûts de stockage et à modifier la manière dont les données sont protégées. Elle y parvient en comparant les nouvelles données aux données existantes et en éliminant les redondances, puisque seuls les blocs uniques sont transférés. Cela réduit la bande passante nécessaire à la réplication.
Voici cinq grandes tendances de la déduplication :
Logiciels plutôt qu’appliances
Pendant de nombreuses années, la norme consistait à acheter deux appliances de déduplication — l’une servant de copie de sauvegarde et pouvant répliquer les données copiées vers l’autre boîtier.
Cette solution présente certes un intérêt, mais elle peut devenir encombrante lorsque les volumes de données augmentent. Dans ce cas, les restaurations peuvent être lentes et les coûts s’envoler.
La déduplication est désormais parfois proposée uniquement sous forme logicielle, ce qui évite de recourir à des appliances préconfigurées. Ces logiciels peuvent fonctionner sur des machines virtuelles. Les solutions matérielles existent toujours et restent adaptées à certains cas d’usage.
Flexibilité
Pendant des années, un débat a fait rage sur le lieu et la manière les plus appropriés pour effectuer la déduplication des données. Certains estimaient qu’elle devait être réalisée à la source, tandis que d’autres jugeaient préférable de l’effectuer sur la cible. De même, certains insistaient pour qu’elle soit réalisée en ligne, quand d’autres préconisaient un traitement hors ligne. Chaque approche comporte des compromis.
Les systèmes de déduplication modernes ont évolué et permettent à l’utilisateur de sélectionner le type de déduplication répondant le mieux aux exigences de son organisation. Il existe des produits proposant notamment la déduplication en ligne, simultanée ou post-traitement.
« Si l’objectif concerne le stockage ou la sauvegarde, la cible sera privilégiée pour la compression et la déduplication », a déclaré Greg Schulz, analyste chez StorageIO Group.
La déduplication en ligne contribue à réduire les besoins en stockage et convient généralement mieux aux configurations de stockage de petite taille ainsi qu’aux environnements de réplication. La déduplication simultanée n’a pas besoin d’attendre la fin des tâches de sauvegarde. La déduplication post-traitement, ou hors ligne, dissocie la déduplication des processus de sauvegarde. Les données de sauvegarde sont écrites sur un espace disque temporaire avant la déduplication. Cette méthode permet de raccourcir la durée des sauvegardes, qui ne sont pas affectées par les charges de travail liées à la déduplication.
Mais à mesure que les jeux de données grossissent, les administrateurs du stockage doivent composer avec des silos qui compliquent le stockage et la gestion des données.
Une technique de disposition des données de Reed-Solomon et un lac de données offrent aux clients une capacité à l’échelle du pétaoctet, avec une déduplication et une compression des données à grande vitesse en ligne pour éliminer les doublons. Une vitesse accrue peut s’avérer nécessaire, et la déduplication en ligne peut être la solution.
« La déduplication en ligne offre d’importants avantages en réduisant l’espace occupé sur disque », a déclaré Brian Henderson, directeur du marketing produit pour le stockage de données non structurées chez Dell Technologies.
« La combinaison de la compression en ligne, de la déduplication en ligne et de la déduplication post-traitement sur un pool de stockage plus vaste contribue à réduire les coûts de stockage tout en améliorant son efficacité. »
Déduplication globale
Comme indiqué précédemment, la déduplication consistait autrefois à transférer des données entre deux boîtiers et à les comparer. Les systèmes modernes peuvent désormais assurer la même fonction à l’échelle globale.
FalconStor, par exemple, fournit des fonctions de sauvegarde et de restauration hautes performances qui intègrent la déduplication afin de raccourcir les fenêtres de sauvegarde, d’optimiser la capacité, de réduire les coûts de stockage et de limiter les besoins en liaisons WAN. Son produit StorSafe reçoit les sauvegardes provenant de nombreuses sources, puis les découpe en fragments, calcule leurs hachages et les réduit, afin de pouvoir les stocker à moindre coût sur site ou dans un stockage objet cloud.
« Seuls les blocs de données uniques à l’échelle globale sont répliqués », a déclaré Chris Cummings, vice-président du marketing chez FalconStor.
« La déduplication globale garantit que les données redondantes des bureaux distants sont éliminées avant leur réplication vers le référentiel central, ce qui réduit les besoins en espace. »
Déduplication au niveau des sous-fichiers
La déduplication peut être effectuée au niveau du fichier et du sous-fichier. Dans certains systèmes, le stockage à instance unique (SIS) compare les fichiers complets. Ainsi, si une modification mineure est apportée, l’intégralité du fichier doit être stockée à nouveau.
La déduplication au niveau des sous-fichiers, ou fondée sur les blocs, améliore l’efficacité, car les données sont divisées en sous-blocs auxquels est attribuée une clé d’identification. Si deux clés de hachage identiques sont détectées, les blocs sont identiques.
Une fois établi qu’un bloc de données existe déjà dans le référentiel de déduplication, le bloc est remplacé par un pointeur reliant le nouveau sous-bloc au bloc existant dans le référentiel.
Il faut éviter la tarification fondée sur la capacité
Certains services actuels fondent leur tarification sur les volumes de données ainsi que sur la modélisation des taux de déduplication, car la réduction de données obtenue en éliminant les fichiers en double — qui peut atteindre un ratio de 20:1 ou plus dans certains cas — peut s’avérer coûteuse.
« Toute personne qui tenterait de mesurer les volumes de données et de modéliser la déduplication pour chaque client mobiliserait les ressources informatiques et réduirait les bénéfices », a déclaré Cummings, de FalconStor.
« La meilleure approche consiste à trouver un tarif mensuel fixe et peu élevé. »