データファブリックとデータメッシュは、企業がデータをより迅速かつ効率的に管理・分析するのに役立つ。どちらも、より正確なデータをビジネスユーザーにより速く提供することを目指す、データ管理の異なるアプローチだ。データファブリックは情報サイロの解消を目的とする一方、データメッシュは企業のデータ分析プロセスにおけるボトルネックを減らせるよう構成される。両者は1つの組織内に同時に導入することも可能だが、目指すところは異なる。
このガイドでは、データファブリックとデータメッシュのメリットに加え、導入に伴う潜在的なデメリットや障壁について分析する。
データファブリックとは?
「データファブリック」とは、複数の場所に複数の形式で保存されたデータを接続する、自動化されたインテリジェントなシステムを利用するデータ管理アーキテクチャだ。複数のストレージソースからデータを抽出して一元化することで、データファブリックはチームが統合されたデータを全体的に分析できるようにし、より優れた洞察をもたらす。
データファブリックは、柔軟性の確保、データ管理の標準化、情報の分析、そしてチームによるより賢明なビジネス上の意思決定を支援するよう設計されている。例えば、ある企業がデータをデータベース、顧客関係管理(CRM)システム、ネットワーク接続型ストレージ(NAS)アレイに保存しているとする。データファブリックを導入すれば、チームはこれらすべてのデータをより深く把握し、3つのシステム間のサイロ化を防げる。
通常、データファブリックには連携して動作する複数のソリューションが含まれる。フル機能のデータファブリックは、複数のプロバイダーによるデータ管理またはストレージソリューションを統合する。例えば、TalendのData Fabricプラットフォームを使って、MongoDBデータベースとNetSuiteプラットフォームのデータを統合できる。また、データレイク、データウェアハウス、アプリケーションから情報を取り込むことも可能だ。
データファブリックプラットフォームは、アプリケーション・プログラミング・インターフェース(APIs)などの統合技術を利用して、Google Driveのようなアプリケーション、Microsoft SQL Serverのようなデータベース、Amazon Redshiftのようなデータウェアハウスからデータを取り込み、こうした異なるソースの情報を統合する。
データファブリックの仕組み
フル機能のデータファブリックには、次の機能が含まれる。
- 複数のデータ保存形式への対応理想的には、構造化データと非構造化データの両方に対応する必要がある。ほとんどの企業が両方を扱っているためだ。
- データの取り込み・統合機能関連するすべてのアプリケーションから生データを収集して1カ所に転送し、その後、分析に向けてすべてのデータを統合する必要がある。
- 複数のネットワーク経路データが非常に多くの方向へ移動するため、情報の通り道を複数用意することが重要だ。そうしなければネットワークが滞り、遅延が増大する可能性がある。
データファブリックは、取り込みと統合によって構造化データと非構造化データの両方を収集・分析する。取り込み技術には、Apache Kafka、Databricks、Amazon Kinesisなどの取り込みツールを使った抽出・変換・ロード(ETL)処理やSQLコマンドが含まれる。自動取り込みは、人的ミスの可能性を減らせるため、手動での取り込みより望ましい。
データファブリックでは、データを統合する、つまり単一のウェアハウスやレイクなどの中核的な1カ所に取り込んだ後、すべてのデータをまとめてクレンジング・分析する必要もある。データファブリックの主要な要素の1つは、サイロの排除だ。例えば、顧客データの一部がSAPに保存され、別のデータがSalesforceに保存されている場合、それらをすべて結合するまで顧客属性を正確に把握できない可能性がある。重複データや不正確な情報、古い情報などが問題になり得る。
データファブリックの用途とは?
データファブリックは、多くの異なる場所にデータを保存している企業、特に複数のデータベースやその他のストレージシステムを持つ大企業に適している。また、大量の情報を一元化するため、ビッグデータ運用にもメリットをもたらす。データファブリックでは、データの柔軟性と俊敏性が重要だ。複数のソースから情報を迅速に分析するには、データファブリックがストレージシステム間でデータを効率的に移動できなければならない。
データファブリックのデメリットの1つは、単純にセットアップに必要な労力だ。こうしたストレージソリューションをすべて統合し、分析対象のデータが高品質かつ正確になるようデータガバナンスのベストプラクティスを確立するには、数カ月かかることもある。これは、中小企業や、小規模なビジネスインテリジェンスチームまたはデータチームを抱える組織にとって、特に難しい可能性がある。
データメッシュとは?
データメッシュとは、単一のソースに集約するのではなく、データ分析を分散させ、複数の部門からすぐに利用できるようにするデータ管理アーキテクチャだ。データメッシュは次の特徴を持つ。
- データを第一級のプロダクトとして重視するデータは適切に管理・保護し、価値あるものとして扱う必要がある。
- 関連する事業部門に基づいてデータを分類するこれは、人事データのすべてを他の業務データから自動的に分離してサイロ化するという意味ではない。ただし、人事情報をまとめて管理するという意味ではある。
- データに最も近いビジネスユーザーにアクセス権を付与する例えば、CRMデータは営業チームがすぐ利用でき、会計データは財務部門がすぐ利用できるようにする。
データメッシュを導入する企業は、構造化データと非構造化データのすべてを収める単一のデータレイクを持ちながら、カテゴリー検索を容易にする方法でメタデータを分類できる。データの正確性とクリーンさについても定期的に検証し、例えば重複を排除する必要がある。各チームは企業のデータ管理ソフトウェア内に専用のアカウントを持ち、関連するデータを検索できる。
データアクセスには、ユーザーが業務に関連する情報を理解するのに役立つ分析機能も含まれる。例えば、従来の企業データアーキテクチャでは、マーケティングチームがビジネスインテリジェンスチームにダッシュボードを申請し、BIチームは申請がキューに入るとダッシュボードを作成していた。しかし、重要なキャンペーンのためにマーケティングチームがすぐにデータを必要としたらどうだろうか。
データメッシュは、適切なチームがデータを直接利用できるようにし、より迅速な意思決定を可能にする。単一の分析チームだけに頼ることで生じるボトルネックを取り除けば、全体的な効率が向上し、手作業が減り、データ分析が簡素化され、収益が増加する可能性さえある。データを即座に活用できることは、多くの営業、ウェブ、テクノロジーチームにとって重要だ。
データメッシュは、データをプロダクトとして扱うことにも重点を置く。これは、データを広範で曖昧な概念ではなく、プロダクトとして扱うという意味だ。データは適切に管理・保護し、価値あるものとして扱うとともに、簡単にアクセスして利用できなければならない。
データメッシュには、次の要素が必要だ。
- 明確なガバナンス要件各チームは、自部門の特定のデータを誰が管轄し、その担当者がどのように管理するのかを把握しておく必要がある。
- アクセス制御セキュリティ上の理由から、データを閲覧または編集する真の必要性がある人だけがアクセスできるようにする。
- 品質保証データを必要とするチームにとって有用かつ正確なものになるよう、クレンジングして整理する必要がある。
大規模なデータセットの管理に適した最適なデータガバナンスツールについて詳しく知る。
データメッシュの仕組み
データメッシュは、ほとんどのストレージ技術とは異なり、ハードウェアとソフトウェアの具体的な実装ではなく、企業全体でデータを利用可能にするための一般的なアプローチだ。組織ごとのアプローチによって、その形は異なる。
まず、すべてのチームがデータに関するドメイン知識とオーナーシップを持つ必要がある。これを教え、育てるには時間がかかるが、主要なチームメンバーはチャートやグラフの読み方、重要なデータの見極め方、データをクリーンで整理された状態に保つ方法を学ばなければならない。
チームは、安全なデータアクセス方法も備える必要がある。例として、シングルサインオン(SSO)や多要素認証(MFA)が挙げられる。企業は、業務遂行のために明示的にデータを必要とするユーザーだけが閲覧・編集できるよう、厳格なアクセス制御を設定する必要がある。
ビジネスユーザーは、どうすれば簡単にデータを見つけられるだろうか。データが構造化されているデータウェアハウスやデータベースでは、簡単かつ論理的にクエリを実行できるようにする必要がある。オブジェクトストアやその他の非構造化データ環境では、メタデータが理解しやすく、簡単に検索できなければならない。
保存データのセキュリティ対策について詳しく知る。
データメッシュの用途とは?
データメッシュは、重要な情報への既存のボトルネックを解消するため、すべての業務部門やチームにとって便利だ。データメッシュアーキテクチャのメリットを得られるチームには、次のようなものがある。
- 営業
- マーケティング
- 編集
- 検索エンジン最適化
- ペイドメディア
- エンジニアリング
- プロダクト
- ソーシャルメディア
- 情報技術
各チームは企業内で異なる役割を担っているが、意思決定には正確で整理されたデータを必要とするチームがほとんどだ。データメッシュは情報を第一級のプロダクトとして扱うため、データが業務運営にどれほど重要かを認識している。企業の世界では、データはもはや後回しにできるものではなく、最優先事項だ。
データメッシュアーキテクチャの潜在的なデメリットの1つは、データセキュリティだ。複数のチームが企業データにアクセスできると、セキュリティプロトコルやコンプライアンスにとって危険になり得る。機密情報を扱える人が増えるほど、セキュリティ侵害のリスクは高まる。厳格なID・アクセス管理などの方法でデータを保護できるものの、企業にとっては依然としてデメリットとなる。軽減は可能だが、対応には時間がかかる。
データメッシュが難しいもう1つの理由は、各チームにデータと関連技術を管理できるメンバーが必要になることだ。例えば、各チームにダッシュボードを作成でき、データクレンジングツールの使い方を知っている人が必要になる可能性がある。そのため、データメッシュの導入を成功させるのは、ほとんどの中小企業にとって難しいかもしれない。従業員数が十分でないことが理由だ。
まとめ:知っておくべきこと
データファブリックとデータメッシュは、どちらも企業にとって有用なデータアーキテクチャだ。組織が両方を利用することも可能だが、データをいつ一元化するのか(ファブリック)、いつ異なるチームに分散するのか(メッシュ)を判断する必要がある。どちらのアプローチにもメリットがある一方、慎重な計画とデータ保護対策が求められる。次に最適なデータ管理プラットフォームについて詳しく読む。