PolyBase で外部データソースとしてGoogle Data Catalog を連携利用

詳細情報をご希望ですか?

無償トライアル:

ダウンロードへ

製品の詳細情報へ:

Google Data Catalog ODBC Driver

Google Data Catalog ODBC Driver を使って、ODBC 接続をサポートするあらゆるアプリケーション・ツールからAGoogle Data Catalog にデータ連携。

Google Data Catalog データにデータベースと同感覚でアクセスして、Google Data Catalog データに使い慣れたODBC インターフェースで双方向連携。



CData ODBC Driver for Google Data Catalog とSQL Server 2019 のPolyBase を使って、リアルタイムGoogle Data Catalog に外部データソースとしてアクセス。

SQL Server のPolyBase は、データベーステーブルをクエリするTransact-SQL 構文を使って、外部データにクエリする仕組みです。 CData ODBC Drivers for Google Data Catalog を組み合わせて使うことで、SQL Server データと同じようにGoogle Data Catalog へのアクセスが可能です。 本記事では、外部データソースと外部テーブルの作成から、T-SQL クエリを使ってライブGoogle Data Catalog データへ接続を認可するところまで説明します。

CData ODBC ドライバーは、ドライバーに組み込まれた最適化されたデータ処理により、PolyBase でライブGoogle Data Catalog データを送受信するための圧倒的なパフォーマンスを提供します。SQL Server からGoogle Data Catalog に複雑なSQL クエリを発行すると、ドライバーはフィルタや集計などのサポートされているSQL 操作をGoogle Data Catalog に直接プッシュダウンし、組み込みSQL エンジンを利用して、サポートされていない操作(一般的にはSQL 関数とJOIN 操作) をクライアント側で処理します。また、PolyBase を使用することで、単一のクエリを使用して分散ソースからデータをプルし、SQL Server データをGoogle Data Catalog と結合することもできます。

Google Data Catalog への接続

未指定の場合は、初めにODBC DSN(data source name)で接続プロパティを指定します。ドライバーのインストールの最後にアドミニストレーターが開きます。Microsoft ODBC Data Source Administrator を使用して、ODBC DSN を作成および構成できます。PolyBase を使用してSQL Server に外部データソースを作成するには、System DSN を構成します。(CData Google Data Catalog Sys は自動的に作成されます。)

Google Data Catalog uses the OAuth authentication standard. Authorize access to Google APIs on behalf on individual users or on behalf of users in a domain.

Before connecting, specify the following to identify the organization and project you would like to connect to:

  • OrganizationId: The ID associated with the Google Cloud Platform organization resource you would like to connect to. Find this by navigating to the cloud console.

    Click the project selection drop-down, and select your organization from the list. Then, click More -> Settings. The organization ID is displayed on this page.

  • ProjectId: The ID associated with the Google Cloud Platform project resource you would like to connect to.

    Find this by navigating to the cloud console dashboard and selecting your project from the Select from drop-down. The project ID will be present in the Project info card.

When you connect, the OAuth endpoint opens in your default browser. Log in and grant permissions to the application to completes the OAuth process. For more information, refer to the OAuth section in the Help documentation.

[接続のテスト]をクリックして、DSN がGoogle Data Catalog に正しく接続できているかを確認します。[テーブル]タブに移動し、Google Data Catalog のテーブル定義を確認します。

Google Data Catalog データの外部データソースを作成

接続を構成したのち、外部データソースのマスター暗号化キーと資格情報データベースを作成する必要があります。

マスター暗号化キーの作成

以下のSQL コマンドを実行して新しいマスターキー[ENCRYPTION]を作成し、外部データソースの資格情報を暗号化します。

CREATE MASTER KEY ENCRYPTION BY PASSWORD = 'password';

資格情報データベースの作成

以下のSQL コマンドを実行してGoogle Data Catalog に接続されている外部データソースの資格情報を作成します。

Note:Google Data Catalog は認証にUser やPassword を必要としないため、IDENTITY とSECRET に任意の値を使用できます。

CREATE DATABASE SCOPED CREDENTIAL googledatacatalog_creds
WITH IDENTITY = 'username', SECRET = 'password';

Google Data Catalog の外部データソースを作成

以下のSQL コマンドを実行し、以前作成したDSN と資格情報を使用して、PolyBase でGoogle Data Catalog の外部データソースを作成します。

Google Data Catalog の場合、SERVERNAME を[localhost]または[127.0.0.1]に設定し、PORT を空のままにします。PUSHDOWN は、デフォルトでON に設定されているため、ODBC Driver は、サーバー側の処理を利用して複雑なクエリを実行できます。

CREATE EXTERNAL DATA SOURCE cdata_googledatacatalog_source
WITH ( 
  LOCATION = 'odbc://SERVERNAME[:PORT]',
  CONNECTION_OPTIONS = 'DSN=CData Google Data Catalog Sys',
  -- PUSHDOWN = ON | OFF,
  CREDENTIAL = googledatacatalog_creds
);

Google Data Catalog の外部テーブルを作成

外部データソースを作成したら、CREATE EXTERNAL TABLE ステートメントを使用してSQL Server インスタンスからGoogle Data Catalog にリンクします。テーブルカラムの定義は、CData ODBC Driver for Google Data Catalog によって公開されているものと一致しなければなりません。DSN Configuration Wizard の[テーブル]タブを参照し、テーブルの定義を確認できます。

CREATE TABLE ステートメントのサンプル

以下は、Google Data Catalog Schemas に基づいて外部テーブルを作成するステートメントの一例です。

CREATE EXTERNAL TABLE Schemas(
  Type [nvarchar](255) NULL,
  DatasetName [nvarchar](255) NULL,
  ...
) WITH ( 
  LOCATION='Schemas',
  DATA_SOURCE=cdata_googledatacatalog_source
);

SQL Server インスタンスでGoogle Data Catalog の外部テーブルを作成すると、ローカルデータとリモートデータを同時にクエリできるようになります。CData ODBC Driver に組み込まれているクエリ処理により、可能な限り多くのクエリ処理がGoogle Data Catalog にプッシュされることで、ローカルのリソースと計算リソースが解放されます。ODBC Driver for Google Data Catalog の30日間無料トライアルをダウンロードし、SQL Server データでライブGoogle Data Catalog データを使い始めましょう。