本記事では CData サポート担当からこんなことを聞かれたらどこを確認すべきか?という観点で、よく頂くお問合せ内容をご紹介します。
記事はこちら →CData Cmdlets for Databricks をつかって、PowerShell からリアルタイムDatabricks data に連携できます。データ同期などのタスクの連携にぴったりの製品です。 本記事では、PowerShell からCData Cmdlets for Databricks およびCData Cmdlets for MySQL を使って、同期スクリプトを作成して実行します。
まずは、PowerShell でDatabricks への接続を行います。レプリケーションは4つのステップがあります。
To connect to a Databricks cluster, set the properties as described below.
Note: The needed values can be found in your Databricks instance by navigating to Clusters, and selecting the desired cluster, and selecting the JDBC/ODBC tab under Advanced Options.
モジュールのインストール:
Install-Module DatabricksCmdlets
Databricks への接続:
$databricks = Connect-Databricks -Server $Server -Port $Port -TransportMode $TransportMode -HTTPPath $HTTPPath -UseSSL $UseSSL -User $User -Password $Password
取得ターゲットのリソースの取得:
$data = Select-Databricks -Connection $databricks -Table "Customers"
Invoke-Databricks cmdlet を使って、SQL-92 クエリを使用することもできます:
$data = Invoke-Databricks -Connection $databricks -Query 'SELECT * FROM Customers WHERE Country = @Country' -Params @{'@Country'='US'}
戻り値からカラム名のリストを保存します。
$columns = ($data | Get-Member -MemberType NoteProperty | Select-Object -Property Name).Name
カラム名を指定できるようにして、データをMySQL データベースにレプリケーションします。
モジュールのインストール:
Install-Module MySQLCmdlets
MySQL DB に、MySQL Server 名、ユーザー、パスワード、レプリケーション先のデータベース名を指定して、接続します:
$mysql = Connect-MySQL -User $User -Password $Password -Database $Database -Server $Server -Port $Port
Databricks、保存された値、そしてAdd-MySQL Cmdlet を使って、MySQL にデータを1レコードずつ挿入します。この例では、MySQL 側のテーブルは、Databricks のリソース(Customers)と同じテーブル名を持っている必要があります。
$data | % {
$row = $_
$values = @()
$columns | % {
$col = $_
$values += $row.$($col)
}
Add-MySQL -Connection $mysql -Table "Customers" -Columns $columns -Values $values
}
これで、Databricks データをMySQL に複製できました。これで、分析、BI などでDatabricks データをMySQL から使うことができるようになります。
一度PowerShell でDatabricks とMySQL に接続したら、次からは1行のコマンドでレプリケーションを実施できます:
Select-Databricks -Connection $databricks -Table "Customers" | % {
$row = $_
$values = @()
$columns | % {
$col = $_
$values += $row.$($col)
}
Add-MySQL -Connection $mysql -Table "Customers" -Columns $columns -Values $values
}
別のPowerShell モジュールで、Databricks を別のデータベースに複製する場合、Select-Databricks cmdlet のデータから、カラム、接続およびテーブルを除外する方がいいでしょう。これらのデータは、CData cmdlet からデータを移動する際にのみ必要なものだからです。:
$columns = ($data | Get-Member -MemberType NoteProperty | Select-Object -Property Name).Name | ? {$_ -NotIn @('Columns','Connection','Table')}