Lakeflow Designer でビルドするすべてのビジュアル データ準備ファイルは、運用対応コードによってサポートされ、 <name>.designer.ipynbという名前のノートブックとして格納されます。 他のAzure Databricks コードに使用するのと同じツールを使用して運用環境に移行できます。Git に格納し、ジョブとして実行し、宣言型オートメーション バンドルを使用してデプロイします。
このページでは、ビジュアル データ準備ファイルをプロトタイプから運用環境に取り込む方法について説明します。
Git でのストアとバージョン
ワークスペースには、ビジュアル データ準備ファイルがネイティブに格納されます。 ビジュアル データ準備ファイルをバージョン管理するには、Git フォルダーに配置し、他のノートブックと同様に追跡します。
- ワークスペースに Git フォルダーを作成します。
- ビジュアル データ準備ファイルをその Git フォルダーに移動します。
- Git の他のノートブックと同様に、ファイルを追跡、コミット、バージョン管理します。 Git では、ファイルは
<file_name>.designer.ipynbとして表示されます。
Git フォルダーの詳細については、Azure Databricks Git フォルダーを参照してください。 ビジュアル データ準備ファイルをエクスポートまたはインポートするには、「ビジュアル データ準備ファイルの エクスポートとインポート」を参照してください。
ジョブとしてスケジュールする
ビジュアル データ準備ファイルは、ジョブとしてスケジュールすることで自動化できます。
- 直接スケジュールする: 上部メニューの [スケジュール ] ボタンをクリックして、ビジュアル データ準備ファイルのスケジュールされたジョブを作成します。
- ジョブへの追加: Azure Databricks ジョブを作成し、ビジュアル データ準備ファイルをタスクとして追加します。 これにより、そのビジュアル データ準備ファイルを、より大きなパイプライン内の他のタスクと組み合わせることができます。 タスクの [種類 ] ドロップダウンで、[ ビジュアル データの準備] を選択し、ファイルを選択します。
スケジュールされた実行では、各演算子がジョブ タスク グラフの個々のノードとして表示されるため、キャンバスで実行するのと同じ方法で演算子ごとの結果を検査できます。
既存のスケジュールを表示および管理するには、もう一度 [ スケジュール ] をクリックして一覧を開きます。 別のスケジュールを作成するには、Add schedule をクリックします。あるいは、スケジュールの を開いて、編集、今すぐ実行、一時停止、複製、Jobs で表示、または 削除 を選択します。
実行で演算子の出力を表示する
既定では、スケジュールされた実行では、出力演算子などのターミナル演算子 (ダウンストリーム接続のない演算子) に対してのみ出力が生成されます。 実行中のすべての演算子の結果を表示するには、[スケジュール] ダイアログで [詳細設定 ] を展開し、[ オペレーター出力の表示] を選択します。
実行出力サイズの制限を超えないように、大きなキャンバスではこのオプションをオフにします。
サーバーレス環境を選択する
ビジュアル データ準備ファイルを使用する場合は、対話型実行とスケジュールされたジョブの両方に使用されるサーバーレス環境を選択できます。
ノートブックの場合と同じように、右側のサイドバーの [環境] サイド ウィンドウ。 [ 基本環境] で、環境のバージョンを選択します。 「サーバーレス環境を構成する」を参照してください。
環境間でのパラメーター化
パラメーターは、SQL および Python 演算子から参照できるビジュアル データ準備ファイル全体に対して定義された名前付き値です。 パラメーターの定義と参照の詳細については、「 パラメーター」を参照してください。
パラメーターを使用すると、開発中のテスト カタログや運用環境の運用カタログなど、異なる環境に対して同じビジュアル データ準備ファイルを実行できます。
-
UI でジョブをスケジュールする場合: 各スケジュールのパラメーター値をオーバーライドします。 たとえば、
environmentパラメーターをtestに設定して実行するスケジュールと、productionに設定して実行するスケジュールを作成します。 -
バンドルを使用してデプロイする場合: ジョブの
parametersを使用してパラメーター値を設定し、バンドル ターゲットを使用して環境ごとに異なる値を指定します。 バンドル開発と運用のターゲットを使用すると、環境固有の設定で同じジョブを別々の環境にデプロイできます。 宣言型オートメーション バンドルのデプロイ モードと宣言型オートメーション バンドルの構成に関するページを参照してください。
実行時に、ビジュアル データ準備ファイルは、対話形式で実行する場合でもジョブとして実行する場合でも、そのパラメーターを同じ方法で読み取るので、すべての環境で変更なしで同じファイルが動作します。
環境ごとに異なるテーブルから読み取る
環境ごとに異なるソース テーブルから読み取る場合は、固定の Source 演算子ではなく、パラメーターを指定して SQL 演算子を使用します。
catalog、schema、およびtableパラメーターを定義し、IDENTIFIER()句でパラメーターを参照して、テーブル名を動的に作成します。
SELECT * FROM IDENTIFIER(:catalog || '.' || :schema || '.' || :table)
スケジュールまたはバンドルターゲットごとに catalog、 schema、または table パラメーターをオーバーライドして、開発中のテスト データと運用環境のデータで同じビジュアル データ準備ファイルをポイントします。
IDENTIFIER()句の詳細については、IDENTIFIER句を参照してください。
宣言型オートメーション バンドルを使用したデプロイ
宣言型オートメーション バンドルを使用すると、ソース ファイルなどのAzure Databricksリソースを定義してデプロイできるため、ソース管理、コード レビュー、テスト、CI/CD などのソフトウェア エンジニアリングのベスト プラクティスをビジュアル データ準備ファイルに適用できます。 「宣言型オートメーション バンドルとは」を参照してください。
バンドルを使用してビジュアル データ準備ファイルをデプロイするには、ノートブック タスクを定義し、.designer.ipynbのnotebook_task.notebook_pathファイル パスを参照します。 バンドルでは、Jobs UI には notebook_task のタスク タイプとして表示されますが、ビジュアル データ準備ファイルでは キーを使用します。
次の例では、バンドル構成ファイルの横にあるビジュアル データ準備ファイルを実行するジョブを定義します。
resources:
jobs:
daily_prep_job:
name: daily_prep_job
tasks:
- task_key: run_visual_data_prep
notebook_task:
notebook_path: ./my_transformation.designer.ipynb
Azure Databricks CLI を使用してバンドルをデプロイして実行します。
databricks bundle deploy
databricks bundle run daily_prep_job
ノートブック タスク キーの完全なセットについては、「 ノートブック タスク」を参照してください。 バンドル内のジョブを定義する完全なチュートリアルについては、「 宣言型オートメーション バンドルを使用したジョブの開発」を参照してください。
CI/CD を使用して自動化する
ビジュアル データ準備バンドルを自動的に検証してデプロイするには、それらを CI/CD パイプラインに統合します。 GitHub Actionsの使用例については、GitHub Actionsを参照してください。