Unityカタログのボリュームのコンテンツ検索

コンテンツ検索は、Unity Catalogの巻内の文書を準備し、索引付けします。 検索やエージェントの質問はインデックスと照合され、ユーザーとエージェントは最も関連性の高い情報をより速く、より正確に取得できます。 インデックスは各ファイルの内容をカバーするため、エージェントは複数のファイルにまたがる特定の一節を参考にして、複数のファイル全体を検索するのではなく、参考にすることができます。

コンテンツ検索は特にGenieエージェントに付属するボリュームに有用です。 Genie エージェントを使用したボリューム内のファイルの分析を参照してください。

Important

この機能は ベータ版です。 これを使用するには、ワークスペース管理者が [プレビュー] ページから Genie エージェントを使用してボリューム内のファイルを分析するを有効にする必要があります。 Manage Azure Databricks プレビューを参照してください。

Requirements

Unityカタログのボリュームのコンテンツ検索を有効にする前に、以下の要件を満たしていることを確認してください。

地域ごとの提供状況

このセクションに記載された地域でコンテンツ検索が可能です。 リストに載っていない地域では利用できません。 一部の地域では、アカウント管理者がクロスジオ処理を有効にした場合にのみ動作し、これによりAzure DatabricksがワークスペースGeo以外のファイルを処理することができます。 「クロスジオプロセス処理を有効にする」を参照してください。

クロスジオ処理を必要としない地域

ワークスペースのリージョンでは以下のリージョンでコンテンツ検索が行われます:

  • 米国中部
  • 米国東部
  • 米国東部 2
  • フランス中部
  • ドイツ中西部
  • 米国中北部
  • 米国中南部
  • スウェーデン中部
  • スイス北部
  • 米国西部
  • 米国西部 2
  • 米国西部 3

クロスジオ処理を必要とする地域

以下の地域では、コンテンツ検索を有効にする前にアカウント管理者がクロスジオ処理を有効にする必要があります:

  • オーストラリア中部
  • オーストラリア中部 2
  • オーストラリア東部
  • オーストラリア南東部
  • ブラジル南部
  • カナダ中部
  • カナダ東部
  • インド中部
  • 東アジア
  • 東日本
  • 西日本
  • 韓国中部
  • メキシコ中部
  • 北ヨーロッパ
  • ノルウェー東部
  • カタール中部
  • 南アフリカ北部
  • インド南部
  • 東南アジア
  • スイス西部
  • アラブ首長国連邦北部
  • 英国南部
  • 英国西部
  • 米国中西部
  • 西ヨーロッパ
  • インド西部

カタログエクスプローラーの巻のページからコンテンツ検索の有効化・無効を選べます。

コンテンツ検索を有効にするには:

  1. Azure Databricks ワークスペースで、Data icon.Catalog をクリックします。
  2. インデックスしたいファイルを含むボリュームを検索したり閲覧したりして、それを選びます。
  3. 概要タブの右側サイドバーにあるコンテンツ検索セクションを見つけてください。
  4. [有効化]をクリックします。

コンテンツ検索を有効にすると、Azure Databricksは初期同期を実行し、ボリューム内の対応ファイルを解析・インデックス化します。 概要タブのコンテンツ検索セクションでは、取り込み状況、最新の同期結果、ボリュームがインデックスされるまでの時間が表示されます。

コンテンツ検索は、新たに追加されたファイルや既存ファイルの編集など、ボリュームの変更を自動的に解析・インデックス化するわけではありません。 コンテンツ検索を更新して変更を反映させるには、「コンテンツ検索」セクションの「今すぐ同期」をクリックしてください。 同期をトリガーするには音量を CAN MANAGE する必要があります。

コンテンツ検索を無効にするには、「コンテンツ検索」セクションで「無効化」をクリックしてください。 コンテンツ検索を無効にすると、生成されたインデックスと処理済みのコンテンツが削除されます。 再度有効にすると、Azure Databricksがボリュームを一から再インデックスし、再び取り込みコストが発生します。

Databricksは、Genieエージェントに付与するボリュームのコンテンツ検索を有効にすることを推奨しています。 Genie エージェントを使用したボリューム内のファイルの分析を参照してください。

コンテンツ検索の請求方法

コンテンツ検索には2つのコスト要素があります:

  • 取り込み:コンテンツ検索を有効にしたり同期を実行したりすると、Azure Databricksai_parse_document AI機能を使ってファイルを解析し、インデックスを作成する前にファイルを作成します。 Databricksはこの処理を AI機能価格で請求しています。
  • クエリの提供:Lakebaseは得られたインデックスを保存し、サービスします。 Databricksは、Lakebaseが提供する計算ユニット(CU)に基づいて計算とストレージの請求を行います。 クエリサービスはインデックスサイズとクエリの同時実行性に基づいて2CUから12CUまでスケールします。 3日間トラフィックがなければ、エンドポイントはゼロにスケールし、クエリサービス用の計算コストが発生しなくなります。 現在の料金については、 Lakebase の価格に関するページを参照してください。

Genieエージェントがインデックスされたボリュームを照会すると、クエリ自体もGenie Agentコストが発生することがあります。 この特集はどのように宣伝されているかをご覧ください。

Limitations

ベータ期間中のコンテンツ検索には以下の制限があります。

  • コンテンツ検索はUnity Catalog管理ボリュームのみに対応しています。 外部ボリューム、マイファイルのボリューム、ワークスペースバインド付きのカタログ内のボリュームはサポートされていません。 「 マイ ファイルにファイルを保存する」を参照してください。
  • ボリューム全体をコンテンツ検索を有効にします。 ボリューム内のフォルダやファイルのサブセットをインデックスすることはできません。
  • 各ワークスペースはコンテンツ検索を有効にした最大100ボリュームまで持つことができます。
  • 各インデックスボリュームは最大10,000ファイルを含めることができます。
  • コンテンツ検索は50MBを超えるファイルをスキップします。
  • コンテンツ検索はPDF、JPG、JPEG、PNG、TIFF、TIF、DOCX、PPT、またはPPTXファイルに対応しています。 他のファイル形式はすべてスキップされます。
  • コンテンツ検索はAWS GovCloud、Azure Governmentのリージョン、またはFedRAMP準拠のワークスペースでは利用できません。

その他のリソース

関連情報については、次のリソースを参照してください。