インテリジェント ドキュメント処理 (IDP) は、PDF、DOCX ファイル、画像、プレゼンテーションなどの非構造化コンテンツを、ダウンストリーム のエージェント、アプリケーション、分析を強化する構造化されたエンリッチメントされたデータに変換します。
Azure Databricksは、同じ研究で開発されたAI機能に基づいて構築されたIDPの2つの運用方法を提供します。
- Agent Bricks UI:ドキュメントの解析、抽出、分類をコードなしで行う視覚的な体験を提供します。 サンプルドキュメントのテスト、スキーマやラベルの洗練、スケール前の視覚的な検証に活用しましょう。
- SQL AI関数:Lakehouse上で直接インテリジェントな文書処理機能を実行。 これらを使って大規模に文書処理を行い、ステージをまとめて作成し、Lakeflowパイプラインでガバナンスされた本番レベルのパイプラインを構築しましょう。
インテリジェント文書処理機能
| 能力 | エージェント・ブリックス UI | SQL関数 |
|---|---|---|
| PDF、DOCX、イメージ、および PPT を構造化されたテキスト、テーブル、および図の説明に変換します。 | 文書解析 | ai_parse_document |
| 定義したスキーマを使用して、ドキュメントまたはプレーン テキストから構造化フィールドをプルします。 | 情報の抽出 | ai_extract |
| ドキュメントまたはテキストに定義済みのカテゴリを割り当て、最大 500 以上のラベルをサポートします。 | 分類 | ai_classify |
| 解析された文書を意味チャンクに変換し、検索拡張生成(RAG)やAI検索インデックス作成に対応できます。 |
ai_prep_search (ベータ) |
一般的なユース ケース
Azure Databricks 上の IDP は、さまざまなダウンストリーム アプリケーションに対応します。
- 取得拡張生成 (RAG): LLM アプリケーションのチャンク、取得品質、およびグラウンド処理を向上させるために、ドキュメントを解析および構造化します。
- 知識の抽出と分析: 主要なフィールドとメタデータを抽出して、ドキュメント データの検索、レポート、ビジネス インテリジェンスを有効にします。
- エージェント駆動型ワークフロー: ドキュメントのルーティング、分類、エンリッチを行い、自動化された意思決定とタスクの実行をサポートします。
- ドキュメントの理解と分類: ダウンストリーム処理のために、種類、トピック、またはコンテンツごとに大規模なドキュメント コーパスを整理します。
どのように機能するのか
Azure Databricks を使用すると、Lakehouse で統合されたエンドツーエンドのワークフローとしてインテリジェントなドキュメント処理が可能になります。 インジェスト、解析、エンリッチメント、ダウンストリーム分析は 1 つのプラットフォーム上に構築されているため、各ステージは複雑な統合やデータ移動を必要とせずにシームレスに連携します。
取り込みと調整
Lakeflow パイプラインを使用して、未加工のドキュメント (PDF、イメージ、DOCX ファイルなど) を取り込み、パイプラインを調整します。 インジェストとオーケストレーションは Lakehouse とネイティブに統合されているため、ドキュメントは追加のインフラストラクチャなしでダウンストリーム処理に直接フローします。
ドキュメントの解析 (ブロンズ レイヤー)
ai_parse_documentを適用して、生ファイルを構造化表現に変換します。 これにより、テキスト、テーブル/画像の説明、およびドキュメント構造をキャプチャする標準化されたブロンズ レイヤーが作成され、すべてのダウンストリーム ユース ケースに対して一貫した基盤が形成されます。抽出と分類
ai_extractとai_classifyを使用して、構造化されたフィールドとメタデータを使用して解析されたドキュメントを強化します。 これらの関数は解析された出力に対して直接動作するため、重要な情報を抽出し、ドキュメントを分類し、追加の変換手順なしでワークフローを介してルーティングすることができます。取得の準備 (RAG)
ai_prep_search(ベータ) を適用して、解析されたドキュメントを、タイトル、セクション ヘッダー、ページ参照などのドキュメント レベルのコンテキストでエンリッチされたセマンティック チャンクに変換します。 出力は AI Search インデックス作成用に書式設定され、RAG ワークロードと取得ワークロードの一貫した基盤を提供します。分析と運用化
追加の AI 関数またはその他のツール (AI/BI ダッシュボード、アプリ、AI Search) を利用して、ダウンストリーム分析、取得 (RAG)、エージェント駆動型ワークフローを実現します。 すべてのデータは Lakehouse に残るため、構造化されたドキュメント データを検索、ダッシュボード、アプリケーションにすぐに使用できます。