見出し画像

「エージェントは作るより“走らせ続ける”方が難しい」— 成功率5%の壁を越えるAgentic Infra設計

企業における生成AI活用は“魔法の杖”ではない。Episode 14「Agentic infra is the problem you're probably not thinking about」では、現場導入のボトルネックが「モデルそのもの」よりも「エージェントを動かし続けるためのインフラ(オーケストレーション、評価、人手介在、データ接続)」にあることが繰り返し語られた。本稿では、番組での議論をもとに、失敗が起きる構造と、実務で効く設計原則を整理する。


1. 95%のPoCが失敗する“見かけ倒し”の理由


  • 冒頭で触れられたMITの話題――「エンタープライズのGenAIパイロットの95%が失敗」。出演者は「分母(試行回数)が極端に大きい」「期待値過剰」を主因に挙げた。

  • 本質:PoCで作るのは“滑らかに見えるデモ”。しかし、本番に上げるには、運用・監査・信頼性という“地味な難所”を越える必要がある。

  • 引用:「モデルは年々良くなるが、企業が本当に必要とする“固有の仕事”とのギャップを埋める追加レイヤが要る」。

1-1. “AI Work Slop”という落とし穴

  • BetterUp×Stanfordが指摘した“AIが量産する体裁だけ整った無内容”。

  • 発言:「拡張(expansion)はノイズ、圧縮(compression)が価値」。長文を無批判に生成・再要約し続ける“伝言ゲーム”は、意思決定の芯を削る。

2. コンテキスト・エンジニアリング:精度は“入れる文脈”で決まる


  • 論点:「コンテキスト・ロット(文脈腐敗)は、しばしば幻覚より深刻」。

  • 典型例:社内検索インデックスに“正解がある”のに、エージェントが誤ったクエリで低品質ドキュメントを拾い、性能がWeb検索以下に落ちる。

  • ポイント:

    • 無限の情報は毒必要十分の文脈を“圧縮”して渡す設計が要。

    • 品質の定義を先に合意(「この出力は何を満たせば良いか」)。すべてはその評価軸から逆算する。

2-1. 単一 vs. 複数エージェント

  • マルチエージェントは魅力的だが、領域重複や書き込み競合で一気に複雑化。

  • 誘導原則:

    1. 読み取り系の並列は比較的安全。

    2. 書き込み系は監督レイヤ(オーケストレータ+人手承認)を必須化。

    3. ユーザーにどこまで内部状態を見せるかは製品設計の要点。

3. “エージェント・インフラ”とは何か


  • 出演者の定義は実務的だ。計画→実行→学習→ToDo更新→共有を支えるスクラッチスペース、長期実行、中断・再開、人手エスカレーション、権限・秘匿情報管理、評価基盤が揃って初めて運用可能になる。

  • 引用:「サーバに上げた“素のエージェント”は、エスカレーションした瞬間に死ぬ」。状態保存と再起動の仕組みが鍵。

3-1. Human-in-the-Loop(HITL)を“第一級”に

  • 難題ほど人の承認・分業が混ざる。多段承認や組織横断のハンドオフを、業務ロジックとして設計する。

  • 重要示唆:「人が不要なら、その業務はビジネスクリティカルではない可能性」。HITL前提の案件に集中せよ。

4. データの二層:保存データと行動データ


  • 「企業が持つデータ」は、保管データ(DB, DWH)だけではない。現場の頭の中の“やり方”(判断の癖・承認基準・回避原則)こそ差別化源。

  • 方針:エージェントを現場に寄り添わせて行動ログを収集し、“企業流の意思決定”を学習させる。

  • さらに、統計的最適化(需要予測など)と意味論的上書き(例外イベントの判断)を接着する“グルー(Glue)”が必要。

5. スケールの壁:作るより拡げる方が難しい?


  • ホットテイクへの答えは割れた。

    • 立場A:「良いエージェントを“作る”こと自体が未解決」。

    • 立場B:「スケールすると仮定が崩れ、表面積爆発で未知の不具合が噴出」。

  • 実務含意:段階的に表面積を増やし、評価レイヤで支える。評価が強いほど、安全に実験できる。

6. 実装原則:どこから始め、何を捨てるか


  • 1) スター人材の増幅から始める
    「置換ではなく拡張」。上位パフォーマーの意思決定を“教科書化”し、HITLで誤差を矯正。

  • 2) 測れるKPIの業務から
    例:「解約率低減」「一次応答時間」「請求差異検知」。数値で勝ちを確認し、範囲拡大。

  • 3) 配管(Plumbing)は極力持たない
    秘密管理・長期ジョブ・人手承認・監査ログなど、共通基盤で外だし。

  • 4) 圧縮優先のコンテキスト設計
    “全部入れ”禁止。必要最小限+参照手順をプロンプト・テンプレート化。

  • 5) 評価→改善のループを固定
    オフライン再現テスト(プロンプト/ツール/データ差分)+オンライン監視(ドリフト、承認率、回収率)。

7. まとめ:“AIの価値”はインフラに宿る


  • 生成や検索は入り口にすぎない。状態管理・人手介在・長期実行・評価・権限を接着するエージェント・インフラが、PoCをプロダクションに変える。

  • 引用で締める:「このスプリントで集中すべきは一つ――あなたのビジネスロジックを最高品質でモデル化すること。残りの配管は共通基盤に寄せよ。

オススメ記事


Next Big Wave(成長株・アイデアの種・トレンド深掘り)



いいなと思ったら応援しよう!