見出し画像

【無料】Meta SAM Audio登場!「言葉で音を選ぶ」音声分離AIが革命的すぎる


🎯 この記事でわかること

「動画から犬の鳴き声だけ消したい...」

「バンド演奏からギターだけ抜き出したい...」

これ、高価なソフトと専門知識がないと無理でしたよね。

2025年12月16日、Metaが発表したSAM Audioが、この常識を覆しました。

「犬の鳴き声を消して」と言葉で指示するだけで、60分の動画全体から犬の声だけを消せます。

しかも完全オープンソースで、ブラウザで今すぐ無料で試せます

この記事では、以下の内容をわかりやすく解説します。

  • SAM Audioとは?

  • 3つの革新的なプロンプト方式

  • 実用的な活用シーン

  • 今すぐ試す方法

音声編集の民主化、一緒に見ていきましょう!


📖 目次



1. SAM Audioとは?

🎵 「Segment Anything」の音声版

SAM Audioは、Metaの「Segment Anything」シリーズの最新作です。

┌────────────────────────────────────────┐
│      Segment Anythingシリーズ          │
├────────────────────────────────────────┤
│                                        │
│  2023年4月  SAM      → 画像            │
│  2024年7月  SAM 2    → 動画            │
│  2025年11月 SAM 3    → コンセプト      │
│  2025年11月 SAM 3D   → 3D空間          │
│  2025年12月 SAM Audio → 音声 ← NEW!    │
│                                        │
│  「あらゆるものをセグメント化する」    │
│  というMetaのビジョン                  │
│                                        │
└────────────────────────────────────────┘

🔧 従来のツールとの決定的な違い

┌────────────────────────────────────────┐
│      従来のツール(Spleeter等)        │
├────────────────────────────────────────┤
│                                        │
│  ・「ボーカル」「ドラム」など          │
│    事前定義されたカテゴリのみ          │
│                                        │
│  ・「交通騒音」「エアコンの音」は      │
│    対応不可能                          │
│                                        │
│  ・複数のツールを使い分けが必要        │
│                                        │
└────────────────────────────────────────┘

┌────────────────────────────────────────┐
│      SAM Audio                         │
├────────────────────────────────────────┤
│                                        │
│  ・「任意の音」を言葉で指定可能        │
│                                        │
│  ・「犬の鳴き声」「車のエンジン音」    │
│    「群衆の歓声」など何でもOK          │
│                                        │
│  ・単一モデルで統合的に処理            │
│                                        │
└────────────────────────────────────────┘

🧠 PE-AVエンジン:1億の動画で学習

SAM Audioの核心技術はPE-AV(Perception Encoder Audiovisual)エンジンです。

1億件以上の動画-音声ペアで学習し、「画面上で人が話している」→「その人の声はこの周波数帯」という視聴覚の対応関係を獲得しています。

処理速度はRTF 0.7(リアルタイムより30%高速)。5分の音声を約3.5分で処理できます。


2. 3つの革新的なプロンプト方式

💬 ① テキストプロンプト

自然言語で音を指定するだけで分離できます。

┌────────────────────────────────────────┐
│      テキストプロンプトの例            │
├────────────────────────────────────────┤
│                                        │
│  「犬の鳴き声」                        │
│  「ピアノの音」                        │
│  「女性の声」                          │
│  「車のエンジン音」                    │
│  「エアコンの音」                      │
│                                        │
│  → 言葉で指定するだけで分離!         │
│                                        │
└────────────────────────────────────────┘

特に効果的なのは具体的な指定です。「背景ノイズ」より「air conditioning hum(エアコンの音)」のように具体的に書くと精度が上がります。

👆 ② ビジュアルプロンプト

動画内の人物や物体をクリックするだけで、その音だけを分離できます。

┌────────────────────────────────────────┐
│      ビジュアルプロンプトの例          │
├────────────────────────────────────────┤
│                                        │
│  🎸 バンド演奏動画でギタリストをクリック│
│     → ギターの音だけ抽出              │
│                                        │
│  🎤 インタビュー動画で話者をクリック   │
│     → その人の声だけ抽出              │
│                                        │
│  🥁 コンサートでドラマーをクリック     │
│     → ドラムトラックのみ抽出          │
│                                        │
└────────────────────────────────────────┘

これはSAM 3との連携で実現しています。画面上のオブジェクトを認識し、その音響発生源を特定します。

⏱️ ③ スパンプロンプト(業界初!)

時間範囲を指定するだけで、同じ音を全体から分離できます。

┌────────────────────────────────────────┐
│      スパンプロンプトの革命的な使い方  │
├────────────────────────────────────────┤
│                                        │
│  Step 1: 0:15〜0:17で鳴った犬の吠え声を│
│          1箇所だけマーク               │
│                                        │
│  Step 2: 「この音と同じ音を全体から削除」│
│          を指示                        │
│                                        │
│  → 60分のポッドキャスト全体から        │
│    同様の音がすべて除去される!        │
│                                        │
└────────────────────────────────────────┘

これは業界初の機能です。一度マークするだけで、長い動画全体から同じ音を消せます。


3. 実用的な活用シーン

🎬 映像・ポッドキャスト制作

┌────────────────────────────────────────┐
│      映像制作での活用                  │
├────────────────────────────────────────┤
│                                        │
│  ✅ 屋外撮影の交通騒音を除去           │
│                                        │
│  ✅ インタビュー映像から背景の会話を消す│
│                                        │
│  ✅ 録音中に入った犬の鳴き声を削除     │
│                                        │
│  ✅ エアコンのノイズを除去             │
│                                        │
│  → 「犬の鳴き声を消去」と入力するだけ!│
│                                        │
└────────────────────────────────────────┘

🎵 音楽制作

┌────────────────────────────────────────┐
│      音楽制作での活用                  │
├────────────────────────────────────────┤
│                                        │
│  ✅ 既存の楽曲からギターソロだけ抽出   │
│                                        │
│  ✅ ボーカルを分離してリミックス作成   │
│                                        │
│  ✅ カラオケ音源の作成                 │
│                                        │
│  ✅ サンプリング素材の切り出し         │
│                                        │
│  ※ ただしスタジオマスタリング品質には │
│    達していないため、最終仕上げには    │
│    専門ツールが依然必要                │
│                                        │
└────────────────────────────────────────┘

👂 補聴器・アクセシビリティ

Metaは米国最大の補聴器メーカーStarkeyと提携し、補聴器への応用を研究中です。

┌────────────────────────────────────────┐
│      補聴器への応用可能性              │
├────────────────────────────────────────┤
│                                        │
│  🍽️ レストランで向かいの人の声だけ強調 │
│                                        │
│  💨 風の強い日に会話相手の声を聞き取る │
│                                        │
│  🎉 パーティーで特定の人の声だけ抽出   │
│                                        │
│  → 「音を大きくする」から              │
│    「聴きたい音だけ届ける」へ進化      │
│                                        │
└────────────────────────────────────────┘

4. 今すぐ試す方法

🌐 ブラウザで無料体験

Segment Anything Playgroundで今すぐ試せます!

🔗 https://aidemos.meta.com/segment-anything/editor/segment-audio

┌────────────────────────────────────────┐
│      Playgroundの使い方                │
├────────────────────────────────────────┤
│                                        │
│  Step 1: 上記URLにアクセス             │
│                                        │
│  Step 2: サンプル素材を選ぶ、または    │
│          自分のファイルをアップロード  │
│                                        │
│  Step 3: テキストで分離したい音を指定  │
│          (例:「dog barking」)       │
│                                        │
│  Step 4: 結果をダウンロード!          │
│                                        │
│  推奨クリップ長:10〜60秒              │
│                                        │
└────────────────────────────────────────┘

対応フォーマット:MP3、WAV、FLAC、OGG、AAC、AIFF(音声)、MP4、MKV、AVI(動画)

💻 開発者向け:オープンソース

SAM Audioは完全オープンソースで公開されています。

  • GitHub: facebookresearch/sam-audio

  • Hugging Face: facebook/sam-audio-large(要アクセス申請)

# サンプルコード
from sam_audio import SAMAudio

# モデルの読み込み
model = SAMAudio.from_pretrained("facebook/sam-audio-large")

# テキストプロンプトによる分離
audio = model.separate("guitar", input_audio="band.mp3")

# ビジュアルプロンプトによる分離
video_audio = model.separate_by_click(
    input_video="concert.mp4", 
    click_coords=(100, 200)
)

5. 注意点と制限

⚠️ 現時点の制限

┌────────────────────────────────────────┐
│      知っておくべき制限                │
├────────────────────────────────────────┤
│                                        │
│ ⚠️ 合唱から1人の声を抽出 → 困難        │
│    (類似した音源の分離は課題)        │
│                                        │
│ ⚠️ オーケストラから特定楽器 → 困難     │
│                                        │
│ ⚠️ 音声プロンプト未対応                │
│    (「この音と同じ音を分離」は不可)  │
│                                        │
│ ⚠️ GPU必須(Largeモデルは38GB VRAM)   │
│    → Playgroundなら問題なし            │
│                                        │
│ ⚠️ 生成モデルゆえの「ハルシネーション」│
│    → 元の音にない音が追加される可能性  │
│                                        │
└────────────────────────────────────────┘

🔒 プライバシーへの懸念

高度な音声分離技術は、悪用のリスクも孕んでいます。公共録音から特定の声を分離する監視用途への転用が懸念されており、Metaは「法律の遵守はユーザーの責任」という立場です。


6. まとめ

📝 この記事のポイント

┌────────────────────────────────────────┐
│            今回のまとめ               │
├────────────────────────────────────────┤
│                                        │
│ ・SAM Audioは「言葉で音を選ぶ」        │
│   革新的な音声分離AI                   │
│                                        │
│ ・3つのプロンプト方式                  │
│   ① テキスト:「犬の鳴き声」で指定    │
│   ② ビジュアル:動画内をクリック      │
│   ③ スパン:時間範囲を指定(業界初)  │
│                                        │
│ ・1億件以上の動画で学習、RTF 0.7の速度│
│                                        │
│ ・完全オープンソースで無料公開         │
│                                        │
│ ・Playgroundで今すぐブラウザで試せる   │
│                                        │
└────────────────────────────────────────┘

🚀 音声編集の民主化

┌────────────────────────────────────────┐
│      音声編集の未来                    │
├────────────────────────────────────────┤
│                                        │
│  【Before】                            │
│  ・高価なソフト($249〜$1,199)が必要  │
│  ・専門的な知識と熟練技術が必要        │
│  ・スペクトログラムを読める人だけ      │
│                                        │
│  【After】                             │
│  ・無料で誰でも使える                  │
│  ・「犬の鳴き声を消して」と言うだけ    │
│  ・専門知識不要                        │
│                                        │
│  → 音声編集が「専門家だけのもの」から  │
│    「言葉で伝えれば誰でもできるもの」へ│
│                                        │
└────────────────────────────────────────┘

🎯 今すぐ試してみよう

SAM Audioは、音声編集の概念を根本から変える革新です。

まずはSegment Anything Playgroundで、10〜60秒のクリップで試してみてください。「犬の鳴き声」「ギターの音」など、言葉で指定するだけで分離される体験は、きっと驚きを与えてくれます。

🔗 今すぐ試す: https://aidemos.meta.com/segment-anything/editor/segment-audio


📚 参考リンク


この記事が役に立ったら「スキ」をお願いします!

フォローしていただけると、AIツールの最新情報をお届けできます 🙏

いいなと思ったら応援しよう!

やすだ.dev@毎日投稿 ここまで読んでいただきありがとうございます! 記事が少しでもお役に立てたなら、応援チップをいただけると跳ねて喜びます🙌 いただいたチップは、AIツールの検証費・API利用料・新しい記事の取材にそのまま使わせていただきます。 無理のない範囲で、気持ちだけでも嬉しいです✨