見出し画像

ローカルで、テキストを音声にする Qwen3-TTS を試してみた(日本語対応)。

環境

使用モデル

手順

環境構築

uv venv --python 3.11

source .venv/bin/activate

uv pip install torch torchaudio \
  --index-url https://download.pytorch.org/whl/cu128

uv pip install -e .

実行ファイル作成

japanese.py で保存。

import torch
import soundfile as sf
from qwen_tts import Qwen3TTSModel

model = Qwen3TTSModel.from_pretrained(
    "Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice",
    device_map="cuda:0",
    dtype=torch.bfloat16,
)

# 日本語で生成(Ono_Anna は日本語ネイティブの女性声)
wavs, sr = model.generate_custom_voice(
    text="こんにちは、今日はいい天気ですね。お元気ですか?",
    language="Japanese",
    speaker="Ono_Anna",
)
sf.write("output.mp3", wavs[0], sr)
print("output.mp3 に保存しました")

実行

python japanese.py

所感

良いね。ローカルだけで、画像作って、動画作って、歌作って、ナレーション、出来そうだ。やるかどうか、できる力があるかどうかは別にして。

高速化も試してないし、いろいろ遊べそう。

いいなと思ったら応援しよう!