ローカルで、テキストを音声にする Qwen3-TTS を試してみた(日本語対応)。
環境
使用モデル
手順
環境構築
uv venv --python 3.11
source .venv/bin/activate
uv pip install torch torchaudio \
--index-url https://download.pytorch.org/whl/cu128
uv pip install -e .実行ファイル作成
japanese.py で保存。
import torch
import soundfile as sf
from qwen_tts import Qwen3TTSModel
model = Qwen3TTSModel.from_pretrained(
"Qwen/Qwen3-TTS-12Hz-1.7B-CustomVoice",
device_map="cuda:0",
dtype=torch.bfloat16,
)
# 日本語で生成(Ono_Anna は日本語ネイティブの女性声)
wavs, sr = model.generate_custom_voice(
text="こんにちは、今日はいい天気ですね。お元気ですか?",
language="Japanese",
speaker="Ono_Anna",
)
sf.write("output.mp3", wavs[0], sr)
print("output.mp3 に保存しました")実行
python japanese.py所感
良いね。ローカルだけで、画像作って、動画作って、歌作って、ナレーション、出来そうだ。やるかどうか、できる力があるかどうかは別にして。
高速化も試してないし、いろいろ遊べそう。
