悪用厳禁!!わずか数秒の音声からクローンボイス生成しかも自動で文字越し無料で出来るQwen 3 TTS&ASRがすごい!
まず、論より証拠で次の某有名論破有名人風で生成した音声を聞いてください
追記26/01/30
GGUF形式でQwen2-VLを爆速化させるためにllama-cpp(推論エンジン)を導入したのですが、その過程でライブラリの構成が変わったせいか、この記事の最初に紹介しているTTSノードがエラーを吐くようになってしまいました。 急遽、別のQwen3-TTS用ノードに入れ替えたところ、これが大正解さらに驚くべきことに、最新のQwen3-TTSノードではQwen3-ASR(自動音声認識)との連携に対応しました。これにより、”参照する音声が何を喋っているか”を人間が手動でテキスト入力する必要がありましたが、これが大きな手間となっていました。しかし、新環境ではASRモデルが参照音声を即座に解析し、文字起こしからプロンプト生成までをフルオートで完結させることが可能です。
追記26/01/30 新ワークフロー&カスタムノードからお読みください
これが無料で使えるのが今回紹介するQwen 3 TTSです。導入方法は、動画や記事など他でも沢山あるので今回の私の記事では導入の詳細は簡単な紹介程度で、情報が現在殆んど出てない音声クローンの作り方を現時点で私が数日使ってみてわかった事を紹介していこうと思います。
実際使い方をLLMなどにも聞いたりしましたが、新しいTTS情報の為か曖昧な返答しか得られなかったので私が数日間かけて試行錯誤して上記音声を出力できるまでを、サクッと紹介していきます。
簡単に導入方法と私のマシン環境を触れておきます。
Windows_RTX5060Ti16GB_システムRAM80GBとミドルスペックPCです。
ここから先は
¥ 300
この記事が気に入ったらチップで応援してみませんか?
