自分の声のクローンボイスでポッドキャストを作ろうとした話(まだいまいち)
こんにちは、たまき(AIに語りかける者)です。
一月二月三月は行く逃げる去ると言いますが、2月は日数が少ないこともあって、本当にすぐ終わってしまいますねぇ。
最近、更新が少なかったんですが、その理由がタイトルで。自分の声のクローンボイスを作ろうと四苦八苦していたからです。
クローンボイスを作ろうと思った理由。
去年始めたことの一つにポッドキャストがありまして。それの編集がとても面倒くさいのです。自分の喋ってるのを何回も聞かないとダメっていうのが面倒くさいんです。
で、その編集をAIにやらせようと当初から四苦八苦してまして。まあそれがなかなかうまくいかない。その過程の中で、自分のクローンボイスを作るのはどうかと思ったわけです。
現状クローンボイスはまだ難しい。
確かに、自分の声が1分ぐらいあれば、簡単にクローンボイス自体は作り出せます。ですが、それをしゃべらせようと思ったら、これはまた別問題で。
結構GPUパワーがいるので、サクッと作れるわけでもありません。
特にポッドキャストなどはだいたい一回で二時間ぐらい録ったりするので。
それをクローンボイスで清書というか、きれいにしようと思ってもなかなか難しいわけです。もちろん問題はそれだけではなく、単純にアクセントの問題や、脚本のテキストの読み間違いなども多発して、出来としていまいちです。
その結果、結局自分のポッドキャストを何回も聞いて編集することになりました。まあこの界隈もLLMと一緒でどんどん小型化してどんどん速くなるんでしょうから。その時にまた試してみる予定です。
というわけでここからは各種クローンボイスを作ったレビューをお届けします。
Qwen3-TTS
こちらは現時点で一番新しいクローンボイスAIですね。
クローンボイスとしてはそこそこ似ているものの後半になると声が似てなくなる。キャラ画像があれば動画として出すことも可能で割と優秀。なので、ショート動画とか作るなら使えると思う。あくまでもポッドキャストを清書するのに向いてないだけで。
GPT-SoVITS
コレは去年出た音声生成AI。出た当初に試した人は多かったんですが、その後V4、V2Pro、V2Pro Plusと順調にバージョンアップしてたみたいで試しました。どれが現状で良いのかわからなかったのでGensparkに調べてもらいました。
https://www.genspark.ai/agents?id=f3ef3608-32f7-43f7-91a0-7bfb93d4f78d
V4よりV2Pro Plusの方が良いらしい。なるほど。
出来上がったのがこちら。
クオリティ自体はこっちの方が良さそう。ただ逆に18秒のクローンボイスを作るのに、結構時間がかかったのでその辺はバーターかな。
紛らわしいやつVoicebox
こちらも最近出てきた、オープンソースのVoicebox。流れてきた画像だとタイムライン編集ができるような感じだったのでインストールしてみたが、まだその機能は実装されてなかった。なのでまたバージョンアップしたら試す予定。あと名前がややこしい。
音声生成AIサービスは除外。
もちろん有料ならば結構いろんなサービスがあるけれど、ポッドキャストはあくまで無料の範囲でどれだけできるかっていう話なので。もちろんいろいろ試したけど似ているかどうかは割とこっちとしてはどうでもいいので。それよりも長時間生成してくれるAIが欲しい。
まとめ。
まだまだ音声生成AIは発展途上ですわ。
最近ジェンスパークの音声入力サービスSpeaklyを使ってこのブログも書き始めました。楽ではあるんだけど、しゃべりながら文章を出すっていう行為自体に慣れていなくて。まあキーボードで打つより少し早いかなというぐらいです。脳の考える部分と口に出す部分がまだ接続がいまいちな感じ。でもこれからは音声入力がどんどん基本になっていくんだろうから。
成り立つために頑張っています。なれるために頑張っています。以上でーす。
いいなと思ったら応援しよう!
ありがとうございます!励みになります!