第1993話 Sunoは「言葉」ではなく「音韻」を歌っているのか?──ローマ字・音節分割・人工言語による歌唱制御実験

前回の実験では、

「Sunoは歌詞の意味を理解して歌っているのか?」

をテーマに、

  • 通常英文

  • 擬似英語

  • 母音中心

  • 音節分割

  • 子音強調

  • 人工言語

を比較しました。

その結果、

意味が存在しない言葉でも歌唱は成立し、

Sunoは文章の意味だけではなく、

  • 音節

  • 母音配置

  • 発音リズム

  • 区切り情報

などの音韻的特徴を利用している可能性が見えてきました。

今回はさらに一歩進め、

「Sunoは文字情報をどのように音へ変換しているのか?」

を検証します。

今回の実験テーマ

今回注目したのは、

形態素 → 音素 → 音節 → 歌唱

という変換過程です。

同じ内容でも、

  • 漢字

  • ひらがな

  • ローマ字

  • 音節分割

  • 人工言語

  • 母音列

によって、AIの歌唱表現が変化するのかを比較しました。


実験条件

Styleは全パターン固定。

Experimental electronic cinematic fusion, futuristic AI music laboratory, intelligent music generation, emotional cyber pop, modern electronic pop, cinematic atmosphere, evolving synthesizers, deep warm analog bass, precise electronic drums, expressive emotional vocals, vocal as rhythmic instrument, phonetic vocal textures, syllable-driven melodic phrasing, dynamic rhythmic articulation, layered electronic percussion, evolving vocal harmonies, immersive stereo production, professional studio quality, progressive musical journey, subtle glitch textures, intelligent arrangement, balanced commercial sound, memorable melodic hooks, hybrid human and artificial creativity, modern J-pop influenced melodic sensibility, polished modern mix, evolving vocal phrasing, expressive legato and subtle staccato contrast, cinematic electronic anthem, futuristic vocal experiment, phonetic structure analysis, linguistic sound laboratory

変更するのはLyricsのみです。

目的は、

「入力文字構造の違いが歌唱へ与える影響」

を確認することです。


Pattern1:日本語ローマ字表記

[Verse]

Watashi wa sora no naka de
Atarashii oto wo sagasu

Shizuka na toki no nagare
Kasanaru hibiki no naka

Kokoro no oku ni aru
Mada shiranai katachi

[Chorus]

Haruka na sekai e
Towa ni hibiku melody

Kotoba no kage wo koete
Hajimaru oto no tabi

例:

Watashi wa mirai e aruku

Wasureta yume wo kakaete

というように、日本語をローマ字化しました。

結果

非常に自然な日本語歌唱として成立しました。

以前、アップロード音源から歌詞抽出を行った際には、

漢字・ひらがなとして認識される場合もありました。

しかし今回、ローマ字入力でも日本語らしい発音になりました。

この結果から、

ローマ字は単純に英語として処理されているのではなく、

音韻情報として利用されている可能性があります。


Pattern2:音節分割

[Verse]

Wa ta shi wa
So ra no na ka de

A ta ra shi i
O to wo sa ga su


Shi zu ka na
To ki no na ga re

Ka sa na ru
Hi bi ki no na ka


[Chorus]

Ha ru ka na
Se ka i e

To wa ni
Hi bi ku
Me lo di


Ko to ba no
Ka ge wo
Ko e te

Ha ji ma ru
O to no
Ta bi

例:

Wa ta shi wa

Mi ra i e

A ru ku

のように、音節単位で区切りました。

結果

明確に区切り感のある歌唱になりました。

発音タイミング、

リズム、

メロディへの配置

に影響が感じられました。

これは前回確認した、

改行

ハイフン

スペース

による変化とも一致します。

Sunoでは、文字そのものだけではなく、

「どこで区切るか」

という情報が歌唱表現へ影響している可能性があります。


Pattern3:人工言語

[Verse]

Nalewa sorami venata
Lumera tonavi selora

Karuna velomi raneta
Solami navera torai


[Chorus]

Velora sanami
Lumira tanova

Selani morava
Nalewa forever

例:

Nalera solamai

Temora vesai

のような意味を持たない造語。

結果

過去の人工言語実験と同様に、自然な楽曲として成立しました。

意味が存在しなくても、

  • 音節数

  • 母音配置

  • リズム

が成立していれば、歌として処理できる可能性があります。

これはAI歌唱において、

「意味理解」

よりも、

「音響パターン」

が重要な役割を持つことを示唆します。


Pattern4:母音中心

[Verse]

Aa ia oae
Iu ae oa

Eia oua
Aei oia


Aa ee ia
Oo ua ei

Ia oa ae
Ue io


[Chorus]

Aa ia aa
Oo ei oo

Ae ia oo
Ee aa ii

例:

Aa ia oae

Oo ua ei

のような母音主体の入力。

結果

長い歌詞として使用するより、

  • Intro

  • 間奏

  • フック

  • バックボーカル

のような短い部分で効果的でした。

母音はメロディラインと相性が良く、

伸びや空間的な表現を作る要素として利用できる可能性があります。


実験結果まとめ

入力形式 結果
日本語ローマ字 自然な日本語歌唱として成立
音節分割 区切り・リズム制御に影響
人工言語 意味なしでも楽曲化
母音中心 フックや装飾表現に有効


今回見えてきた仮説

今回の実験だけでは、Suno内部処理を断定することはできません。

しかし、結果から仮説モデルを更新すると、

文字情報
 ↓
音韻情報
 ↓
音節・リズム解析
 ↓
歌唱生成
 ↓
楽曲化

という流れが考えられます。

つまりAIは、

「文章として意味を理解して歌う」

だけではなく、

「文字列から音の特徴を抽出して歌唱を構築している」

可能性があります。


統合曲実験

Style(統合曲用)

Experimental electronic cinematic fusion, futuristic AI music laboratory, intelligent music generation, emotional cyber pop, modern electronic pop, cinematic atmosphere, evolving synthesizers, deep warm analog bass, precise electronic drums, expressive emotional vocals, vocal as rhythmic instrument, phonetic vocal textures, syllable-driven melodic phrasing, dynamic rhythmic articulation, layered electronic percussion, evolving vocal harmonies, immersive stereo production, professional studio quality, progressive musical journey, subtle glitch textures, intelligent arrangement, balanced commercial sound, memorable melodic hooks, hybrid human and artificial creativity, modern J-pop influenced melodic sensibility, polished modern mix, evolving vocal phrasing, expressive legato and subtle staccato contrast, cinematic electronic anthem, futuristic vocal experiment, multilingual phonetic fusion, artificial language vocal design, emotional sound exploration

Lyrics

[Intro]

Before the letters

There is a sound

Before the meaning

There is a rhythm


Aa ia oae

Oo ua ei


[Verse 1]

Watashi wa sora e susumu

Shizuka na oto wo sagasu

Kasanaru hibiki no naka

Atarashii sekai ga hiraku


Koe wa toki wo koete

Oto wa yume wo egaku


[Pre-Chorus]

Wa ta shi wa

So ra e

Su su mu


Shi zu ka na

O to wo

Sa ga su


[Chorus]

Beyond the letters

Beyond the meaning

The voice becomes a sound


Kotoba no kage wo koete

Hibiki no naka de meguru


Na le ra so la mai

Ve no ra lu mi ra

Ta me ra so na vi


One voice

Many forms

One melody


[Instrumental Vocal]

Aa ee ia

Oo ua ei

Na na ra

So la mi

Ae o ia


[Verse 2]

Mirai no katachi wa

Itsuka kawaru

Moji mo koe mo

Toki no naka de ugoku


Mi ra i no

Ka ta chi wa

I tsu ka

Ka wa ru


[Bridge]

Nalera solamai venora

Lumira temora vesai

Karena moritai selora


No meaning

No language

Only vibration


Aa ia

Oo ei

Ae oa


[Final Chorus]

Beyond the letters

Beyond the signs

Beyond the hidden lines


Different sounds

Different voices

Become one light


Wa ta shi wa

So ra e

Su su mu


Nalera

Solamai


Aa ee ai

Oo ua ei


The melody remains

The sound continues


[Outro]

Before the word

There was a voice

Before the voice

There was a rhythm

最後に今回の結果を反映し、

  • 通常言語

  • 日本語ローマ字

  • 音節分割

  • 人工言語

  • 母音フレーズ

を1曲の中へ統合しました。

テーマは、

Beyond Letters, Beyond Meaning

(文字を越えて、意味を越えて)

です。

意味を持つ言葉から始まり、

音節へ分解され、

人工言語へ変化し、

最後は純粋な音へ近づいていく。

AIがどの段階の情報を利用して音楽を構築しているのかを探る実験曲です。


まとめ

今回の実験では、

  • ローマ字でも自然な日本語歌唱が可能

  • 音節分割は歌唱タイミングへ影響する

  • 人工言語でも音楽として成立する

  • 母音はフックや空間表現に利用できる

という傾向が確認できました。

AI音楽生成では、

文字

リズム

感情表現

という複数の情報層が存在しているのかもしれません。

今後はさらに、

形態素

音素

音節数

母音配置

リズム構造

を数値化し、AI歌唱生成の特徴を解析していきます。

タグ

#AI音楽 #Suno #生成AI #AI作曲 #音楽実験 #音響解析 #人工知能 #音韻 #音声生成 #DTM #AIラジオ実験 #機械学習 #創作研究

いいなと思ったら応援しよう!