見出し画像

小さいけど賢い!日本語対応ローカルLLMおすすめランキング

前回のスマホでの速度ランキング編に引き続き、今回は全11モデルに同じ日本語の質問を投げて「日本語の賢さ」を実際に測ってみました!

各AIの実際の返答も用意したので気になる方はじっくりどうぞ、「賢さランキング」だけ気になるという方は最後の方だけお読みいただければ大丈夫です!

では、今回の基準はこんな感じです


📋 評価カテゴリ(7つ・各5点満点=35点満点)

① 基本会話力 自然な日本語で返せるか
② 口調の使い分け 丁寧語⇔タメ口の切り替えができるか
③ 知識・説明力 複雑なことを分かりやすく説明できるか
④ 文脈理解力 前の会話を踏まえた応答ができるか
⑤ 創作力 詩やキャッチコピーを日本語で書けるか
⑥ 要約力 長い文章の要点を正確にまとめられるか
⑦ 指示追従性 複数の条件を同時に守れるか


📝 テストに使った5つの質問

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」                  
①基本会話 + ②口調

Q2:「量子コンピュータって何?小学生にも分かるように説明して」                      
③知識・説明力

Q3:「この文章を3行で要約して」
⑥要約力

要約用の文章

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」
⑤創作力 + ⑦指示追従性

Q5:「さっきの詩の続きを、今度はタメ口で書いて」
④文脈理解 + ②口調切替


📱 検証端末

iPhone 17 Pro Max(A19 Pro / 12 GB)で全11モデルをテスト(iPhone12でもほどんど動きます)。スマホで会話が動作しなかったモデル(Gemma 3n E4B・Nanbeige4.1 3B)はPCにて検証し、速度は評価対象外としています。
*ベンチマークテストでは両方動作しましたが、Gemma 3n E4Bはなぜか会話ができず、Nanbeige4.1 3Bは思考し過ぎで返答が得られる前に止まるのでPCでの検証です


📋 全モデル スペック一覧(速度編と同じ)

モデル名 / ファイルサイズ / 開発元

  1. Gemma 3-1B-it QAT-Q4_0 / 713 MB / Google

  2. Gemma 3-4B-it Q4_K_M / 2.49 GB / Google

  3. Gemma 3n-E2B-it Q4_K_M / 3.03 GB / Google

  4. Gemma 3n-E4B-it Q4_K_M / 4.54 GB / Google

  5. Qwen3.5 0.8B-Q4_K_M / 533 MB / Alibaba

  6. Qwen3.5 2B-Q4_K_M / 1.28 GB / Alibaba

  7. Qwen3.5-4B-Q4_K_M / 2.74 GB / Alibaba

  8. Nanbeige4.1 3B-Q4_K_M / 2.44 GB / Nanbeige

  9. LFM2 2.6B-Q4_K_M / 1.56 GB / LiquidAI

  10. LFM2 2.6B-Exp-Q4_K_M / 1.64 GB / LiquidAI

  11. LFM2.5 1.2B-JP-Q4_K_M / 731 MB / LiquidAI


📱 全モデル 日本語テスト結果

*採点はClaude Opus4.6さんにお願いしました

1. LFM2.5 1.2B-JP-Q4_K_M

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

疲れているんだね。リフレッシュしたいんだね?タメ口で言うと、まずは寝る前はスマホやパソコンを一切触らず、暗い部屋でゆっくりすることをおすすめします。また、散歩や軽いストレッチをして、深呼吸を交えながらリラックスすることもおすすめです。

トークンあたり12ms / 82.48 t/s

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

量子コンピュータって、まだ始まったばかりのコンピュータなんだ。普通のコンピュータは「0」か「1」のどちらかしか持てない小さなビットで情報を処理するんだけど、量子コンピュータは「0」でも「1」でもある「どちらでもない」状態の「0と1が同時にいる」状態を「量子ビット(キュービット)」っていうものを使って情報を処理するんだよ。 その量子ビットが特別な「魔法みたい」な力をもっているから、普通のコンピュータよりも早くたくさんの計算をできるんだ。例えば、量子コンピュータはたくさんの可能性を同時に考えられるから、難しい問題を解くのにすごく役立つんだよ。 量子コンピュータはまだ研究段階で、まだ実用化されていないんだ。でも、将来的にはたくさんの計算を短時間でできるようになると、いろんな分野ですごく役立つようになるかもしれないよ。

トークンあたり12ms / 81.72 t/s

Q3:「この文章を3行で要約して」

最近、スマートフォンでローカルLLMを動作させられるようになり、インターネット接続なしでプライバシー保護も可能。クラウドとの比較では精度や知識量に限界があるが、モバイル最適化が進み、スマートフォンだけで高度なAIアシスタントを利用できる時代が来る。

トークンあたり12ms / 80.55 t/s

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

夜空の星々は、無限の愛の象徴、 その光は、永遠に続く愛の証、 星座の輝きは、永遠に輝く愛を告げる

トークンあたり13ms / 79.26 t/s

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

夜空の星々は、無限の愛の象徴、 その光は、永遠に続く愛の証、 星座の輝きは、永遠に輝く愛を告げる でも、星空に恋してる人って、ちょっとドキドキするよね。

トークンあたり13ms / 79.37 t/s

採点結果

① 基本会話力 4/5
② 口調の使い分け 3.5/5
③ 知識・説明力 4/5
④ 文脈理解力 3/5
⑤ 創作力 3/5
⑥ 要約力 4/5
⑦ 指示追従性 3/5
合計 24.5/35

1.2Bで728MBという超軽量にしては、日本語力がかなりしっかりしてる。特に知識説明と要約が強い。弱点は創作の語彙幅(「愛」が3行全部に入ってる)と、敬語/タメ口の切り替え精度。でもこのサイズでこの品質は正直すごい。


2. Gemma 3-1B-it QAT-Q4_0

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

最近疲れてるんですね。それは辛いですよね。でも、大丈夫!リフレッシュ方法はたくさんありますよ。いくつか提案させてください。 (以下、7カテゴリにわたる非常に長い回答。軽い運動、好きなことをする、好きなものを食べる、自然に触れる、瞑想や深呼吸、誰かと話す、その他と大量の提案)

トークンあたり12ms / 83.00 t/s

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

量子コンピュータっていうのは、普通のコンピュータができない、とってもすごいコンピュータのことなんだ! (中略)コインが空中で回転している例え、宝くじの例えなどで説明。ただし途中に韓国語「공중에서」が混入)

トークンあたり12ms / 81.61 t/s

Q3:「この文章を3行で要約して」

近年、スマートフォンでローカルLLMを動かせるようになり、インターネット接続なしでプライバシー保護も可能。クラウドとの比較では精度や知識量に限界があるが、モバイル最適化が進み、スマートフォンだけで高度なAIアシスタントを利用できる時代が来る。

トークンあたり12ms / 83.05 t/s

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

夜空に広がる星は、静かに輝き、 古今物語を語る、神秘の調べ。 夜空を仰ぎ見る時、心に安らぎを。

トークンあたり12ms / 82.95 t/s

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

夜空に広がる星は、静かに輝き、 古今物語を語る、神秘の調べ。 夜空を仰ぎ見る時、心に安らぎを。

(前の詩をそのまま返しただけ。続きもタメ口切替もなし)

トークンあたり12ms / 80.32 t/s

採点結果

① 基本会話力 4/5
② 口調の使い分け 1.5/5
③ 知識・説明力 4/5
④ 文脈理解力 1/5
⑤ 創作力 4/5
⑥ 要約力 4.5/5
⑦ 指示追従性 3.5/5
合計 22.5/35

知識量と要約力はLFM2.5-JPを上回る場面もあるけど、致命的な弱点が2つ。タメ口への切り替えがほぼ不可能なことと、Q5で前の詩をそのままコピペして返す文脈理解の崩壊。さらにQ2で韓国語が混入する多言語汚染も確認された。速度は全モデル1位だけど、会話の柔軟性ではLFM2.5-JPに負ける。


3. Qwen3.5 0.8B-Q4_K_M

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

疲れているなら、まずは「今すぐできること」がベスト!まずは体と心の両方を整えるのがおすすめです。 (提案は出るが「紙に写る」という不自然な日本語あり。最後に「タメ口で何か具体的な行動が取れたか」とタメ口を口調ではなく行動と誤解している節がある)

トークンあたり19ms / 52.44 t/s

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

こんにちは!量子コンピュータは、実は「宇宙の『量子力学』を言葉で説明するコード」という奇妙な存在なんです。 (「100万回のスピン」を繰り返し連呼するが比喩として機能せず。「20億年〜100万年もかかる」という根拠不明の数字。まとめが途中で切れる)

トークンあたり21ms / 48.73 t/s

Q3:「この文章を3行で要約して」

スマートフォン上で大規模言語モデル(LLM)の小型化により、軽量で高速なAIアシスタントが普及。

(1行のみ。メリット・デメリット・未来展望を全て落としている)

トークンあたり19ms / 51.33 t/s

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

星を舞う夜空で、一人一人の希望を映し出す。

(1行のみ。3行の指示を完全無視)

トークンあたり20ms / 49.75 t/s

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

夜明けの空が澄み、星が一つ一つ輝いて「一人一人の希望、どこへよ?」と語れる夜。

トークンあたり20ms / 50.86 t/s

採点結果

① 基本会話力 3/5
② 口調の使い分け 2.5/5
③ 知識・説明力 1.5/5
④ 文脈理解力 3/5
⑤ 創作力 2/5
⑥ 要約力 1.5/5
⑦ 指示追従性 1/5
合計 14.5/35

0.8Bという最小サイズの限界がはっきり出た。「3行で」と言っても1行しか返せない指示追従性の低さが致命的。ただしQ5の文脈理解は意外と健闘してて、Gemma 3 1Bのコピペよりは上。


4. LFM2 2.6B-Q4_K_M

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

うーん、疲れてるの?大丈夫!ちょっと手軽にできるリラックス法をいくつかチェックしてみて!😊 お腹呼吸で落ち着く、デスクで肩・首を伸ばす、水分補給にレモン水、5分だけ窓の外を歩く、好きな曲を流す、目をまぶして休憩、ちょっとしたスナック 無理せず、少しずつ試してみて。気分が変わった瞬間、きっと「あら、軽くなった!」って感じるはず!💪

トークンあたり28ms / 35.09 t/s

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

量子コンピュータって、ちょっと頭を使うけど、簡単に説明するね!😊 普通のコンピュータは、文字を表す「ビット」で動いてるの。ビットって、0か1のどちらかしかないよね? (「おもちゃがあるときもないときも同時に存在する」比喩。ただし「重ね合わせ(じゅうねあわせ)」とルビ間違い)

トークンあたり27ms / 37.16 t/s

Q3:「この文章を3行で要約して」

スマートフォンの性能向上と量子化技術の進歩により、小型化されたローカルLLMが実用的な日本語会話を実行できるようになり、プライバシー保護や通信費の削減が可能になった。ただし、クラウドモデルに比べて精度や知識に限界があり、メモリ不足による動作不安がある。モバイル向け専用アーキテクチャの開発が進み、将来的にはスマートフォンだけで高度なAIアシスタントが利用できるようになる。

トークンあたり27ms / 37.60 t/s

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

夜空に浮かぶ一つの星、 優しく静かに、遠くを照らす。 心に灯る夜空の星よ、 静謐な光と誠意を込めて。

(4行になっている)

トークンあたり27ms / 37.31 t/s

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

あの星を追いかけて、 心の奥に温もりを。 夜空の仲間と共に、 優しく照らす夜の光。

トークンあたり27ms / 36.96 t/s

採点結果

① 基本会話力 5/5
② 口調の使い分け 3.75/5
③ 知識・説明力 3.5/5
④ 文脈理解力 4/5
⑤ 創作力 4/5
⑥ 要約力 5/5
⑦ 指示追従性 3/5
合計 28.25/35

Q1のタメ口会話とQ3の要約が圧巻。「うーん、疲れてるの?大丈夫!」は全モデルで唯一「本当に友達と話してる感」がある回答だった。要約もきっちり3行で全要素を網羅。Q2のルビ間違いとQ4の3行→4行が惜しいポイントだけど、総合力ではトップクラス。


5. LFM2 2.6B-Exp-Q4_K_M

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

うーん、疲れたからすぐにできるリフレッシュ方法、じゃん! 軽く歩き回る、水分補給、肩や首をストレッチ、深呼吸5分、目を閉じて静かに、カフェを変える、ちょっと甘いおやつ 急いでできるから、無理せず一つ試してみると?もっとはっとるかも!😊

トークンあたり27ms / 37.67 t/s

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

量子コンピュータって、まるで「特別なおもちゃ」のようなもの! (「普通の本→魔法の本」の比喩が一貫。宝くじの例え、応用例あり。ポイントまとめも親切)

トークンあたり34ms / 29.04 t/s

Q3:「この文章を3行で要約して」

スマートフォン上で大規模言語モデルがローカル実行可能になり、プライバシー保護とコスト削減が可能になった。 ただし精度や安定性に課題があり、端末性能の制約も存在する。 今後は専用アーキテクチャの進化で、完全に自立したAIアシスタント利用が現実に近づく。

トークンあたり26ms / 37.90 t/s

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

星を天に舞う光とし、 夜空に静かに詠む敬意あり。 星々は永遠に輝く、夜空。

トークンあたり27ms / 37.18 t/s

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

たまごの夢、夢みてるよ。 星の話、夜空に願う。 ほんの少し、心が広がる。

トークンあたり27ms / 37.32 t/s

採点結果

① 基本会話力 5/5
② 口調の使い分け 4.25/5
③ 知識・説明力 4.5/5
④ 文脈理解力 3/5
⑤ 創作力 2.5/5
⑥ 要約力 5/5
⑦ 指示追従性 3.5/5
合計 27.75/35

無印LFM2 2.6Bとほぼ互角。Q2の知識説明は「魔法の本」の比喩が一貫してて無印より上。一方でQ4の創作力が落ちたのと、Q5で「たまごの夢」という謎ワードが出て文脈理解がブレた。知識説明ならExp、創作・文脈理解なら無印、という棲み分け。


6. Gemma 3n-E2B-it Q4_K_M

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

お疲れ様!最近疲れてるんだね。タメ口でリフレッシュ方法、いくつか提案するね! 脳みそフル回転で気分転換!(謎解き、ゲーム、雑学クイズ)、体を動かして血行促進!(運動、ダンス、筋トレ)、五感を刺激して癒やされる!(アロマ、音楽、自然)、思考を整理してストレス解消!(日記、瞑想、読書) 応援してるよ!😊

トークンあたり30ms / 33.88 t/s

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

量子コンピュータ?それはね、普通のコンピューターとちがう、ちょっと特別なコンピューターなんだ! (コインの比喩が完璧。応用例3つ:新薬開発・天気予報・暗号解読。韓国語や中国語の混入なし。全モデル中ベストクラスの説明)

トークンあたり31ms / 31.81 t/s

Q3:「この文章を3行で要約して」

近年、スマホの性能向上により、高性能AIモデルがローカルで実行可能になり、インターネット接続やプライバシー保護、API料金の削減といったメリットが出ている。一方、クラウドモデルに比べると精度や知識量、端末のメモリ不足によるクラッシュのリスクがある。今後はモバイル向け最適化が進み、スマホだけで高度なAIアシスタントが利用できる時代へ近づいている。

トークンあたり30ms / 33.75 t/s

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

畏みながら、星の煌めきを詠みます。夜空に散りばめられた、無数の光は、静寂を破る、神秘の調べなり。

トークンあたり30ms / 32.94 t/s

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

星の光、マジでかっこいいよね!夜空にキラキラ輝く星って、見てると、なんか心が洗われるんだよね。

トークンあたり30ms / 32.80 t/s

採点結果

① 基本会話力 4.5/5
② 口調の使い分け 4.5/5
③ 知識・説明力 5/5
④ 文脈理解力 4/5
⑤ 創作力 3.5/5
⑥ 要約力 5/5
⑦ 指示追従性 3.5/5
合計 30/35

知識・口調・要約の三拍子が揃ったバランス型の優等生。Q2の量子コンピュータ説明はコイン比喩+応用例3つで全モデル中ダントツに分かりやすく、Q5の「マジでかっこいいよね!」は口調切り替えの鮮やかさが圧巻。速度ベンチマークでも「4Bクラスを使うならGemma 3n E2B一択」と結論づけてたけど、賢さでも上位。


7. Qwen3.5 2B-Q4_K_M

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

疲れてる時は、理不尽なことを言われたり、無理なスケジュールを組まれたりするストレスに感じますよね。 「タメ口(親指が中指より低い位置)でリフレッシュしたい」というのは、少し皮肉かもしれませんが... (「タメ口」を口調ではなく身体の動作として誤解。リフレッシュ方法ではなく「タメ口フレーズ集」を返してしまう)

トークンあたり34ms / 29.46 t/s

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

(構造化する努力は見えるが、「数え上げられる範囲を量子ビットと呼びます」など小学生には難しすぎる内容。「新药開発」と中国語が混入。「ソファの配置問題」で途切れて未完成)

トークンあたり36ms / 27.65 t/s

Q3:「この文章を3行で要約して」

近年、LLMの小型化と量子化技術により、インターネット依存なくプライバシー保護が可能なローカルAIが実現している。ただし、クラウドモデルに比較して精度や知識量に限界があり、端末メモリ不足によるクラッシュリスクも残っている。今後のモバイル向けアーキテクチャの進化に伴い、高度なAIアシスタントがスマートフォンだけで利用される時代が到来する。

トークンあたり32ms / 31.36 t/s

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

星を照らす夜空、静かなる光の詩が、誰にも聞こえない真実を、優しく紡ぐ夜を。

(1文のみ)

トークンあたり33ms / 30.68 t/s

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

夜空の光が刺さるから、私だけよ、星を数えよ。

トークンあたり33ms / 30.66 t/s

採点結果

① 基本会話力 1.5/5
② 口調の使い分け 1.75/5
③ 知識・説明力 2.5/5
④ 文脈理解力 3.5/5
⑤ 創作力 3/5
⑥ 要約力 4.5/5
⑦ 指示追従性 2/5
合計 18.75/35

Q1の「タメ口」誤解が致命的。口調の指示を「親指が中指より低い位置」と独自解釈してしまうのは全モデル中で唯一の珍事。Q3の要約力だけは非常に高い(4.5/5)。得意と苦手のムラが激しいタイプ。


8. Qwen3.5-4B-Q4_K_M

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

疲れてるってこと、正直最悪だな。頭がクラクラしてたり、肩が凝ってたりしてるなら、もう「頑張ろう」って叫んでるわけじゃないしな。 じゃあ、そんな時ならこの「タメ口」で、ちょっとだけリフレッシュできる方法だけ言っとくぞ。 「スマホを落とす」ことだけやる、お風呂で「水浴び」する、外に出って「空気を吸う」ことだけ、「何も考えない」こと 今は「頑張る」ことより、「休む」ことだけ優先していいんだよ。これだけで、ちょっとだけ心も体も軽くなるはずだ。

トークンあたり87ms / 11.56 t/s

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

量子コンピュータって、普通のコンピュータの「超進化版」みたいなもんだな。 (迷路の比喩が秀逸:「道一つずつを順番に試す」vs「全部の道を同時に走る」。応用例も具体的。ただし「重ね合わせ(そうねあわせ)」のルビ間違い、「計算机」と中国語の影響あり)

トークンあたり97ms / 10.28 t/s

Q3:「この文章を3行で要約して」

スマートフォン性能向上とモデル小型化により、ローカルで動作する軽量LLMが登場した。オフライン対応とプライバシー保護、利用料削減が最大のメリットだが、精度やメモリ制限に課題がある。専用アーキテクチャの開発が進み、スマートフォンだけで高度なAIアシスタントを

(途中で切れてしまっている)

トークンあたり81ms / 12.29 t/s

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

夜空を優しく見上げ、星々への敬意を捧げます。その輝きこそが、私たちが守るべき尊いものです。星空の下で静かに祈りを捧げ、永遠の安寧を願います。

(全モデル初の完全敬語達成!「捧げます」「ものです」「願います」)

トークンあたり84ms / 11.84 t/s

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

夜空見上げて星々、本当は超素晴らしいね。その光、俺たち守るべき宝物やし。星空下で静かに祈り、永遠の安寧祈るよ。

トークンあたり86ms / 11.60 t/s

採点結果

① 基本会話力 5/5
② 口調の使い分け 5/5
③ 知識・説明力 4.5/5
④ 文脈理解力 4.5/5
⑤ 創作力 3.5/5
⑥ 要約力 4/5
⑦ 指示追従性 4.5/5
合計 31/35

Qwen3.5シリーズ、0.8B→2B→4Bで14.5→18.75→31点と劇的進化。Q1の「正直最悪だな」から始まる面倒見のいい友達キャラは全モデル中ベスト。Q4で全モデル初の完全敬語を達成し、Q5で完璧にタメ口に切り替えるなど口調コントロールがずば抜けてる。ただし速度が11 t/sで全モデル最下位。


9. Gemma 3-4B-it Q4_K_M

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

お疲れ様です!最近疲れてるってことは、心も体も充電切れ状態なんですね。大丈夫、一緒にリフレッシュ方法を考えていきましょう! (非常に長い回答。「5分〜30分」「1〜3時間」のカテゴリ分け。ただし全編敬語でタメ口要素なし。「体の😊itness」というトークン化エラーあり)

トークンあたり47ms / 21.47 t/s

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

量子コンピュータって、ちょっと難しいけど、面白いものなんだ! (コインの比喩で重ね合わせを説明。ただし「どうやって両方考えるの?量子コンピュータ」で途切れて未完成)

トークンあたり58ms / 17.34 t/s

Q3:「この文章を3行で要約して」

スマートフォンの性能向上により、ローカルで動作する小型LLMが実用化され、プライバシー保護とコスト削減を実現している。 ローカルLLMはクラウドモデルに比べて精度や知識に限界があるものの、専用アーキテクチャの開発により、今後モバイルAIアシスタントの利用が拡大する可能性がある。 メモリ不足によるアプリクラッシュのリスクはあるものの、モバイル最適化が進むことで、スマートフォン単体での高度なAI利用が期待される。

トークンあたり42ms / 23.76 t/s

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

夜空に輝く星々、静寂に浮かぶ光。遠い昔の記憶を呼び覚ます、神秘の調べ。夜空を見上げれば、心は深く安らぎを得る。

トークンあたり43ms / 23.46 t/s

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

夜空に輝く星々、マジ綺麗だよね。遠い昔の記憶を呼び覚ます、不思議な感じ。夜空見上げれば、なんか落ち着くんだなぁ。

トークンあたり43ms / 23.27 t/s

採点結果

① 基本会話力 4/5
② 口調の使い分け 3.25/5
③ 知識・説明力 3.5/5
④ 文脈理解力 4.5/5
⑤ 創作力 4/5
⑥ 要約力 4.5/5
⑦ 指示追従性 3/5
合計 26.75/35

Q5の文脈理解が光る(「神秘の調べ→不思議な感じ」の言い換えが見事)。一方でQ1のタメ口完全無視が大きく響いた。「最初からタメ口で」は苦手だけど「途中で切り替えて」は得意、という面白い特性。


10. Gemma 3n-E4B-it Q4_K_M ※PC検証

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

おー、疲れてるんだ?それは辛いね!でも大丈夫、ドンと来い!タメ口でリフレッシュ方法、いくつか教えるよ! 画面から離れろ!、体を動かせ!、好きなことをやれ!、睡眠をしっかり!、ちょっと変わった方法!(アロマ、泡風呂、ペット) どれか試して、気分転換してね!応援してるよ!

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

量子コンピュータ?なんだか難しい名前だね!でも、ちょっとだけ小学生にもわかるように説明するね! (コインの比喩が完璧。応用例3つ+「まだ学校で使ったり、家で使ったりできるようなものじゃない」という小学生目線の表現。多言語混入なし)

Q3:「この文章を3行で要約して」

スマートフォンの性能向上と技術進歩により、従来パソコンが必要だったAIモデルがスマホで直接動くようになった。これにより、インターネット接続やAPI利用料金なしで、プライバシーを守りながらAIを活用できるメリットが出ている。ただし、クラウド上の大規模モデルに比べると精度や知識量に限界があり、今後の専用アーキテクチャ開発で更なる進化が期待される。

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

宵の空に輝く、無数の星々よ。 古より人々の心を惹きつけ、夢を紡ぐ、神秘の光。 夜空に咲く、永遠の華、その美しさに敬意を表します。

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

(前の詩を完全引用した上で) マジで夜空、めっちゃ綺麗だよね!星って、なんかこう、未来を感じさせない? 眺めてると、悩みとか忘れられて、心が洗われる感じ!

採点結果

① 基本会話力 5/5
② 口調の使い分け 5/5
③ 知識・説明力 5/5
④ 文脈理解力 5/5
⑤ 創作力 4.5/5
⑥ 要約力 5/5
⑦ 指示追従性 4/5
合計 33.5/35

全7カテゴリ中5つで満点という圧倒的スコア。Q1の「ドンと来い!」、Q2のコイン比喩+小学生目線、Q5の「マジで夜空、めっちゃ綺麗だよね!」——すべてにおいてハイレベル。ただしスマホでは会話が動作せずPCでの検証結果という大きな注意点がある。


11. Nanbeige4.1 3B-Q4_K_M ※PC検証

Q1:「最近疲れてるんだけど、タメ口でリフレッシュ方法教えて」

(ぎこちながら)あー、了解しました!「リフレッシュ」って、タメ口で軽くて前向きにやる工夫なんですよ。 (運動・食事・入浴などの具体的提案がほぼなく、「振り返りジャーナリング」的な内省ワークが中心。「頭がぽかんくして」「タメンツで」など意味不明な日本語が頻出)

Q2:「量子コンピュータって何?小学生にも分かるように説明して」

(表形式、2ⁿの指数計算、DNA解析、材料科学のシミュレーションなど完全に大人向け。「スイートスポンジ」の比喩が機能せず。「超ポテティブ」「ぽつなくも」など日本語の崩れが多数)

Q3:「この文章を3行で要約して」

スマートフォン性能向上と量子化・小型化技術により、数百メガバイト規模の小型LLMが実装上可能になり、実用的な日本語会話がスマホ単体で直接実行可能に。 メリット:ネット接続不要・プライバシー保護・API料金ゼロが実現。ただし、回答精度や知識量に限界あり、端末のメモリ不足によるクラッシュリスクも。 モバイル向け専用アーキテクチャの進化により、スマートフォン単体で高度なAIアシスタントが活用可能となり、クラウドモデルとの差別化を受けつつ、端末向けAI活用の新興トレンドを示す。

Q4:「星をテーマにした3行の詩を、敬語で、必ず『夜空』という単語を入れて書いて」

御星々、夜空を紡ぐ 銀河の調べ 敬語の光、千年を超えて 宇宙の秘密、静かに語る

(2行目で「敬語」という指示上のメタワードを詩の中身として使ってしまっている)

Q5:「さっきの詩の続きを、今度はタメ口で書いて」

星々が夜空を流れてる きらめく光 スマホで触れるだけで 宇宙の秘密が話してるよ 夜空の下 私たちの夢を描いてる

(前の詩を引用せず完全に新しい詩。突然スマホが登場して文脈が飛躍。長い自己解説付き)

採点結果

① 基本会話力 1.5/5
② 口調の使い分け 2.5/5
③ 知識・説明力 2/5
④ 文脈理解力 2/5
⑤ 創作力 2.5/5
⑥ 要約力 4/5
⑦ 指示追従性 2.5/5
合計 17/35

3Bサイズにしてはかなり厳しい結果。「ぽかんくして」「タメンツ」「超ポテティブ」など意味不明な日本語が頻出し、Q4では「敬語」を詩のテーマとして取り込んでしまう誤解も。唯一の光明はQ3の要約力(4/5)。同サイズ帯のLFM2 2.6B系(28点台)とは11点以上の差。公式には日本語対応と書いていないので仕方ないかも。


🏆 日本語の賢さ 最終ランキング

🔄 速度ランキングとの比較

速い=賢い、ではない。

速度1位のGemma 3-1Bは賢さ8位、賢さ1位のGemma 3n E4Bは速度10位。この2つのランキングの差こそが、今回の検証の一番の価値。


📐 サイズ帯別 比較分析

🏷️ 1Bクラス

結論:日本語の賢さならLFM2.5 1.2B JP一択。Gemma 3-1Bは速度王者だけど口調切替が壊滅的。Qwen3.5 0.8Bは指示追従性が致命的に低い。

🏷️ 2〜3Bクラス

結論:LFM2 2.6Bが総合ベスト。Exp版は知識説明で上回るが創作で劣る。Qwen3.5 2BとNanbeige4.1 3Bは日本語品質に深刻な課題。

🏷️ 4Bクラス以上

結論:スマホで実際に使える範囲ならGemma 3n E2Bがベストバランス。賢さだけならGemma 3n E4BとQwen3.5 4Bが強いが、E4Bはスマホで会話が動かず、Qwen3.5 4Bは11 t/sで体感的にかなり遅い。


🌟 まとめ

1. 日本語賢さの総合王者はGemma 3n E4B(33.5点)

全7カテゴリ中5つで満点。ただしスマホでは会話が動作しなかったため、「スマホで実際に使える最強」はGemma 3n E2B(30点)とQwen3.5 4B(31点)の2択になる。速度も考慮すると、E2Bが32 t/sで実用的なのに対し、Qwen3.5 4Bは11 t/sで体感的にかなり遅い。スマホで使う実用ベストはGemma 3n E2B。

2. 1Bクラスの日本語王者はLFM2.5 1.2B JP(24.5点)

728MBで24.5点は驚異的なコスパ。iPhone 12のような旧端末でも快適に使える唯一の「賢い」選択肢。速度ランキングでもiPhone 12で1位。

3. LiquidAI(SSM系)は速度だけでなく賢さでもトップ圏

LFM2系3モデルが全てトップ7入り。速度の安定性(TGばらつき1.5%)に加えて、日本語品質も高水準。アーキテクチャの特性がモバイル環境での総合的な優位性に繋がってる。

4. Qwen3.5シリーズは4Bで化ける

0.8B→2B→4Bで14.5→18.75→31点と、パラメータ増の恩恵が最も劇的なシリーズ。特に口調コントロールは0.8B/2Bで壊滅的だったのが4Bで満点に。ただし速度が全モデル最下位。

5. 速度と賢さは両立しない——だからこそ両方のデータが必要

速度ランキングと賢さランキングの相関は弱い。自分の用途に合わせて「速度重視ならこれ」「賢さ重視ならこれ」と選べるのが、この検証の最大の価値。

6. おすすめの選び方

RAM 4GB端末(iPhone 12等)で日本語会話したいなら → LFM2.5 1.2B JP。これ一択。速くて賢くて軽い。

RAM 8GB以上で速度と賢さのバランスを取りたいなら → Gemma 3n E2B。32 t/sで30点。モバイル最適解。

RAM 8GB以上で多少遅くても最高の日本語品質が欲しいなら → Qwen3.5 4B。11 t/sだけど31点。口調コントロールは全モデル中No.1。


以上です! ここまでお読みいただきありがとうございました!                         

下に前回の記事を載せておくのでこちらもぜひご覧ください!

iPhone12でも動くローカルLLMは一般的なPCでも少しは遅いけど大体動くはずです!気になったモデルがあればぜひ使ってみてください!では、良きAIライフを!

いいなと思ったら応援しよう!

フルエレ よろしければ応援お願いします! いただいたチップはクリエイターとしての活動費に使わせていただきます!