見出し画像

スマホでも動くローカルLLMランキング

ローカルLLM動かすならPCよりもスマホで動かしたい!って思いませんか? 動かしたい!...けど、うちのスマホでも本当に動くのか分からんのよ... というわけで、最新のiPhone17 Pro MaxiPhone12で、私が色んなローカルLLMのベンチマークを測って実際に試してみました! なんでこんな検証するのか?

とういうとiPhone17 Pro Maxを買う前は、うちのiPhone12でどこまで試せるのか分からなかったり、おすすめのモデルもよく分からんし、スマホだけで賢いローカルLLMと話したかったからなんです。

スマホで自分のことを理解してくれるのに最適な、軽くて速くておすすめなローカルLLMと話したかった。

しかもスマホでのローカルLLMの検証は海外の記事ばかりで、日本語のデータが少ないし、それが本当かどうかもよく分からなかったというわけですね

しかし!今ではiPhone17 Pro Maxで色々できるようになったので、同じ悩みを抱えていた人のために参考となるデータをまとめてそれを共有しよう!というのが理由です。 ...分かったから、検証結果はよ! では、以下に結果とおすすめのランキングを残していきます。11個のローカルLLMでテストしたため、情報量が多いのでデータ部分だけバッサリ読み飛ばしちゃっても構いません!ランキングは下の方に行けばあります! 今回の検証条件は以下の通り。


🔧 共通検証条件

「項目 と設定値」
PP (Prompt Processing)  512トークン
TG (Text Generation)  128トークン
PL (Parallel) 1
Rep (繰り返し回数)  3
コンテキスト長  1024
Flash Attention  有効
外部からの試行回数  3回(中央値採用)


📱 検証端末

端末 / チップ / RAM / GPUレイヤー

iPhone 17 Pro Max (A19 Pro / 12 GB / 6コアGPU)

iPhone 12 (A14 Bionic / 4 GB / 4コアGPU)


📋 全モデル スペック一覧

モデル名 / ファイルサイズ / 開発元

  1. Gemma 3-1B-it QAT-Q4_0. / 713 MB / Google

  2. Gemma 3-4B-it Q4_K_M. / 2.49 GB / Google

  3. Gemma 3n-E2B-it Q4_K_M. / 3.03 GB / Google

  4. Gemma 3n-E4B-it Q4_K_M. / 4.54 GB / Google

  5. Qwen3.5 0.8B-Q4_K_M. / 533 MB / Alibaba

  6. Qwen3.5 2B-Q4_K_M. / 1.28 GB / Alibaba

  7. Qwen3.5-4B-Q4_K_M. / 2.74 GB / Alibaba

  8. Nanbeige4.1 3B-Q4_K_M. / 2.44 GB / Nanbeige

  9. LFM2 2.6B-Q4_K_M. / 1.56 GB / LiquidAI

  10. LFM2 2.6B-Exp-Q4_K_M. / 1.64 GB / LiquidAI

  11. LFM2.5 1.2B-JP-Q4_K_M. / 731 MB / LiquidAI


📱 iPhone 17 Pro Max — 全モデル3回分

PP (t/s)➡プロンプト処理
TG (t/s)➡トークン生成
メモリ➡最大メモリ使用量

1. Gemma 3-1B-it QAT-Q4_0.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 1175.02 / 82.79 / 6s / 976 MB
2回目 1240.27 / 82.87 / 5s / 977 MB
3回目 1204.17 / 82.77 / 5s / 982 MB
中央値 1204.17 / 82.79 / 5s / 977 MB

TGばらつき:82.77〜82.87(0.12%)→ 極めて安定 2. Gemma 3-4B-it Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 267.06 / 23.73 / 22s / 4 GB
2回目 251.32 / 23.59 / 22s / 4 GB
3回目 211.63 / 19.86 / 26s / 4 GB
中央値 251.32 / 23.59 / 22s / 4 GB

TGばらつき:19.86〜23.73 → 3回目にサーマルスロットリング(スマホが熱くなって自動的に速度が落ちる現象)が発生(-16.3%

3. Gemma 3n-E2B-it Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 280.11 / 33.72 / 17s / 3 GB
2回目 266.16 / 32.14 / 17s / 3 GB
3回目 255.12 / 30.38 / 18s / 3 GB
中央値 266.16 / 32.14 / 17s / 3 GB

TGばらつき:30.38〜33.72(9.9%)→ やや劣化あり

4. Gemma 3n-E4B-it Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 156.19 / 19.76 / 29s / 5 GB
2回目 141.27 / 18.30 / 32s / 5 GB
3回目 140.09 / 17.85 / 32s / 5 GB
中央値 141.27 / 18.30 / 32s / 5 GB

TGばらつき:17.85〜19.76(9.7%)→ やや劣化あり

5. Qwen3.5 0.8B-Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 936.21 / 51.92 / 9s / 1 GB
2回目 939.95 / 50.96 / 9s / 1 GB
3回目 903.20 / 50.22 / 9s / 1 GB
中央値 936.21 / 50.96 / 9s / 1 GB

TGばらつき:50.22〜51.92(3.3%)→ 安定

6. Qwen3.5 2B-Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 491.40 / 31.73 / 15s / 2 GB
2回目 448.76 / 30.61 / 16s / 2 GB
3回目 455.59 / 30.43 / 16s / 2 GB
中央値 455.59 / 30.61 / 16s / 2 GB

TGばらつき:30.43〜31.73(4.1%)→ 安定

7. Qwen3.5-4B-Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 175.27 / 13.40 / 37s / 3 GB
2回目 152.71 / 11.71 / 43s / 3 GB
3回目 156.34 / 11.67 / 43s / 3 GB
中央値 156.34 / 11.71 / 43s / 3 GB

TGばらつき:11.67〜13.40(12.9%)→ 1回目から急落、サーマルスロットリングが顕著

8. Nanbeige4.1 3B-Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 280.06 / 27.48 / 19s / 3 GB
2回目 256.17 / 27.09 / 20s / 3 GB
3回目 253.06 / 26.88 / 20s / 3 GB
中央値 256.17 / 27.09 / 20s / 3 GB

TGばらつき:26.88〜27.48(2.2%)→ 非常に安定

9. LFM2 2.6B-Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 358.95 / 37.87 / 14s / 2 GB
2回目 325.07 / 37.57 / 15s / 2 GB
3回目 323.54 / 37.31 / 15s / 2 GB
中央値 325.07 / 37.57 / 15s / 2 GB

TGばらつき:37.31〜37.87(1.5%)→ 非常に安定

10. LFM2 2.6B-Exp-Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 363.36 / 38.80 / 14s / 2 GB
2回目 338.98 / 38.75 / 14s / 2 GB
3回目 323.32 / 38.18 / 14s / 2 GB
中央値 338.98 / 38.75 / 14s / 2 GB

TGばらつき:38.18〜38.80(1.6%)→ 非常に安定

11. LFM2.5 1.2B-JP-Q4_K_M.

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 887.70 / 81.41 / 6s / 1 GB
2回目 829.12 / 80.40 / 6s / 1 GB
3回目 785.77 / 80.21 / 6s / 1 GB
中央値 829.12 / 80.40 / 6s / 1 GB

TGばらつき:80.21〜81.41(1.5%)→ 非常に安定


📱 iPhone 12 — 全モデル3回分

1. Gemma 3-1B-it QAT-Q4_0. ✅ 動作

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 392.41 / 32.75 / 15s / 894 MB
2回目 394.90 / 33.43 / 15s / 891 MB
3回目 373.26 / 33.68 / 15s / 888 MB
中央値 392.41 / 33.43 / 15s / 891 MB

TGばらつき:32.75〜33.68(2.8%)→ 安定

2. Gemma 3-4B-it Q4_K_M. ❌ クラッシュ

メモリ不足でアプリが強制終了。

3. Gemma 3n-E2B-it Q4_K_M. ❌ クラッシュ

メモリ不足でアプリが強制終了。

4. Gemma 3n-E4B-it Q4_K_M. ❌ クラッシュ

メモリ不足でアプリが強制終了。

5. Qwen3.5 0.8B-Q4_K_M. ✅ 動作

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 269.26 / 16.63 / 29s / 939 MB
2回目 245.02 / 14.39 / 33s / 913 MB
3回目 249.29 / 15.29 / 31s / 916 MB
中央値 249.29 / 15.29 / 31s / 916 MB

TGばらつき:14.39〜16.63(13.5%)→ やや不安定

6. Qwen3.5 2B-Q4_K_M. ❌ クラッシュ

メモリ不足でアプリが強制終了。

7. Qwen3.5-4B-Q4_K_M. ❌ クラッシュ

メモリ不足でアプリが強制終了。

8. Nanbeige4.1 3B-Q4_K_M. ❌ クラッシュ

メモリ不足でアプリが強制終了。

9. LFM2 2.6B-Q4_K_M. ✅ 動作

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 109.15 / 17.16 / 36s / 1 GB
2回目 99.56 / 14.60 / 42s / 1 GB
3回目 88.25 / 11.52 / 51s / 1 GB
中央値 99.56 / 14.60 / 42s / 1 GB

TGばらつき:11.52〜17.16(32.9%)→ サーマルスロットリング深刻

10. LFM2 2.6B-Exp-Q4_K_M. ✅ 動作

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 111.37 / 17.32 / 36s / 885 MB
2回目 106.73 / 15.12 / 41s / 877 MB
3回目 87.02 / 11.60 / 51s / 860 MB
中央値 106.73 / 15.12 / 41s / 877 MB

TGばらつき:11.60〜17.32(33.0%)→ サーマルスロットリング深刻

11. LFM2.5 1.2B-JP-Q4_K_M. ✅ 動作

回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 267.45 / 37.10 / 16s / 929 MB
2回目 259.31 / 35.73 / 16s / 929 MB
3回目 245.00 / 33.81 / 17s / 930 MB
中央値 259.31 / 35.73 / 16s / 929 MB

TGばらつき:33.81〜37.10(8.9%)→ 軽度の劣化あり


🏆 iPhone 17 Pro Max — 速度が速い(TG中央値)ランキング

🥇 1位 Gemma 3-1B-it QAT-Q4_0.

🥈 2位 LFM2.5 1.2B-JP-Q4_K_M.

🥉 3位 Qwen3.5 0.8B-Q4_K_M.

4位 LFM2 2.6B-Exp-Q4_K_M.

5位 LFM2 2.6B-Q4_K_M.

6位 Gemma 3n-E2B-it Q4_K_M.

7位 Qwen3.5 2B-Q4_K_M.

8位 Nanbeige4.1 3B-Q4_K_M.

9位 Gemma 3-4B-it Q4_K_M.

10位 Gemma 3n-E4B-it Q4_K_M.

11位 Qwen3.5-4B-Q4_K_M.


🏆 iPhone 12 — 速度が速い(TG中央値)ランキング

🥇 1位 LFM2.5 1.2B-JP-Q4_K_M.

🥈 2位 Gemma 3-1B-it QAT-Q4_0.

🥉3位 Qwen3.5 0.8B-Q4_K_M.

4位 LFM2 2.6B-Exp-Q4_K_M.

5位 LFM2 2.6B-Q4_K_M.

❌ Gemma 3-4B-it Q4_K_M.

❌ Gemma 3n-E2B-it Q4_K_M.

❌ Gemma 3n-E4B-it Q4_K_M.

❌ Qwen3.5 2B-Q4_K_M.

❌ Qwen3.5-4B-Q4_K_M.

❌ Nanbeige4.1 3B-Q4_K_M.


🔄 端末間比較(同一モデル)

モデル / iPhone 17 ProMaxのTG (t/s) / iPhone 12のTG (t/s)/ 倍率 /

Gemma 3-1B-it QAT-Q4_0. / 82.79 / 33.43 / 2.48x
LFM2.5 1.2B-JP-Q4_K_M. / 80.40 / 35.73 / 2.25x
Qwen3.5 0.8B-Q4_K_M. / 50.96 / 15.29 / 3.33x
LFM2 2.6B-Exp-Q4_K_M. / 38.75 / 15.12 / 2.56x
LFM2 2.6B-Q4_K_M. / 37.57 / 14.60 / 2.57x

iPhone 12での動作評価↓
Gemma 3-1B-it QAT-Q4_0. ✅ 快適
LFM2.5 1.2B-JP-Q4_K_M. ✅ 快適
Qwen3.5 0.8B-Q4_K_M. △ ギリギリ実用
LFM2 2.6B-Exp-Q4_K_M. △ 不安定
LFM2 2.6B-Q4_K_M. △ 不安定


📐 サイズ帯別 比較分析

🏷️ 1Bクラス

結論:速度ならGemma 3-1B、日本語品質ならLFM2.5-JP、ストレージ(容量)節約ならQwen3.5-0.8B

🏷️ 2〜3Bクラス

結論:LFM2-2.6B-Expが一択。メモリ2 GB・38 t/sで安定性もトップクラス

🏷️ 4Bクラス以上

結論:4Bクラスを使うならGemma-3n-E2B一択。パラメータでは最大なのに速度もメモリも最適


🌟まとめ(Opus4.6の分析)

1. 日本語スマホLLMの最適解はLFM2.5-1.2B-JP
iPhone 17 ProMaxで80 t/s、iPhone 12で35 t/sと両端末で実用的な速度。Gemma 3 1Bとほぼ互角の速度でしかも日本語特化。ファイル728 MB、メモリ1 GB以下で非常に軽量なので誰でも導入しやすい。

2. モバイル最適解はGemma-3n
Gemma-3n-E2BはGemma-3-4Bより「パラメータ多め・速度速い・メモリ少ない」の良いとこ三拍子。E4Bは速度低下が大きいため、E2Bがおすすめ。

3. LiquidAI(SSM系)は安定性で異次元
LFM2系のTGばらつきは1.5〜1.6%で、Transformerベースの大型モデル(10〜16%)と比べて圧倒的に安定。サーマルスロットリングの影響を受けにくいアーキテクチャ上での優位性がある。

4. RAM 4 GB端末の限界線が明確
メモリ使用量1 GB超のモデルは全滅(クラッシュ)。RAM 4 GB端末は1Bクラスまで。RAM 8 GB以上は2〜4Bクラスまで可能。RAM 12 GBは5 GB以上のモデルも余裕で動かせる。

5. Qwen3.5シリーズは速度面で苦戦
0.8Bは動くが同サイズのGemma・LFMに速度で劣り、4Bは全モデル最下位の11 t/s。日本語品質テストで挽回できるかが焦点。

6. LFM2-2.6B-Expは2〜3Bクラスのベストチョイス
無印の完全上位互換。速度+3%、メモリ同等、安定性同等。Expを選ばない理由がない。


以上です! スマホでローカルLLMを動かしたい人の参考になれば幸いです! ここまでお読みいただきありがとうございました!

いいなと思ったら応援しよう!

フルエレ よろしければ応援お願いします! いただいたチップはクリエイターとしての活動費に使わせていただきます!