スマホでも動くローカルLLMランキング
ローカルLLM動かすならPCよりもスマホで動かしたい!って思いませんか? 動かしたい!...けど、うちのスマホでも本当に動くのか分からんのよ... というわけで、最新のiPhone17 Pro MaxとiPhone12で、私が色んなローカルLLMのベンチマークを測って実際に試してみました! なんでこんな検証するのか?
とういうとiPhone17 Pro Maxを買う前は、うちのiPhone12でどこまで試せるのか分からなかったり、おすすめのモデルもよく分からんし、スマホだけで賢いローカルLLMと話したかったからなんです。
スマホで自分のことを理解してくれるのに最適な、軽くて速くておすすめなローカルLLMと話したかった。
しかもスマホでのローカルLLMの検証は海外の記事ばかりで、日本語のデータが少ないし、それが本当かどうかもよく分からなかったというわけですね
しかし!今ではiPhone17 Pro Maxで色々できるようになったので、同じ悩みを抱えていた人のために参考となるデータをまとめてそれを共有しよう!というのが理由です。 ...分かったから、検証結果はよ! では、以下に結果とおすすめのランキングを残していきます。11個のローカルLLMでテストしたため、情報量が多いのでデータ部分だけバッサリ読み飛ばしちゃっても構いません!ランキングは下の方に行けばあります! 今回の検証条件は以下の通り。
🔧 共通検証条件
「項目 と設定値」
PP (Prompt Processing) 512トークン
TG (Text Generation) 128トークン
PL (Parallel) 1
Rep (繰り返し回数) 3
コンテキスト長 1024
Flash Attention 有効
外部からの試行回数 3回(中央値採用)
📱 検証端末
端末 / チップ / RAM / GPUレイヤー
iPhone 17 Pro Max (A19 Pro / 12 GB / 6コアGPU)
iPhone 12 (A14 Bionic / 4 GB / 4コアGPU)
📋 全モデル スペック一覧
モデル名 / ファイルサイズ / 開発元
Gemma 3-1B-it QAT-Q4_0. / 713 MB / Google
Gemma 3-4B-it Q4_K_M. / 2.49 GB / Google
Gemma 3n-E2B-it Q4_K_M. / 3.03 GB / Google
Gemma 3n-E4B-it Q4_K_M. / 4.54 GB / Google
Qwen3.5 0.8B-Q4_K_M. / 533 MB / Alibaba
Qwen3.5 2B-Q4_K_M. / 1.28 GB / Alibaba
Qwen3.5-4B-Q4_K_M. / 2.74 GB / Alibaba
Nanbeige4.1 3B-Q4_K_M. / 2.44 GB / Nanbeige
LFM2 2.6B-Q4_K_M. / 1.56 GB / LiquidAI
LFM2 2.6B-Exp-Q4_K_M. / 1.64 GB / LiquidAI
LFM2.5 1.2B-JP-Q4_K_M. / 731 MB / LiquidAI
📱 iPhone 17 Pro Max — 全モデル3回分
PP (t/s)➡プロンプト処理
TG (t/s)➡トークン生成
メモリ➡最大メモリ使用量
1. Gemma 3-1B-it QAT-Q4_0.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 1175.02 / 82.79 / 6s / 976 MB
2回目 1240.27 / 82.87 / 5s / 977 MB
3回目 1204.17 / 82.77 / 5s / 982 MB
中央値 1204.17 / 82.79 / 5s / 977 MB
TGばらつき:82.77〜82.87(0.12%)→ 極めて安定 2. Gemma 3-4B-it Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 267.06 / 23.73 / 22s / 4 GB
2回目 251.32 / 23.59 / 22s / 4 GB
3回目 211.63 / 19.86 / 26s / 4 GB
中央値 251.32 / 23.59 / 22s / 4 GB
TGばらつき:19.86〜23.73 → 3回目にサーマルスロットリング(スマホが熱くなって自動的に速度が落ちる現象)が発生(-16.3%)
3. Gemma 3n-E2B-it Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 280.11 / 33.72 / 17s / 3 GB
2回目 266.16 / 32.14 / 17s / 3 GB
3回目 255.12 / 30.38 / 18s / 3 GB
中央値 266.16 / 32.14 / 17s / 3 GB
TGばらつき:30.38〜33.72(9.9%)→ やや劣化あり
4. Gemma 3n-E4B-it Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 156.19 / 19.76 / 29s / 5 GB
2回目 141.27 / 18.30 / 32s / 5 GB
3回目 140.09 / 17.85 / 32s / 5 GB
中央値 141.27 / 18.30 / 32s / 5 GB
TGばらつき:17.85〜19.76(9.7%)→ やや劣化あり
5. Qwen3.5 0.8B-Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 936.21 / 51.92 / 9s / 1 GB
2回目 939.95 / 50.96 / 9s / 1 GB
3回目 903.20 / 50.22 / 9s / 1 GB
中央値 936.21 / 50.96 / 9s / 1 GB
TGばらつき:50.22〜51.92(3.3%)→ 安定
6. Qwen3.5 2B-Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 491.40 / 31.73 / 15s / 2 GB
2回目 448.76 / 30.61 / 16s / 2 GB
3回目 455.59 / 30.43 / 16s / 2 GB
中央値 455.59 / 30.61 / 16s / 2 GB
TGばらつき:30.43〜31.73(4.1%)→ 安定
7. Qwen3.5-4B-Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 175.27 / 13.40 / 37s / 3 GB
2回目 152.71 / 11.71 / 43s / 3 GB
3回目 156.34 / 11.67 / 43s / 3 GB
中央値 156.34 / 11.71 / 43s / 3 GB
TGばらつき:11.67〜13.40(12.9%)→ 1回目から急落、サーマルスロットリングが顕著
8. Nanbeige4.1 3B-Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 280.06 / 27.48 / 19s / 3 GB
2回目 256.17 / 27.09 / 20s / 3 GB
3回目 253.06 / 26.88 / 20s / 3 GB
中央値 256.17 / 27.09 / 20s / 3 GB
TGばらつき:26.88〜27.48(2.2%)→ 非常に安定
9. LFM2 2.6B-Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 358.95 / 37.87 / 14s / 2 GB
2回目 325.07 / 37.57 / 15s / 2 GB
3回目 323.54 / 37.31 / 15s / 2 GB
中央値 325.07 / 37.57 / 15s / 2 GB
TGばらつき:37.31〜37.87(1.5%)→ 非常に安定
10. LFM2 2.6B-Exp-Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 363.36 / 38.80 / 14s / 2 GB
2回目 338.98 / 38.75 / 14s / 2 GB
3回目 323.32 / 38.18 / 14s / 2 GB
中央値 338.98 / 38.75 / 14s / 2 GB
TGばらつき:38.18〜38.80(1.6%)→ 非常に安定
11. LFM2.5 1.2B-JP-Q4_K_M.
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 887.70 / 81.41 / 6s / 1 GB
2回目 829.12 / 80.40 / 6s / 1 GB
3回目 785.77 / 80.21 / 6s / 1 GB
中央値 829.12 / 80.40 / 6s / 1 GB
TGばらつき:80.21〜81.41(1.5%)→ 非常に安定
📱 iPhone 12 — 全モデル3回分
1. Gemma 3-1B-it QAT-Q4_0. ✅ 動作
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 392.41 / 32.75 / 15s / 894 MB
2回目 394.90 / 33.43 / 15s / 891 MB
3回目 373.26 / 33.68 / 15s / 888 MB
中央値 392.41 / 33.43 / 15s / 891 MB
TGばらつき:32.75〜33.68(2.8%)→ 安定
2. Gemma 3-4B-it Q4_K_M. ❌ クラッシュ
メモリ不足でアプリが強制終了。
3. Gemma 3n-E2B-it Q4_K_M. ❌ クラッシュ
メモリ不足でアプリが強制終了。
4. Gemma 3n-E4B-it Q4_K_M. ❌ クラッシュ
メモリ不足でアプリが強制終了。
5. Qwen3.5 0.8B-Q4_K_M. ✅ 動作
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 269.26 / 16.63 / 29s / 939 MB
2回目 245.02 / 14.39 / 33s / 913 MB
3回目 249.29 / 15.29 / 31s / 916 MB
中央値 249.29 / 15.29 / 31s / 916 MB
TGばらつき:14.39〜16.63(13.5%)→ やや不安定
6. Qwen3.5 2B-Q4_K_M. ❌ クラッシュ
メモリ不足でアプリが強制終了。
7. Qwen3.5-4B-Q4_K_M. ❌ クラッシュ
メモリ不足でアプリが強制終了。
8. Nanbeige4.1 3B-Q4_K_M. ❌ クラッシュ
メモリ不足でアプリが強制終了。
9. LFM2 2.6B-Q4_K_M. ✅ 動作
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 109.15 / 17.16 / 36s / 1 GB
2回目 99.56 / 14.60 / 42s / 1 GB
3回目 88.25 / 11.52 / 51s / 1 GB
中央値 99.56 / 14.60 / 42s / 1 GB
TGばらつき:11.52〜17.16(32.9%)→ サーマルスロットリング深刻
10. LFM2 2.6B-Exp-Q4_K_M. ✅ 動作
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 111.37 / 17.32 / 36s / 885 MB
2回目 106.73 / 15.12 / 41s / 877 MB
3回目 87.02 / 11.60 / 51s / 860 MB
中央値 106.73 / 15.12 / 41s / 877 MB
TGばらつき:11.60〜17.32(33.0%)→ サーマルスロットリング深刻
11. LFM2.5 1.2B-JP-Q4_K_M. ✅ 動作
回 / PP (t/s) / TG (t/s) / 合計時間 / メモリ
1回目 267.45 / 37.10 / 16s / 929 MB
2回目 259.31 / 35.73 / 16s / 929 MB
3回目 245.00 / 33.81 / 17s / 930 MB
中央値 259.31 / 35.73 / 16s / 929 MB
TGばらつき:33.81〜37.10(8.9%)→ 軽度の劣化あり
🏆 iPhone 17 Pro Max — 速度が速い(TG中央値)ランキング
🥇 1位 Gemma 3-1B-it QAT-Q4_0.
🥈 2位 LFM2.5 1.2B-JP-Q4_K_M.
🥉 3位 Qwen3.5 0.8B-Q4_K_M.
4位 LFM2 2.6B-Exp-Q4_K_M.
5位 LFM2 2.6B-Q4_K_M.
6位 Gemma 3n-E2B-it Q4_K_M.
7位 Qwen3.5 2B-Q4_K_M.
8位 Nanbeige4.1 3B-Q4_K_M.
9位 Gemma 3-4B-it Q4_K_M.
10位 Gemma 3n-E4B-it Q4_K_M.
11位 Qwen3.5-4B-Q4_K_M.
🏆 iPhone 12 — 速度が速い(TG中央値)ランキング
🥇 1位 LFM2.5 1.2B-JP-Q4_K_M.
🥈 2位 Gemma 3-1B-it QAT-Q4_0.
🥉3位 Qwen3.5 0.8B-Q4_K_M.
4位 LFM2 2.6B-Exp-Q4_K_M.
5位 LFM2 2.6B-Q4_K_M.
❌ Gemma 3-4B-it Q4_K_M.
❌ Gemma 3n-E2B-it Q4_K_M.
❌ Gemma 3n-E4B-it Q4_K_M.
❌ Qwen3.5 2B-Q4_K_M.
❌ Qwen3.5-4B-Q4_K_M.
❌ Nanbeige4.1 3B-Q4_K_M.
🔄 端末間比較(同一モデル)
モデル / iPhone 17 ProMaxのTG (t/s) / iPhone 12のTG (t/s)/ 倍率 /
Gemma 3-1B-it QAT-Q4_0. / 82.79 / 33.43 / 2.48x
LFM2.5 1.2B-JP-Q4_K_M. / 80.40 / 35.73 / 2.25x
Qwen3.5 0.8B-Q4_K_M. / 50.96 / 15.29 / 3.33x
LFM2 2.6B-Exp-Q4_K_M. / 38.75 / 15.12 / 2.56x
LFM2 2.6B-Q4_K_M. / 37.57 / 14.60 / 2.57x
iPhone 12での動作評価↓
Gemma 3-1B-it QAT-Q4_0. ✅ 快適
LFM2.5 1.2B-JP-Q4_K_M. ✅ 快適
Qwen3.5 0.8B-Q4_K_M. △ ギリギリ実用
LFM2 2.6B-Exp-Q4_K_M. △ 不安定
LFM2 2.6B-Q4_K_M. △ 不安定
📐 サイズ帯別 比較分析
🏷️ 1Bクラス
結論:速度ならGemma 3-1B、日本語品質ならLFM2.5-JP、ストレージ(容量)節約ならQwen3.5-0.8B
🏷️ 2〜3Bクラス
結論:LFM2-2.6B-Expが一択。メモリ2 GB・38 t/sで安定性もトップクラス
🏷️ 4Bクラス以上
結論:4Bクラスを使うならGemma-3n-E2B一択。パラメータでは最大なのに速度もメモリも最適
🌟まとめ(Opus4.6の分析)
1. 日本語スマホLLMの最適解はLFM2.5-1.2B-JP
iPhone 17 ProMaxで80 t/s、iPhone 12で35 t/sと両端末で実用的な速度。Gemma 3 1Bとほぼ互角の速度でしかも日本語特化。ファイル728 MB、メモリ1 GB以下で非常に軽量なので誰でも導入しやすい。
2. モバイル最適解はGemma-3n
Gemma-3n-E2BはGemma-3-4Bより「パラメータ多め・速度速い・メモリ少ない」の良いとこ三拍子。E4Bは速度低下が大きいため、E2Bがおすすめ。
3. LiquidAI(SSM系)は安定性で異次元
LFM2系のTGばらつきは1.5〜1.6%で、Transformerベースの大型モデル(10〜16%)と比べて圧倒的に安定。サーマルスロットリングの影響を受けにくいアーキテクチャ上での優位性がある。
4. RAM 4 GB端末の限界線が明確
メモリ使用量1 GB超のモデルは全滅(クラッシュ)。RAM 4 GB端末は1Bクラスまで。RAM 8 GB以上は2〜4Bクラスまで可能。RAM 12 GBは5 GB以上のモデルも余裕で動かせる。
5. Qwen3.5シリーズは速度面で苦戦
0.8Bは動くが同サイズのGemma・LFMに速度で劣り、4Bは全モデル最下位の11 t/s。日本語品質テストで挽回できるかが焦点。
6. LFM2-2.6B-Expは2〜3Bクラスのベストチョイス
無印の完全上位互換。速度+3%、メモリ同等、安定性同等。Expを選ばない理由がない。
以上です! スマホでローカルLLMを動かしたい人の参考になれば幸いです! ここまでお読みいただきありがとうございました!
いいなと思ったら応援しよう!
よろしければ応援お願いします! いただいたチップはクリエイターとしての活動費に使わせていただきます!