ローカルLLM向けPCを導入する際のスペック比較早見表
1.概要
ローカルLLMモデルの導入検討にあたり、2025年11月現在市場にて手に入る(一部頑張らないと手に入らない機種含む)機種について、性能比較を行ったので以下に共有します。
※本記事はOpenAI Claudeのディープリサーチを用いて調査を行っているため誤った情報が含まれている可能性があります。誤った情報については指摘いただければ幸いです
2.機種ごと性能一覧
🍎 Apple Mac Studio M3 Ultra
ISA/OS: arm64 / macOS
フレームワーク: MLX, llama.cpp, CoreML, PyTorch
対応形式: GGUF 他
メモリ: 統合 512 GB(最大)
帯域: 819 GB/s
電源: 370 W
値段:668,800円
性能(8B decode Q4_K_M): 62.6 tok/s
性能(70B decode Q4_K_M): 15.5 tok/s(ctx 7800)
出典:
🍏 Apple Mac Studio M4 Max
ISA/OS: arm64 / macOS
フレームワーク: MLX, llama.cpp, CoreML, PyTorch
対応形式: GGUF 他
メモリ: 統合 128 GB(最大)
帯域: 546 GB/s
電源: 370 W
値段:328,800円
性能(8B decode Q4_K_M): 47.2 tok/s
🖥️ デスクトップ(RTX 5090)
ISA/OS: x86_64 / Windows, Linux
フレームワーク: llama.cpp, vLLM, TensorRT‑LLM, PyTorch
対応形式: GGUF/AWQ 他
メモリ: GDDR7 32 GB
帯域: 1.792 TB/s
電源(GPUのみ): 575W
値段(GPUのみ):438,666円
性能(8B decode Q4_K_M / LocalScore): 65.1 tok/s
性能(8B decode Q4_K_M / Ollama): 200.00 tok/s
性能(8B decode FP8 / sglang): 137.98 tok/s
🏢 NVIDIA DGX Spark(GB10)
ISA/OS: arm64 / Linux
フレームワーク: vLLM, SGLang, PyTorch
対応形式: FP8 他
メモリ: 統合 128 GB
帯域: 273 GB/s
電源: 240 W
値段:704,000円
性能(8B decode Q4_K_M / Ollama): 43.18 tok/s
性能(8B decode Q8_0 / Ollama): 28.54 tok/s
性能(8B decode FP8 / sglang): 20.5 tok/s(単発)
性能(32並列 aggregate / FP8): 368 tok/s
性能(70B decode Q4_K_M / Ollama): 4.58 tok/s(ctx 2048)
出典:
🏭 ワークステーション(RTX 6000 Ada, Dell/HP/Lenovo)
ISA/OS: x86_64 / Windows, Linux
フレームワーク: llama.cpp, vLLM, TensorRT‑LLM, PyTorch
対応形式: GGUF/AWQ 他
メモリ: GDDR6 48 GB
帯域: 960 GB/s
電源(GPUのみ): 300 W
値段(GPUのみ): 1,088,000円
性能(8B decode Q4_K_M): 121 tok/s
💻 ミニPC(Ryzen APU: UM790/GTR7/EVO‑X2)
ISA/OS: x86_64 / Windows, Linux
フレームワーク: llama.cpp, (ROCm+vLLM一部対応)
対応形式: GGUF 他
メモリ: 統合 32–128 GB
帯域: 256 GB/s
電源(GMKtec EVO-X2): 230W
値段(GMKtec EVO-X2): 250,793円
性能(UM790 Pro / Radeon 780M / 8B decode Q4_K_M): 3.8 tok/s
性能(GMKtec EVO-X2 / Radeon 8060S / 8B decode Q4_K_M): 42.0 tok/s
性能(GMKtec EVO-X2 / Radeon 8060S / 70B decode Q4_K_M): 5.0 tok/s
出典:
⚠️ 重要な注意事項
実測値のみ掲載: 8B/70Bの数値は、テーブル右列の出典に記載された実測値のみを掲載
DGX Spark の量子化: 8B は FP8実測(vLLM/SGLang)。Q4_K_M 8B は現時点で未測定
コンテキスト長の違い: 70B の M3 Ultra(ctx 7800)/DGX Spark(ctx 2048)は出典どおりの条件で記載(基準4kと異なる)
2. 性能ランキング(Llama 3.1 Instruct)
🥇 8B - Single Decode 性能ランキング
RTX 5090 Desktop (Ollama): 200.00 tok/s(Q4_K_M、Ollama)⭐
RTX 5090 Desktop (Ollama, Q8_0): 144.97 tok/s(Q8_0、Ollama)⚠️
RTX 5090 Desktop (sglang): 137.98 tok/s(FP8、sglang)⚠️
RTX 6000 Ada WS: 121 tok/s(Q4_K_M、LocalScore、llama.cpp)
RTX 5090 Desktop (LocalScore): 65.1 tok/s(Q4_K_M、LocalScore)
M3 Ultra: 62.6 tok/s(Q4_K_M、LocalScore)
M4 Max: 47.2 tok/s(Q4_K_M、LocalScore)
DGX Spark (GB10, Ollama): 43.18 tok/s(Q4_K_M、Ollama)⭐
GMKtec EVO-X2 (Radeon 8060S): 42.0 tok/s(Q4_K_M、Framework Community、llama.cpp/Vulkan、ctx=128)
DGX Spark (GB10, Ollama, Q8_0): 28.54 tok/s(Q8_0、Ollama)⚠️
DGX Spark (GB10, sglang): 20.5 tok/s(FP8、sglang)⚠️
UM790 Pro (Radeon 780M): 3.8 tok/s(Q4_K_M、LocalScore、llama.cpp)
注記:
⭐ 新規追加データ: CSVベンチマークより追加
⚠️ 量子化形式の違い: FP8/Q8_0 は Q4_K_M との直接比較に注意が必要
RTX 5090 の実装差: Ollama (200 tok/s) vs LocalScore/llama.cpp (65.1 tok/s) で3倍の性能差
DGX Spark の実装差: Ollama/Q4_K_M (43.18 tok/s) vs sglang/FP8 (20.5 tok/s) で2倍以上の性能差
RTX 6000 Ada は別ロットで131 tok/sの記録もあり(実装依存で121-131 tok/sのレンジ)
Radeon 780M は実装差が大きく、DirectML/INT4-ONNXで15-16 tok/s、LM Studio(Vulkan)で13 tok/s の事例もある
GMKtec EVO-X2 はctx=128での測定(基準4096と異なる)
🥈 70B - Single Decode 性能ランキング
M3 Ultra: 15.5 tok/s(Q4_K_M、MLX/LM Studio、ctx 7800)
GMKtec EVO-X2 (Radeon 8060S): 5.0 tok/s(Q4_K_M、Framework Community、llama.cpp/Vulkan、ctx=128)
DGX Spark (GB10): 4.58 tok/s(Q4_K_M、Ollama、ctx 2048、batch=1)
注記:
M3 Ultra と DGX Spark はコンテキスト長が基準4096と異なる
GMKtec EVO-X2 はctx=128での測定
全プラットフォーム Q4_K_M で統一
🚀 並列処理性能(32並列 aggregate)
DGX Spark (GB10) - 8B FP8: 368 tok/s(32並列 aggregate)
注記: 他プラットフォームの並列性能データは現時点で未測定
3. アーキテクチャ/OS/フレームワーク適合
🍎 Apple Mac Studio M3 Ultra / M4 Max
ISA: arm64
OS: macOS
llama.cpp: ○(Metal対応)
vLLM: △(CPUのみ、GPU未対応)
TensorRT‑LLM: ×
MLX: ○(最適化済み)
Riva NMT NIM: ×(NIMはCUDA+Linux前提)
備考: Apple GPUはvLLM未対応(CPUモードは利用可能)
🖥️ デスクトップ(RTX 5090)
ISA: x86_64
OS: Windows, Linux
llama.cpp: ○(CUDA対応)
vLLM: ○(CUDA対応)
TensorRT‑LLM: ○(CUDA対応)
MLX: —
Riva NMT NIM: ○(Linux+CUDA推奨、Windowsは非推奨/対象外が多い)
備考: GGUF/AWQ/FP8等の形式対応はツール依存
🏢 NVIDIA DGX Spark(GB10)
ISA: arm64
OS: Linux
llama.cpp: ○(CUDA/Vulkan対応)
vLLM: ○(CUDA, AArch64対応)
TensorRT‑LLM: ○(CUDA対応)
MLX: —
Riva NMT NIM: ○(AArch64+CUDA、NVIDIAサポート行列参照)
備考: Grace Blackwell(ARM)アーキテクチャ
🏭 ワークステーション(RTX 6000 Ada)
ISA: x86_64
OS: Windows, Linux
llama.cpp: ○(CUDA対応)
vLLM: ○(CUDA対応)
TensorRT‑LLM: ○(CUDA対応)
MLX: —
Riva NMT NIM: ○(Linux+CUDA対応)
備考: ECC VRAM搭載、安定運用向き
💻 ミニPC(Ryzen APU)
ISA: x86_64
OS: Windows, Linux
llama.cpp: ○(Vulkan/HIP対応)
vLLM: △(ROCm 6.3+ Linux限定、GPU対応が限定的)
TensorRT‑LLM: ×
MLX: —
Riva NMT NIM: ×(NIMはNVIDIA対象)
備考: APUはvLLMのGPU対応が限定的
📌 形式・ツールチェーンの互換性
注意: 形式(GGUF/AWQ/GPTQ/FP8)の可否はフレームワークごとに異なります。 採用形式とツールチェーン(llama.cpp/vLLM/MLX/TRT‑LLM)を事前に確認してくださ
4. 実測詳細(抜粋)
🍎 Apple Mac Studio M3 Ultra
8B / Q4_K_M / single decode
性能: 62.6 tok/s(LocalScore)
70B / Q4_K_M / single decode
性能: 15.5 tok/s(ctx 7800, MLX/LM Studio ユーザー実測)
🍏 Apple Mac Studio M4 Max
8B / Q4_K_M / single decode
性能: 47.2 tok/s(LocalScore)
🖥️ デスクトップ(RTX 5090)
8B / Q4_K_M / single decode
性能: 65.1 tok/s(LocalScore)
🏢 NVIDIA DGX Spark(GB10)
8B / FP8 / single decode & 32並列
単発性能: 20.5 tok/s(single decode)
多同時性能: 368 tok/s(32並列 aggregate)
Prefill: 7,991 tok/s
70B / Q4_K_M / single decode
性能: 4.58 tok/s(ctx 2048, Ollama, batch=1)
🏭 ワークステーション(RTX 6000 Ada)
8B / Q4_K_M / single decode
性能: 121 tok/s(LocalScore、llama.cpp)
Prefill: 6,808 tok/s
レイテンシ: 199 ms
VRAM使用量: 47 GB
備考: 別ロット(48GB)では131 tok/sの記録もあり。実装依存で121-131 tok/sのレンジ
💻 ミニPC(Ryzen APU)
UM790 Pro(Radeon 780M)- 8B / Q4_K_M / single decode
性能: 3.8 tok/s(LocalScore、llama.cpp)
メモリ使用量: 14 GB(統合メモリ)
備考: 実装差が大きく、DirectML/INT4-ONNXで15-16 tok/s、LM Studio(Vulkan, GGUF/INT4)で13 tok/s の事例もある(参考値)
GMKtec EVO-X2(Radeon 8060S)- 8B / Q4_K_M / single decode
性能: 42.0 tok/s(Framework Community、llama.cpp/Vulkan)
テスト条件: ctx=128, tg=128
備考: Framework Desktop 128GB(Strix Halo)での llama-bench実測値。実効帯域 ~215 GB/s(理論256 GB/s)
GMKtec EVO-X2(Radeon 8060S)- 70B / Q4_K_M / single decode
性能: 5.0 tok/s(Framework Community、llama.cpp/Vulkan)
テスト条件: ctx=128, tg=128
5. ハード指標(比較)
🍎 Apple Mac Studio M3 Ultra
メモリ: 統合 512 GB(最大)
帯域: 819 GB/s
電源: 370 W
🍏 Apple Mac Studio M4 Max
メモリ: 統合 128 GB(最大)
帯域: 546 GB/s
電源: 370 W
🖥️ デスクトップ(RTX 5090)
メモリ: GDDR7 32 GB
帯域: 1.792 TB/s
電源: 構成依存
🏢 NVIDIA DGX Spark(GB10)
メモリ: 統合 128 GB
帯域: 273 GB/s
電源: 240 W
🏭 ワークステーション(RTX 6000 Ada)
メモリ: GDDR6 48 GB
帯域: 960 GB/s
電源: 1000–2250 W
6. 互換・ロードの注意(ISA/形式差)
🍎 Apple arm64(M3/M4)
✅ 推奨: MLX、llama.cpp(Metal)、CoreML
⚠️ 制限: vLLM はGPU未対応(CPUのみ動作)
📦 形式: GGUF対応はllama.cpp系、AWQ/GPTQはツール次第(CPU/変換が必要な場合あり)
🟢 NVIDIA CUDA(x86_64)
✅ 推奨: vLLM、TensorRT‑LLM、llama.cpp(CUDA)
✅ 形式: GGUF/AWQ/FP8 など形式別の最適化が充実
📦 最適化: 各フレームワークで高度な最適化が利用可能
🔴 AMD APU/ROCm(x86_64)
✅ 推奨: llama.cpp(Vulkan/HIP)
⚠️ 制限: vLLMのGPU対応は ROCm 6.3+ のLinux限定で検討段階
📦 形式: GGUF中心、ROCm経由でPyTorchも可能
🤖 ARM Linux(GB10)
✅ 推奨: vLLM(CUDA, AArch64)、SGLang、llama.cpp(CUDA/Vulkan)
📦 形式: FP8やGGUF(Ollama)などフレームワーク依存
⚠️ 互換性の重要事項
注意: モデルロード時はISA/OS/フレームワークの組み合わせによる非互換に注意してください。
Apple GPU + vLLM(GPU未対応)
AMD APU + TensorRT-LLM(非対応)
形式差: GGUF/AWQ/FP8 などツール間での互換性
7.性能比較
7-1.帯域比較

本棒グラフは各機種を帯域にて比較した結果だ。
モデルの重みを読み出し時に、メモリー帯域が支配的になるため、帯域(GB/s)が大きいほどtok/sの上限が上がる。(量子化やバッチ化、KVキャッシュの配置により変化)
はずだが、実際のベンチマークスコアを見てみると、、
7-2.ベンチマーク比較

ベンチマークで分かることはNvidia製GPUが圧倒的。
EVO-X2はこの中ではかなり善戦しており(llama.cppであることに注意)、Engineが異なっているもののtok/sのみで比較した場合、GB10とさほど変わらない結果が出ている。
7-3.メモリ容量

次にメモリー容量を比較したグラフだ。
これはロードできるモデルサイズに影響する。
例えば、RTX5090は32GBだが、
8Bを FP16でロードした場合、8B*2B≒16GB(理論値)
70Bを Q4でロードした場合、70*0.5=35GB(KV+一時バッファ含まず)でロードできない。
参考までに以下に各モデルのロード可能目安を示す(参考値)
Desktop (RTX 5090)
Total mem: 32 GB/Usable: 22.4 GB
Max params: FP16 ≈ 10.7B, FP8 ≈ 20.4B, Q4 ≈ 39.0B
Workstation (RTX 6000 Ada)
Total mem: 48 GB/Usable: 33.6 GB
Max params: FP16 ≈ 16.0B, FP8 ≈ 30.5B, Q4 ≈ 58.4B
Apple Mac Studio M3 Ultra
Total mem: 512 GB/Usable: 358.4 GB
Max params: FP16 ≈ 170.7B, FP8 ≈ 325.8B, Q4 ≈ 623.7B
Apple Mac Studio M4 Max
Total mem: 128 GB/Usable: 89.6 GB
Max params: FP16 ≈ 42.7B, FP8 ≈ 81.5B, Q4 ≈ 155.8B
NVIDIA DGX Spark (GB10)
Total mem: 128 GB/Usable: 89.6 GB
Max params: FP16 ≈ 42.7B, FP8 ≈ 81.5B, Q4 ≈ 155.8B
Mini PC (GMKtec EVO-X2)
Total mem: 128 GB/Usable: 89.6 GB
Max params: FP16 ≈ 42.7B, FP8 ≈ 81.5B, Q4 ≈ 155.8B
8.最もコスパの良い機種は?
8-1.導入コスト
単純に、「tok/s_per_100kJPY = (tok/s ÷ 価格) × 100,000」にて計算したグラフを以下で示す。このグラフは10万円あたりで何トークン/秒出せるかを示しています。つまり値が高いほど“安くて速い”

tok/sで比較したグラフだが、圧倒的に早い5090を除くと、EVO-X2が次点になっていることがわかる。
なら、
お金がある人は5090で、
貧乏人はEVO-X2!
なのかというとそうでもない。
EVO-X2の問題は、ISA(インストラクションセット)がx86_64な上に、Ryzen系であるため、ロードできるモデルに限りがある。(アーキテクチャ/OS/フレームワーク適合参照)
そのため、自分が導入したいモデルが、x86_64+Ryzenに対応している場合購入を推奨できるが、私のようにvLLMやNvidia Rivaの翻訳モデルをロードしたい場合は、EVO-X2ではロードできないため、選択肢から外れることとなる。
となるとRTX 5090がBestとなるかもしれないがそう単純ではない。
次の表を見てほしい
8-2.ランニングコスト

RTX5090の問題点は使用電力量となり、NVIDA DGX Sparkと比較すると335W多くなる。たった335Wと思うかもしれないが、電気料金を30円/kWhとして計算した場合、
年間消費差 = 0.335 kW × 8,760 h = 2,934.6 kWh
年間コスト差 = 2,934.6 kWh × 30 円/kWh = 88,038 円/年
となり、RTX5090との差額265,334円は、≒3年 で取り返せてしまう構図となる。つまり、RTX5090を24時間稼働させる場合、3年後にはDGX Sparkのほうが結果的に安くなってしまう。。(RTX 6000 Adaの場合は約9年)
なお、各機種ごとの1年間の電気代を可視化すると以下のようになる。
5090の電気代が年間10万円を超えるという地獄みたいなグラフだがこれが現実だ。

そのため、稼働時間や用途によっては高くてもNVIDIA DGX SparkやApple M4等が検討に上がってくることとなる。。
9.感想
個人的な結論としては、RTX 3080(350W)の12GB程度で耐えうるモデルであれば、電気代と導入コストの兼ね合いで中古のRTX3080でAI PCを構築したほうがコスパが良いのではないかと思ってしまったりする。。
もちろん3080だとパラメータサイズの問題でロードできないモデルが多いので、となるとロードできるLLMモデルを選別したうえでEVO-X2を導入するのが妥当か?
いやRivaモデルだけなら3080に収まるから3080で十分なのか??
選定のために情報を整理したはずなのに悩みが増える結果になっている。。。
