見出し画像

ローカルLLM向けPCを導入する際のスペック比較早見表

1.概要

ローカルLLMモデルの導入検討にあたり、2025年11月現在市場にて手に入る(一部頑張らないと手に入らない機種含む)機種について、性能比較を行ったので以下に共有します。

※本記事はOpenAI Claudeのディープリサーチを用いて調査を行っているため誤った情報が含まれている可能性があります。誤った情報については指摘いただければ幸いです


2.機種ごと性能一覧

🍎 Apple Mac Studio M3 Ultra

🍏 Apple Mac Studio M4 Max

  • ISA/OS: arm64 / macOS

  • フレームワーク: MLX, llama.cpp, CoreML, PyTorch

  • 対応形式: GGUF 他

  • メモリ: 統合 128 GB(最大)

  • 帯域: 546 GB/s

  • 電源: 370 W

  • 値段:328,800円

  • 性能(8B decode Q4_K_M): 47.2 tok/s

  • 出典: https://www.localscore.ai/model/1

🖥️ デスクトップ(RTX 5090)

  • ISA/OS: x86_64 / Windows, Linux

  • フレームワーク: llama.cpp, vLLM, TensorRT‑LLM, PyTorch

  • 対応形式: GGUF/AWQ 他

  • メモリ: GDDR7 32 GB

  • 帯域: 1.792 TB/s

  • 電源(GPUのみ): 575W

  • 値段(GPUのみ):438,666円

  • 性能(8B decode Q4_K_M / LocalScore): 65.1 tok/s

  • 性能(8B decode Q4_K_M / Ollama): 200.00 tok/s

  • 性能(8B decode FP8 / sglang): 137.98 tok/s

  • 出典: https://www.localscore.ai/accelerator/155

🏢 NVIDIA DGX Spark(GB10)

🏭 ワークステーション(RTX 6000 Ada, Dell/HP/Lenovo)

  • ISA/OS: x86_64 / Windows, Linux

  • フレームワーク: llama.cpp, vLLM, TensorRT‑LLM, PyTorch

  • 対応形式: GGUF/AWQ 他

  • メモリ: GDDR6 48 GB

  • 帯域: 960 GB/s

  • 電源(GPUのみ): 300 W

  • 値段(GPUのみ): 1,088,000円

  • 性能(8B decode Q4_K_M): 121 tok/s

  • 出典: https://www.localscore.ai/accelerator/673

💻 ミニPC(Ryzen APU: UM790/GTR7/EVO‑X2)

⚠️ 重要な注意事項

  • 実測値のみ掲載: 8B/70Bの数値は、テーブル右列の出典に記載された実測値のみを掲載

  • DGX Spark の量子化: 8B は FP8実測(vLLM/SGLang)。Q4_K_M 8B は現時点で未測定

  • コンテキスト長の違い: 70B の M3 Ultra(ctx 7800)/DGX Spark(ctx 2048)は出典どおりの条件で記載(基準4kと異なる)

2. 性能ランキング(Llama 3.1 Instruct)

🥇 8B - Single Decode 性能ランキング

  1. RTX 5090 Desktop (Ollama): 200.00 tok/s(Q4_K_M、Ollama)⭐

  2. RTX 5090 Desktop (Ollama, Q8_0): 144.97 tok/s(Q8_0、Ollama)⚠️

  3. RTX 5090 Desktop (sglang): 137.98 tok/s(FP8、sglang)⚠️

  4. RTX 6000 Ada WS: 121 tok/s(Q4_K_M、LocalScore、llama.cpp)

  5. RTX 5090 Desktop (LocalScore): 65.1 tok/s(Q4_K_M、LocalScore)

  6. M3 Ultra: 62.6 tok/s(Q4_K_M、LocalScore)

  7. M4 Max: 47.2 tok/s(Q4_K_M、LocalScore)

  8. DGX Spark (GB10, Ollama): 43.18 tok/s(Q4_K_M、Ollama)⭐

  9. GMKtec EVO-X2 (Radeon 8060S): 42.0 tok/s(Q4_K_M、Framework Community、llama.cpp/Vulkan、ctx=128)

  10. DGX Spark (GB10, Ollama, Q8_0): 28.54 tok/s(Q8_0、Ollama)⚠️

  11. DGX Spark (GB10, sglang): 20.5 tok/s(FP8、sglang)⚠️

  12. UM790 Pro (Radeon 780M): 3.8 tok/s(Q4_K_M、LocalScore、llama.cpp)

注記:
新規追加データ: CSVベンチマークより追加
⚠️ 量子化形式の違い: FP8/Q8_0 は Q4_K_M との直接比較に注意が必要
RTX 5090 の実装差: Ollama (200 tok/s) vs LocalScore/llama.cpp (65.1 tok/s) で3倍の性能差
DGX Spark の実装差: Ollama/Q4_K_M (43.18 tok/s) vs sglang/FP8 (20.5 tok/s) で2倍以上の性能差
RTX 6000 Ada は別ロットで131 tok/sの記録もあり(実装依存で121-131 tok/sのレンジ)
Radeon 780M は実装差が大きく、DirectML/INT4-ONNXで15-16 tok/s、LM Studio(Vulkan)で13 tok/s の事例もある
GMKtec EVO-X2 はctx=128での測定(基準4096と異なる)

🥈 70B - Single Decode 性能ランキング

  1. M3 Ultra: 15.5 tok/s(Q4_K_M、MLX/LM Studio、ctx 7800

  2. GMKtec EVO-X2 (Radeon 8060S): 5.0 tok/s(Q4_K_M、Framework Community、llama.cpp/Vulkan、ctx=128)

  3. DGX Spark (GB10): 4.58 tok/s(Q4_K_M、Ollama、ctx 2048、batch=1)

注記:
M3 Ultra と DGX Spark はコンテキスト長が基準4096と異なる
GMKtec EVO-X2 はctx=128での測定
全プラットフォーム Q4_K_M で統一

🚀 並列処理性能(32並列 aggregate)

  1. DGX Spark (GB10) - 8B FP8: 368 tok/s(32並列 aggregate)

注記: 他プラットフォームの並列性能データは現時点で未測定

3. アーキテクチャ/OS/フレームワーク適合

🍎 Apple Mac Studio M3 Ultra / M4 Max

  • ISA: arm64

  • OS: macOS

  • llama.cpp: ○(Metal対応)

  • vLLM: △(CPUのみ、GPU未対応)

  • TensorRT‑LLM: ×

  • MLX: ○(最適化済み)

  • Riva NMT NIM: ×(NIMはCUDA+Linux前提)

  • 備考: Apple GPUはvLLM未対応(CPUモードは利用可能)

🖥️ デスクトップ(RTX 5090)

  • ISA: x86_64

  • OS: Windows, Linux

  • llama.cpp: ○(CUDA対応)

  • vLLM: ○(CUDA対応)

  • TensorRT‑LLM: ○(CUDA対応)

  • MLX:

  • Riva NMT NIM: ○(Linux+CUDA推奨、Windowsは非推奨/対象外が多い)

  • 備考: GGUF/AWQ/FP8等の形式対応はツール依存

🏢 NVIDIA DGX Spark(GB10)

  • ISA: arm64

  • OS: Linux

  • llama.cpp: ○(CUDA/Vulkan対応)

  • vLLM: ○(CUDA, AArch64対応)

  • TensorRT‑LLM: ○(CUDA対応)

  • MLX:

  • Riva NMT NIM: ○(AArch64+CUDA、NVIDIAサポート行列参照)

  • 備考: Grace Blackwell(ARM)アーキテクチャ

🏭 ワークステーション(RTX 6000 Ada)

  • ISA: x86_64

  • OS: Windows, Linux

  • llama.cpp: ○(CUDA対応)

  • vLLM: ○(CUDA対応)

  • TensorRT‑LLM: ○(CUDA対応)

  • MLX:

  • Riva NMT NIM: ○(Linux+CUDA対応)

  • 備考: ECC VRAM搭載、安定運用向き

💻 ミニPC(Ryzen APU)

  • ISA: x86_64

  • OS: Windows, Linux

  • llama.cpp: ○(Vulkan/HIP対応)

  • vLLM: △(ROCm 6.3+ Linux限定、GPU対応が限定的)

  • TensorRT‑LLM: ×

  • MLX:

  • Riva NMT NIM: ×(NIMはNVIDIA対象)

  • 備考: APUはvLLMのGPU対応が限定的

📌 形式・ツールチェーンの互換性

注意: 形式(GGUF/AWQ/GPTQ/FP8)の可否はフレームワークごとに異なります。 採用形式とツールチェーン(llama.cpp/vLLM/MLX/TRT‑LLM)を事前に確認してくださ

4. 実測詳細(抜粋)

🍎 Apple Mac Studio M3 Ultra

8B / Q4_K_M / single decode

  • 性能: 62.6 tok/s(LocalScore)

70B / Q4_K_M / single decode

  • 性能: 15.5 tok/s(ctx 7800, MLX/LM Studio ユーザー実測)

🍏 Apple Mac Studio M4 Max

8B / Q4_K_M / single decode

  • 性能: 47.2 tok/s(LocalScore)

🖥️ デスクトップ(RTX 5090)

8B / Q4_K_M / single decode

  • 性能: 65.1 tok/s(LocalScore)

🏢 NVIDIA DGX Spark(GB10)

8B / FP8 / single decode & 32並列

  • 単発性能: 20.5 tok/s(single decode)

  • 多同時性能: 368 tok/s(32並列 aggregate)

  • Prefill: 7,991 tok/s

70B / Q4_K_M / single decode

  • 性能: 4.58 tok/s(ctx 2048, Ollama, batch=1)

🏭 ワークステーション(RTX 6000 Ada)

8B / Q4_K_M / single decode

  • 性能: 121 tok/s(LocalScore、llama.cpp)

  • Prefill: 6,808 tok/s

  • レイテンシ: 199 ms

  • VRAM使用量: 47 GB

  • 備考: 別ロット(48GB)では131 tok/sの記録もあり。実装依存で121-131 tok/sのレンジ

💻 ミニPC(Ryzen APU)

UM790 Pro(Radeon 780M)- 8B / Q4_K_M / single decode

  • 性能: 3.8 tok/s(LocalScore、llama.cpp)

  • メモリ使用量: 14 GB(統合メモリ)

  • 備考: 実装差が大きく、DirectML/INT4-ONNXで15-16 tok/s、LM Studio(Vulkan, GGUF/INT4)で13 tok/s の事例もある(参考値)

GMKtec EVO-X2(Radeon 8060S)- 8B / Q4_K_M / single decode

  • 性能: 42.0 tok/s(Framework Community、llama.cpp/Vulkan)

  • テスト条件: ctx=128, tg=128

  • 備考: Framework Desktop 128GB(Strix Halo)での llama-bench実測値。実効帯域 ~215 GB/s(理論256 GB/s)

GMKtec EVO-X2(Radeon 8060S)- 70B / Q4_K_M / single decode

  • 性能: 5.0 tok/s(Framework Community、llama.cpp/Vulkan)

  • テスト条件: ctx=128, tg=128

5. ハード指標(比較)

🍎 Apple Mac Studio M3 Ultra

  • メモリ: 統合 512 GB(最大)

  • 帯域: 819 GB/s

  • 電源: 370 W

🍏 Apple Mac Studio M4 Max

  • メモリ: 統合 128 GB(最大)

  • 帯域: 546 GB/s

  • 電源: 370 W

🖥️ デスクトップ(RTX 5090)

  • メモリ: GDDR7 32 GB

  • 帯域: 1.792 TB/s

  • 電源: 構成依存

🏢 NVIDIA DGX Spark(GB10)

  • メモリ: 統合 128 GB

  • 帯域: 273 GB/s

  • 電源: 240 W

🏭 ワークステーション(RTX 6000 Ada)

  • メモリ: GDDR6 48 GB

  • 帯域: 960 GB/s

  • 電源: 1000–2250 W


6. 互換・ロードの注意(ISA/形式差)

🍎 Apple arm64(M3/M4)

  • 推奨: MLX、llama.cpp(Metal)、CoreML

  • ⚠️ 制限: vLLM はGPU未対応(CPUのみ動作)

  • 📦 形式: GGUF対応はllama.cpp系、AWQ/GPTQはツール次第(CPU/変換が必要な場合あり)

🟢 NVIDIA CUDA(x86_64)

  • 推奨: vLLM、TensorRT‑LLM、llama.cpp(CUDA)

  • 形式: GGUF/AWQ/FP8 など形式別の最適化が充実

  • 📦 最適化: 各フレームワークで高度な最適化が利用可能

🔴 AMD APU/ROCm(x86_64)

  • 推奨: llama.cpp(Vulkan/HIP)

  • ⚠️ 制限: vLLMのGPU対応は ROCm 6.3+ のLinux限定で検討段階

  • 📦 形式: GGUF中心、ROCm経由でPyTorchも可能

🤖 ARM Linux(GB10)

  • 推奨: vLLM(CUDA, AArch64)、SGLang、llama.cpp(CUDA/Vulkan)

  • 📦 形式: FP8やGGUF(Ollama)などフレームワーク依存

⚠️ 互換性の重要事項

注意: モデルロード時はISA/OS/フレームワークの組み合わせによる非互換に注意してください。
Apple GPU + vLLM(GPU未対応)
AMD APU + TensorRT-LLM(非対応)
形式差: GGUF/AWQ/FP8 などツール間での互換性

7.性能比較

7-1.帯域比較

本棒グラフは各機種を帯域にて比較した結果だ。
モデルの重みを読み出し時に、メモリー帯域が支配的になるため、帯域(GB/s)が大きいほどtok/sの上限が上がる。(量子化やバッチ化、KVキャッシュの配置により変化)
はずだが、実際のベンチマークスコアを見てみると、、

7-2.ベンチマーク比較

ベンチマークで分かることはNvidia製GPUが圧倒的。
EVO-X2はこの中ではかなり善戦しており(llama.cppであることに注意)、Engineが異なっているもののtok/sのみで比較した場合、GB10とさほど変わらない結果が出ている。

7-3.メモリ容量

次にメモリー容量を比較したグラフだ。
これはロードできるモデルサイズに影響する。

例えば、RTX5090は32GBだが、
8Bを FP16でロードした場合、8B*2B≒16GB(理論値)
70Bを Q4でロードした場合、70*0.5=35GB(KV+一時バッファ含まず)でロードできない。

参考までに以下に各モデルのロード可能目安を示す(参考値)

  • Desktop (RTX 5090)

    • Total mem: 32 GB/Usable: 22.4 GB

    • Max params: FP16 ≈ 10.7B, FP8 ≈ 20.4B, Q4 ≈ 39.0B

  • Workstation (RTX 6000 Ada)

    • Total mem: 48 GB/Usable: 33.6 GB

    • Max params: FP16 ≈ 16.0B, FP8 ≈ 30.5B, Q4 ≈ 58.4B

  • Apple Mac Studio M3 Ultra

    • Total mem: 512 GB/Usable: 358.4 GB

    • Max params: FP16 ≈ 170.7B, FP8 ≈ 325.8B, Q4 ≈ 623.7B

  • Apple Mac Studio M4 Max

    • Total mem: 128 GB/Usable: 89.6 GB

    • Max params: FP16 ≈ 42.7B, FP8 ≈ 81.5B, Q4 ≈ 155.8B

  • NVIDIA DGX Spark (GB10)

    • Total mem: 128 GB/Usable: 89.6 GB

    • Max params: FP16 ≈ 42.7B, FP8 ≈ 81.5B, Q4 ≈ 155.8B

  • Mini PC (GMKtec EVO-X2)

    • Total mem: 128 GB/Usable: 89.6 GB

    • Max params: FP16 ≈ 42.7B, FP8 ≈ 81.5B, Q4 ≈ 155.8B

8.最もコスパの良い機種は?

8-1.導入コスト

単純に、「tok/s_per_100kJPY = (tok/s ÷ 価格) × 100,000」にて計算したグラフを以下で示す。このグラフは10万円あたりで何トークン/秒出せるかを示しています。つまり値が高いほど“安くて速い”

tok/sで比較したグラフだが、圧倒的に早い5090を除くと、EVO-X2が次点になっていることがわかる。
なら、
お金がある人は5090で、
貧乏人はEVO-X2!

なのかというとそうでもない。
EVO-X2の問題は、ISA(インストラクションセット)がx86_64な上に、Ryzen系であるため、ロードできるモデルに限りがある。(アーキテクチャ/OS/フレームワーク適合参照)
そのため、自分が導入したいモデルが、x86_64+Ryzenに対応している場合購入を推奨できるが、私のようにvLLMやNvidia Rivaの翻訳モデルをロードしたい場合は、EVO-X2ではロードできないため、選択肢から外れることとなる。

となるとRTX 5090がBestとなるかもしれないがそう単純ではない。
次の表を見てほしい

8-2.ランニングコスト

RTX5090の問題点は使用電力量となり、NVIDA DGX Sparkと比較すると335W多くなる。たった335Wと思うかもしれないが、電気料金を30円/kWhとして計算した場合、

年間消費差 = 0.335 kW × 8,760 h = 2,934.6 kWh
年間コスト差 = 2,934.6 kWh × 30 円/kWh = 88,038 円/年

となり、RTX5090との差額265,334円は、≒3年 で取り返せてしまう構図となる。つまり、RTX5090を24時間稼働させる場合、3年後にはDGX Sparkのほうが結果的に安くなってしまう。。(RTX 6000 Adaの場合は約9年)

なお、各機種ごとの1年間の電気代を可視化すると以下のようになる。

5090の電気代が年間10万円を超えるという地獄みたいなグラフだがこれが現実だ。

そのため、稼働時間や用途によっては高くてもNVIDIA DGX SparkやApple M4等が検討に上がってくることとなる。。

9.感想

個人的な結論としては、RTX 3080(350W)の12GB程度で耐えうるモデルであれば、電気代と導入コストの兼ね合いで中古のRTX3080でAI PCを構築したほうがコスパが良いのではないかと思ってしまったりする。。
もちろん3080だとパラメータサイズの問題でロードできないモデルが多いので、となるとロードできるLLMモデルを選別したうえでEVO-X2を導入するのが妥当か?
いやRivaモデルだけなら3080に収まるから3080で十分なのか??
選定のために情報を整理したはずなのに悩みが増える結果になっている。。。

いいなと思ったら応援しよう!