見出し画像

【OpenAI】GPT-OSSを試してみた話②【RTX 3060×2枚】

はじめに

前回の記事では、RTX 3060 12GB上で動作するのかを試しただけですが、実際に実用的かどうかを試すために、RTX 3060を二枚刺して 計24GBのVRAMメモリとして利用してみました。

LLM(大規模言語モデル)はStable Diffusion等の画像生成AIと異なり、GPUの並列演算が簡単にできます。演算性能が単純二倍とはいきませんが、利用できるメモリ空間が合算されるため、一枚ではほとんど動作できなかったモデルも利用可能になります。

特にRTX 3060は(少ないCUDAコアや帯域幅が同世代と比べても狭く)演算性能はそれほど良くないのですが、メモリだけがミドルスペックのGPUの中でも巨大で12GBあります。二枚利用すればハイエンドに迫る24GBメモリ空間を利用できます。ただし、一枚あたり180w(二枚で360w)の電力を利用するため、電源はそれなりのものが必要になります。※ RTX 4090 24GBは450wです

スペック

  • OS: Linux Mint 22.1

  • CPU: Ryzen7 5700x 64GB

  • GPU: RTX 3060 12GB×2(PCIE3.0とPCIE4.0対応版)

LM Studioでのパフォーマンス確認

本当はOllama (Open WebUI)で動作確認したいのですが、githubなどでも不具合のオンパレードなので、高速で手軽なLM Studioでの動作確認です。

(多機能な)Ollamaでの動作が実用的になるのはもう少し先のようです。

※ Gemma3やGemma3nも公開当時は酷いものでしたが、今は改善されとても良いものになっています

動作確認のため、可能な限りの長文を生成して

指示プロンプト
デフォルトよりも、コンテキスト長を少しだけ拡大24kにしています
約62 token/sec

十分すぎる速度で動作しています。

LLMでは(Unified Memory Architectureなので)有利なMac M3 Ultraで72 token/s程度という報告があるので、 そこそこ頑張っていると思います。

まともなAI環境にすればすぐに50万〜100万円のシステムになってしまうMacとコンパラなのは大したものです。

※ ただし、注意が必要なのは、一般的なマザーボードの場合、PCIEのGPUカードを二枚しか搭載できないので、家庭用のゲーミングPCではどんなに頑張っても合計24〜32GBが限界でしょう。一方で、Macのアーキテクチャはメモリを増やせばAIが利用できるメモリになるので、予算次第で256GBでも512GBでも可能になります。しかし、すでに価格的に”家庭用”ではないので、比べる事がおかしいでしょうが。

トークンの限界はどこか?

LLMを実用的にするのは、むしろ動作速度よりもコンテキストサイズ(トークン長)だと思います。デフォルトの4kではちょっとした会話程度しかできません。

実用的に利用するには32kは欲しいところです。

32kでも62 token/sec を保っています
64kだと実行可能でしたが、19 token/secです。明らかにCPU側に濫れていました。
MAXの128kだと9 token/secでした。

まとめ

定量的なベンチマークだと「イマイチ」感のあるgpt-ossですが、筆者が利用する限り、ローカルで利用可能なLLMとしては最高峰の一つだと思います。

以下、関連する記事の【PR】です。


いいなと思ったら応援しよう!