芋出し画像

#4 🌙ルナず孊ぶ、本圓に初めおのロヌカルLLM蚭定を觊るず Qwen の返事は早くなる


埌半 あたりそこらに茉っおない調敎やりたす
絶察必芁だず思いたす



#2で Qwen3.6 27BをPCぞ入れお、日本語で最初の返事をもらいたした。

ただし、Thinkをオンにした状態で自己玹介を頌むず、画面には

Thought for 1 minutes 36 seconds

ず出たした。

でも自己玹介だけで1分36秒は、さすがに埅おないです。

前回の最埌に、GPU Offloadを調敎すれば、叀いi7-4790Kぞ回っおいるかも知れない凊理を、RTX 5060 Ti偎ぞ任せられるかもしれないず曞きたした。

今回は、#2でそのたたにしおいた蚭定を、実際に觊っおみたす。

────────────────────────


前回、27Bを読み蟌む前の画面には、GPU Offloadずいう数字がありたした。
その時は、自動で衚瀺された53のたた読み蟌みたした。


さぁ蚭定

🌙Luna
「前回、GPU Offloadを觊ればもっず早くなるかもしれないっお蚀っおたしたよね」

🧠Ryo_AI
「はい。前回は、たず27BがこのPCで正垞に動くかを優先したした。最初から数字を倉えお、動かなくなったら䜕が原因か分からなくなるためです」

🌙Luna
「じゃ早くなるず嬉しいので次お願いしたヌす」

🧠Ryo_AI
「今回は、どこたでGPU偎ぞ任せられるか確認したす。読み蟌んだ27Bの暪にある歯車を抌しおください」

前回の蚭定を確認したす


【操䜜】

1読み蟌んでいるQwen3.6 27Bの暪にある歯車を抌す
2モデルごずの蚭定画面を開く

─────────────────────────

GPU Offloadを53から64ぞ䞊げる

🌙Luna
「GPU Offload っお結局どんな蚭定ですか」

🧠Ryo_AI
「27Bが返事を䜜る時の凊理を、CPUではなくGPUぞどこたで任せるかの蚭定です」

🧠Ryo_AI
「前回は53たでGPUぞ任せおいたした。今回のモデルでは、64たで䞊げられたす」

🌙Luna
「ずりあえず最倧たで䞊げちゃいたす」

🧠Ryo_AI
「はい、それで今回のRTX 5060 Ti 16GBで読み蟌めるなら、叀いCPU偎ぞ回る凊理を枛らせたす」

GPU Offloadを53から64ぞ倉曎したした。

その䞋にある、CPUスレッドプヌルサむズも3から4ぞ倉曎したす。

🌙Luna
「CPUの方は、4にしおいいんですか」

🧠Ryo_AI
「GPUぞ任せきれない凊理や、呚蟺の凊理にはCPUも䜿いたす。今回は3ではなく4で詊したす」

🌙Luna
「䞋のMax Concurrent Predictionsは、1のたたでいいんですか」

🧠Ryo_AI
「䞀人で䜿う今回は1のたたで倧䞈倫です。同時に耇数の返事を䜜らせる数なので、倚くしたから䞀぀の返事が速くなる数字ではありたせん」

今回は、现かい数字を党郚いじりたせん。

倉えたのは、この二぀だけです。

・GPU Offload53 → 64
・CPUスレッドプヌルサむズ3 → 4

Context Lengthの8192は、前回のたた倉曎したせん。


⚠❗他の人モデルやVRAMサむズが違う方
あずでもう䞀床泚意曞きしたすが
蚭定は䞊のVRAM TOTALを芋おやりたす
GPUオフロヌドはVRAMサむズ以内にした方がいい



倉曎したら適甚を掚したす


───────────────────────

🌙Luna
「64ず4に倉わりたした」

🧠Ryo_AI
「ただです。今開いおいる27Bは、前の53ず3で読み蟌たれた状態です。䞀床読み蟌み盎したす」

【操䜜】
画面䞋に衚瀺された「再読み蟌み」を抌す。

モデルを読み蟌み盎し、GPU Offload 64ずCPUスレッドプヌルサむズ4の状態で27Bを開き盎したした。

─────────────────────────

もう䞀床、自己玹介をしおもらう

前回ず同じように、27Bぞ自己玹介を頌みたす。

Thinkはオンのたたです。

こんにちは。日本語で簡単に自己玹介しおください

🌙Luna
「Thinkingが出たした」

しばらくするず、返事が衚瀺されたした。

画面に出た時間は、

Thought for 24.24 seconds

24秒‌



🌙Luna
「24.24秒です。前回は1分36秒でしたよね」

🧠Ryo_AI
「はい。同じQwen3.6 27Bです。モデルを軜いものぞ入れ替えたわけではありたせん」

🧠Ryo_AI
「GPUぞ任せる量を53から64ぞ䞊げ、CPU偎の蚭定も3から4ぞ倉えたこずで、前より埅ち時間が短くなりたした」

前回は、自己玹介だけで1分36秒。

今回は、24.24秒。

箄72秒短くなりたした。

もちろん、返事の長さや質問の内容で時間は倉わりたす。

文字数たで完党に揃えたベンチマヌクではありたせん。

それでも、前回は「27Bっお、こんなに遅いのかな」ず思った自己玹介が、24秒台たで瞮みたした。

🌙Luna
「Thinkをオフにすれば速かったですけど、オンのたたでもここたで倉わるんですね」

🧠Ryo_AI
「そうです、27Bそのものが急に軜くなったのではなく、自分のPCにあるGPUを、前より䜿える状態に近づけたずいうこずです」

ちなみにThinkを倖せば 䞀瞬で解答しおくれたす


👀  蚭定は、GPUのVRAMや CPUの性胜によっお倉わりたすがTOTAL GPUが蚱すなら フルで䞊げちゃっおくださいw  äžŠã’おから比べお どちらが良いか遞べば良いも思いたす。

⚠ただし コンテキストずオフロヌドの蚭定は16GBなら16GB  8GBなら8GBに収たるように
GPUずTOTALがありたすが できるだけ䞡方 それ以内に収たるようにしおください。

─────────────────────────

今の時点でやった事

・前回そのたたにしたGPU Offload 53を確認した
・GPU Offloadを64ぞ䞊げた
・CPUスレッドプヌルサむズを3から4ぞ䞊げた
・倉曎埌、モデルを再読み蟌みした
・Thinkオンの自己玹介が、1分36秒から24.24秒になった

27Bを入れたら、それで終わりではありたせん。



賢さを芋おみるはずが、トラブル💊


🧠Ryo_AI
「ここたで色々䌚話しおみたしたが、普通のやり取りは特に問題なさそうですね」

🌙Luna
「質問したらちゃんず返っおくるし、普通に話すだけなら困らなさそうです」

🧠Ryo_AI
「では、そろそろ賢さの方を調べおみたすか」

🌙Luna
「」

🧠Ryo_AI
「簡単なクむズではなく、条件を倧量に枡しお、その条件を守ったたた最埌たで䜜業できるか詊したす」

🌙Luna
「䜕か難しそうですねぇ」

🧠Ryo_AI
「今回はPythonコヌドの保守䜜業をやらせたす」

今回入れた指瀺はかなり長めでした。
ここ分からなくお、倧䞈倫です
内容を簡単にたずめるず、

泚文ログを埩元するPythonプログラムを枡し、仕様を理解したうえで耇数のバグを特定。
公開むンタヌフェヌスを壊さず修正し、指定された倧量の境界条件を含む自動テストを䜜成。
最埌に修正版コヌド、テストコヌド、DEBUG_REPORTたで出力させる。

さらに、

「質問犁止」
「最䜎25テスト」
「指定された34項目を党郚どこかで怜蚌」
「最埌にEND_OF_BENCHMARKたで出す」

など、途䞭で条件を萜ずすず倱敗になるようにしおありたす。

🌙Luna
「䜕ずなくですけど、だいぶ倧倉そうですね」

🧠Ryo_AI
「コヌドを曞く胜力だけではなく、長い仕様を远い続けられるかも芋られたす」

では、そのたた実行。

しばらく考えお  

コヌドも出し始めたした。

ずころが   

あれ 途䞭で止たった

停止理由コンテキスト長制限に到達


画面䞋を芋るず

停止理由コンテキスト長制限に到達

🌙Luna
「  あれ 止たっおたす」

🧠Ryo_AI
「はい、回答内容の途䞭でコンテキスト䞊限に到達しおいたす」

🌙Luna
「ただ途䞭なんですけど  」

🧠Ryo_AI
「今回の衚瀺を芋る限り、その状態です」

ここに来お問題が発生しおしたいたした‌

コンテキストは、AIの䜜業机の広さみたいなものです。
短い質問なら、机はあたり埋たりたせん。

でも今回は
長い指瀺を眮く
途䞭の条件も眮く
考えた内容も眮く
長い返事も出す
ので机がどんどん埋たっおいきたす。

そしお机がいっぱいになるず、ただ䜜業䞭でも止たるずいう感じです。


🌙Luna
「これ、長く䜿おうずするず結構困らないですか」

🧠Ryo_AI
「困りたすね、今回だけの話ではなく 䌚話を積み重ねお䜿う堎合は同じ問題が出おきたす」


コヌドを盎しおもらう
長い文章を曞いおもらう

こうやっお普通に䜿っおいるだけでも、䌚話履歎はどんどん増えおいきたす。

🌙Luna
「じゃあ、ある皋床たで䜿ったら毎回止たるんですか」

🧠Ryo_AI
「今の状態のたたなら、コンテキスト䞊限ぞ到達したずころで生成が止たる可胜性がありたす」


止たれば新しいチャットを始めれば良いだけなので簡単です。しかし 新しいチャットを䜜るず、それたで積み䞊げた䌚話はそのたた匕き継がれたせん。

🌙Luna
「最初からたた説明するんですか」

🧠Ryo_A
「必芁な条件は、もう䞀床枡すこずになりたす」

たずえばコヌド䜜成なら
「さっき決めたこの仕様で」

蚘事䜜成なら
「前に決めた構成の続きで」

普通の盞談でも、
「さっき話しおた条件を䜿っお」
こういう䜿い方ができなくなっおきたす。


これでは結構面倒です。

🌙Luna
「ロヌカルLLMなら奜きなだけ䜿えるはずなのに、チャットを䜕回も䜜り盎すのはちょっず違いたすね  」


🌙Luna
「これ、䜕ずかできないんですか」

🧠Ryo_AI
「できたす、でもLM Studio偎でその蚭定が隠されおいお初心者だず間違いなく觊れないようになっおたす」

🌙Luna
「えヌ、そうなんですか 教えおください💊」


ここからは、コンテキストがいっぱいになっおも、その堎で止たりにくくする隠された蚭定を実際に倉曎しおみたす。

※LM Studioは曎新により、画面構成やボタン名が倉わる堎合がありたす。この蚘事では、実際に導入した時点の画面を䜿っお進めおいたす。




🌙
note・AI・SNS考察系のアカりントを育おおいたす
気になった方、近いゞャンルの方は、フォロヌorいいね👍  ã„ただけたら芋に行きたす


いいなず思ったら応揎しよう

kuromineinsight 「ちょっず面癜かった」「たた読みたい」ず思ったら、チップで応揎しおもらえるず嬉しいです。黒峰むンサむトの制䜜に䜿わせおいただきたす。