芋出し画像

#5 🌙ルナず孊ぶ、本圓に初めおのロヌカルLLMLM Studio 「コンテキスト長制限」で止たったので蚭定を倉えおみた

前回 #4
27Bの賢さを詊すために長文テストをしたずころ  ã€Œã‚³ãƒ³ãƒ†ã‚­ã‚¹ãƒˆé•·åˆ¶é™ã«åˆ°é”」  ã§é€”䞭停止しおしたいたした。


ロヌリングりむンドり


🌙Luna
「Ryo、制限の話は䜕ずかできるんですよね」

🧠Ryo_AI
「できたすよ 今回は、その蚭定を倉えお同じ長文テストをもう䞀床詊したす」

🌙Luna
「お願いしたヌす」

たず、今たで隠れおいた蚭定を出したす。

âž»

Developer ModeをONにする

たず巊䞋の歯車から蚭定を開きたす。

ただ問題出おなくおもやった方が良いです


䞊から3぀目の Developer を開いお
Developer mode → ON      ã«ã—たす。


🌙Luna
「オンにするず、色々出おきたしたけど他はそのたたで良いんですか」

🧠Ryo_AI
「今回はDeveloper ModeをONにするだけで倧䞈倫です。ここに衚瀺されおいるほかの項目は觊らず戻りたす」

これをONにするず、今たで通垞画面では芋えおいなかった蚭定項目も䜿えるようになりたす。

âž»

チャット右䞊からサむドバヌを出す

チャット画面ぞ戻りたす。
右䞊を芋るず、ダりンロヌドマヌクの暪にアむコンがありたす。


ここを抌すず、チャットの右偎にサむドバヌが出たす。

🌙Luna
「ここは今たで觊っおなかった堎所ですね」

🧠Ryo_AI
「普通に䌚話するだけなら、開かなくおも䜿えたすからね」

âž»


そしお、トンカチ🔚の暪にあるスラむダヌを抌す

サむドバヌ䞊郚には、トンカチのようなアむコンずスラむダヌのようなアむコンがありたす。


今回は右偎のスラむダヌを抌したす。

するず、Model Parameters  ãŒè¡šç€ºã•れたす。

そのたた少し䞋ぞスクロヌル


「蚭定」を展開する



蚭定ずいう項目があるので開きたす。

するず Temperatureなどに混じっお、コンテキストオヌバヌフロヌ ずいう項目がありたす。

ここが今回觊りたかったずころです。  



【超倧事‌】

「ロヌリングりィンドり」に倉曎

コンテキストオヌバヌフロヌを、ロヌリングりィンドりに倉曎したす。


🌙Luna
「ロヌリングりィンドりっお䜕ですか」

🧠Ryo_AI
「コンテキストが増えおきた時に、叀い郚分を倖しながら新しい内容を入れおいく方匏です」

🌙Luna
「ずっず党郚芚えおるわけではないんですね」

🧠Ryo_AI
「そこは別です、叀い情報がWindowの倖ぞ出れば、その郚分を盎接参照できなくなりたす。長い䌚話を完党保存する機胜ではありたせん」

぀たり、止たらず続けやすくなる代わりに 叀い文脈は順番に倖れおいく。 ここは芚えおおいた方がいいです。

âž»


毎回蚭定するのは面倒なのでプリセットぞ

せっかく倉曎しおも、毎回同じ蚭定を探すのは面倒。

䞊にあるプリセットから保存しおおきたす。

今回は分かりやすいように、Qwen3.6_0812     ずしお保存。


🌙Luna
「これで毎回蚭定を開かなくお枈むんですねぇ」

🧠Ryo_AI
「はい。同じModel Parametersを䜿うなら、毎回䞀から蚭定する必芁がなくなりたす」

 
远蚘:‌
【ロヌリングりむンドりでダメな人】
基本的にこれで䜿えるようになるはずですが  
なぜかそれでもダメな人
この蚘事の1番䞋を芋お䞋さい。。。

âž»

コンテキストを倧きくしお䜿いやすくしたしょう

モデルをロヌドする時のコンテキストを広げお行きたす。同時に量子化も行いたす。
最初にモデルのロヌド時の蚭定で䞋にスクロヌルしたす。

モデルのK/Vキャッシュの量子化はQ8

さらに詳现蚭定を䞋ぞスクロヌル。

量子化するずVRAMに䜙裕が出たす


Kキャッシュ量子化タむプ → Q8_0

Vキャッシュ量子化タむプ → Q8_0

この䞡方を蚭定をしたす。

🌙Luna
「QにするずGPUの容量に䜙裕が出来たした」

🧠Ryo_AI
「Q8以倖に 軜さだけならQ4などもありたす。ただ今回は、長いコンテキストを入れたいのでVRAMは節玄したい。でも粟床もあたり萜ずしたくない。その䞭間ずしおQ8を遞んでいたす」

そもそもK/Vキャッシュは、AIが䌚話を続けるために䜿う䞀時的な蚘憶領域のようなものです。

䌚話が長くなるほど、このキャッシュも倧きくなっおVRAMを䜿いたす。

通垞のf16よりQ8_0に量子化するず、KVキャッシュに必芁なメモリをかなり枛らせたす。llama.cppではK/Vずもにf16が暙準で、q8_0を含む耇数の量子化圢匏を遞択できたす。 実枬䟋では、f16同士のKVキャッシュ5,120MiBに察しおQ8_0同士は2,720MiBで、玄1.9倍圧瞮された䟋もありたす。

🌙Luna
「でも返事がおかしくなったりしないんですか」

🧠Ryo_AI
「量子化なので、理屈の䞊ではf16より粟床は少しだけ萜ちたす。ただQ8はQ4ほど匷く圧瞮しないので、VRAM節玄ず粟床のバランスを取りやすい蚭定です」

今回の目的は、

できるだけ粟床を残しながら、31,000のコンテキストをVRAM内ぞ収めるこず。

なので、いきなりQ4たで䞋げずにQ8_0 / Q8_0から詊しおいたす。

ただし、ここは「Q8ならどんなモデルでも絶察問題なし」ずいう意味ではありたせん。KVキャッシュ量子化はモデルや実行環境によっお盞性がありたす。実際、llama.cppでは䞀郚のモデルやバック゚ンドで量子化KVキャッシュに関する䞍具合報告もありたす。

今回のQwen3.6 27BRTX 5060 TiLM Studioでは、このQ8蚭定で実際に長文テストを行い、最埌たで出力できるかをこのあず確認したす。


🌙Luna
「今回は粟床を萜ずさずにVRAMを空けたいからQ8なんですね」

🧠Ryo_AI
「そうです、たずQ8で䜙裕を䜜っお それでも足りなければ次を考える。この順番の方が分かりやすいです」



そしおコンテキストを31,000ぞ



今床は䞊に戻っお最初のコンテキスト長を広げたす

GPUずTOTALを芋ながらギリギリの少し手前を攻めたす
16GBたでに収たっおたすね
今回の蚭定は、31,000 かなり䞊たで取っおいたす。


🌙Luna
「この堎合31,000が掚奚倀になりたすか」

🧠Ryo_AI
「31,000が党員の正解ずいう意味ではありたせん。モデルやVRAM、KVキャッシュの蚭定で䜿える範囲は倉わりたす」

今回の環境では、これでかなりギリギリ

なので、少し䜙裕を持たせたいなら、コンテキストをもう少し䞋げる ずいう䜿い方でもいいず思いたす。

最終的には 23000で萜ち着きたした😊
Qwenの䞊限は玄32000

âž»

ここたで蚭定出来たら 、もう䞀床モデルをロヌド。



さっき途䞭で止たった長文指瀺を、もう䞀床入れおみたす。

再テスト開始

Thinking




あれ入力欄に 「27%」ずいう衚瀺が出おたす

デベロッパヌにするず出たす


カヌ゜ルを合わせるず、
Current conversation tokens
Total loaded context

そしお 27.0% used  


🌙Luna
「これはひょっずしお今䜿っおるコンテキストの量」

🧠Ryo_AI
「そう芋れば分かりやすいです。長い䌚話をしおいる時に、今どの皋床たで䜿っおいるか確認できたす」

これは結構䟿利

今たでなら、あずどのくらい䜙裕があるのか分からないたた䌚話しおいたのが、目で芋えるようになりたした。

âž»

長文テスト䞭なので 回答が終わるたで時間がかかりたす
埅っおいる間にGPUの動きを芋おみたしょう
RTX 5060 Tiがどのくらい働いおいるのか確認。

NVIDIA蚭定パネルで芋おみたす。


LM Studioで生成䞭
GPU䜿甚率 箄95%
GPU枩床 73℃

かなり䜿っおいたす。

Windowsのタスクマネヌゞャヌ偎も芋おみたす。



こちらでは、

GPU 1 100%           73℃

🌙Luna
「ほが党郚䜿っおたすね  」

🧠Ryo_AI
「今回の長文生成䞭は、GPUをかなり高い負荷で䜿っおいたす。䞀方、CPUやメモリにはただ䜙裕がありたす」

少なくずも今回、RTX 5060 Tiを積んだのに党然䜿っおない  ãšã„う状態ではありたせん。
27Bに長文䜜業をさせるず、ちゃんず働いおいたす。

âž»

回答はどんどん続きたす
修正版のPythonコヌド
続いおテストコヌド
さらにDEBUG_REPORT

🌙Luna
「今床は止たらないですね」

🧠Ryo_AI
「今回はコンテキスト䞊限で停止せず進んでいたすね」

そしお最埌



🌙Luna
「END_OF_BENCHMARKず出たした」

🧠Ryo_AI
「少なくずも今回のテストでは、同じような長文䜜業を最埌たで完走できたした」

âž»

ロヌリングりィンドりをONにすれば党郚解決

ここは少し泚意。

今回、停止しおいた長文テストが、蚭定倉曎埌は最埌たで出力できた事、これは実際に確認できたした。

ただし、ロヌリングりィンドり無限コンテキスト ではありたせん。

🌙Luna
「止たらなくなる代わりに、䜕でも氞久に芚えられるようになるわけじゃないんですね」

🧠Ryo_AI
「そうです。今回の目的はコンテキストを無限にするこずではなく、䞊限に来た時の扱いを倉えお、長い䜜業を続けやすくするこずです」

âž»

で、27Bは賢かったの
そもそもの目的はこれでした。

27Bはどのくらい賢いのか

ずころがテストしおいたら、先にコンテキスト偎の問題にぶ぀かっおしたいたした。

🌙Luna
「賢さを調べようずしたら、蚭定の方を先に盎す事になりたした笑」

🧠Ryo_AI
「ただ、これもロヌカルLLMを䜿う時には倧事な郚分です。モデルの胜力だけ芋おも、実際に長い䜜業を最埌たで凊理できなければ䜿いにくいですからね」

短い質問なら普通に答える
長い指瀺も理解しお進められる

必芁なら過去の䌚話をコピヌしお貌り付けたり、䌚話をファむルに出力しお読み蟌たせる

コレでLM STUDIO で普通にロヌカルAIを䜿う事ができたす。

ファむルも読み蟌めるし 画像も読み蟌んで刀断する事が出来たす。


ここからは䜿い方次第で色々䟿利に䜿う事が出来たす😊


たた 機䌚があれば 携垯から自宅のLLMを操䜜
クラりドAIずの連携 Python環境の構築
その他 䟿利な䜿い方や他ずの連携機胜など 蚘事にできたら良いなず思いたす。


あずりあえずオフラむン専甚じゃなくオンラむン䜵甚でQwenが賢くなるプラグむンの䜿い方 それが先かも知れないですねヌ


🌙
note・AI・SNS考察系のアカりントを育おおいたす
気になった方、近いゞャンルの方は、フォロヌorいいね👍  ã„ただけたら芋に行きたす




远蚘:  ã“れでもダメ ええ〜そんな事っおありたす

ロヌリングりィンドりでも、うたく動かない時がある

🌙Luna
「ロヌリングりィンドりをONにしおるのに、たたに“コンテキスト長制限に到達”みたいな衚瀺が出るチャットがあるんですけど💊」

🧠Ryo_AI
「そこが少しややこしいずころです。ロヌリングりィンドりをONにすれば、理屈䞊は叀い履歎を捚おながら䌚話を続けられるはずです」

🌙Luna
「はずです」

🧠Ryo_AI
「LM Studio 0.4系では、Rolling Windowたわりの挙動が䞍安定だずいう報告もありたす」

うたく動く時は、叀い䌚話履歎をちゃんず切り捚おお、最近の䌚話だけを残しながら続けおくれたす。

しかし、うたく動かない時は、

* 䞊限近くになったあず、党履歎を最初から再評䟡しおいるように芋えお極端に遅くなる
* トヌクン䜿甚率が100を超えおも止たらない
* 出力が短くなる
* 途䞭で止たる
* 返答がおかしくなる

こういう挙動になるこずがありたす。

🌙Luna
「えヌ  じゃあ、運任せなんですか 圓たり倖れみたいな」

🧠Ryo_AI
「完党に運任せずたでは蚀いたせん。ただ、蚭定だけ芋お“これで絶察倧䞈倫”ずは蚀い切れないです」

ロヌリングりィンドりは䟿利です。

ただし、LM Studio本䜓のバヌゞョン、Runtimeのバヌゞョン、モデル、コンテキスト長、GPU蚭定の組み合わせによっお、挙動が倉わる可胜性がありたす。

なので、コンテキスト長制限っぜい挙動が出た時は、Model Parametersだけを芋るのではなく、Runtime偎も確認するず蚀う流れになりたす。

ランタむムはぁ、、😔



🌙Luna
「Runtime たた新しい蚀葉が出おきたしたね  」

🧠Ryo_AI
「はい。次はそこを芋たす。LM Studio本䜓をいきなり旧版に戻す方法もありたすが、たずRuntime偎の曎新や切り替えを確認したす」

🧠Ryo_AI
「はい、LM Studio本䜓をいきなり旧版に戻す方法もありたすが、次はRuntime画面を開いお、CUDA系のRuntimeを確認しおいきたす」



いいなず思ったら応揎しよう

kuromineinsight 「ちょっず面癜かった」「たた読みたい」ず思ったら、チップで応揎しおもらえるず嬉しいです。黒峰むンサむトの制䜜に䜿わせおいただきたす。