ローカルLLM エージェントをベンチマークしてみた ~Gemma4 vs Qwen3.6 ローカルエージェントとして優秀なモデルは?~
こんにちはRcatです。
最近は強力なローカルLLMがたくさん出てますね!
先日はローカルバイブコーディングを試したんですが、設定がちゃんとしていれば十分使えそうな領域です。ただし、できるかできないかくらいしかわからず、モデルごとの優劣が不明瞭です。
というわけで今回は、同じ課題をいくつかのモデルに与えて性能を見てみたいと思います。

はじめに
利用規約
情報や作品の活用時は事前に利用規約をご確認ください。
コメントについて
利用規約のガイドラインを確認の上コメントしてください。
則っていないコメントは削除します。
概要
ローカルモデル結局何がいい?どう選ぶ?
最近いろいろな高性能モデルが出てきていますが、結局どれがいいのかわかりませんよね。
チャットボットアリーナは非常に有用ですが、有志の改良モデルまでは網羅されてなかったり、網羅されていないパターンもあったりします(Qwen3.6とか)。
というわけで自分で簡単なタスクを投げて、実際の動作を見て判断しようと思います!
確認するモデルたち
Rcatの独断と偏見でモデルを選定します!
Gemma4 26B A4
ローカルエージェントの最有力候補。
チャットボットアリーナでは、GPT-5-HIGHより上位にいます。
Gemini/Gemmaで絞るとご覧の通り。まさかのGemini2.5-flashより上。
ちなみに31BはまさかのGemini 2.5Proより上w。旧商用に勝っちゃったよ。

Gemma4 26B A4 Claude蒸留版
主に思考の仕方を現在断トツ一位のClaudeから蒸留したというモデルです。
学習ミスったものがUPされてるとは思えないので、性能は向上しているはず。
つまり…上のベンチよりさらに上に行ってるかもw
こういうのがアリーナにいないのが残念でならない…
Gemma4 31B
オープンかつ個人で手が出るギリギリのサイズのモデル。
これはQ4でやります。重いので。
重くない人はこっちがローカルエージェント最有力候補かな?
Qwen3.6 35B A3
Qwen3.5が出てすぐに3.6になりましたね。
公式ページでは3.5とは段違いの性能をうたっています。
3.5 35B A3のスコアは1396で、Gemma4の26B A4の1438に負けています。
さて、3.6になると…?これ書いてる時点ではまだ結果がないんですね。
もし上がっていれば、同等以上の性能を期待できます。
ちなみにたまにちょっとだけ中国語が出ますw 3.5では出なかった気がする。
Qwen3.6 35B A3 Claude蒸留版
こちらも推論を吸収した強化版。
3.6になってGemmaをもし超えていたら、このモデルはさらに強化されだいぶやばい化け物になっているかもしれません。期待です。
Qwopus3.6-27B (Qwen3.6 Claude蒸留オリジナル)
Jackrongさんという方が作っているQwenシリーズ+Claude蒸留のモデルです。27B版はこちらを使用します。
Gemma4 vs Qwen3.6の蒸留決戦です!
Granite 4.1 30B (思考無し)
IBMのモデルですね。エージェントを前提にされているのですが、"思考をしない"タイプのものです。
ほかのモデルはすべて思考の上で結論を出す前提なのですが、このモデルは思考が長くローカルでは非効率であるという感じの考えのもと、思考無し前提でトレーニングされてるらしい。
思考無しGemma4 31Bよりスコアが高いらしいが、さてGemma4は思考無しって前提じゃないのでどこまでくらいついてくるのか。
検証方法
方法
お題を与えてアプリを作らせます。
それが達成できたか、実行過程でつまずいたり繰り返しで落ちたりしないかなどを見ます。
さらに、改修を加えることができるかも見ます。
まっさらな環境から作ることはできても、意外と改修でつまずくことが多いので、よくある「アプリを作らせたらできました」だけだとほんとの性能ってわからないんですよね。そのあと改修数回加えたらどうなんですか??って聞きたくなる毎回。
お題
LLMチャットアプリの作成

前提
フロントはVue3+Bootstrap5。用意したテンプレ環境を使って開発。
バックはPython Flask。こちらも私が書いた既存のテンプレからスタート。
チャット履歴はDBに書き込む(改修)。
llama-serverのopenai互換apiを叩いてLLMを稼働させるプロキシ的なサーバー。
ぶっちゃけテンプレがある時点で完全新規でなく改修みたいなものですが、まぁ難易度上がっていいんじゃないですかね。
ポイント
PythonとHTMLを併用する
既存のテンプレを理解する必要がある
フロントとサーバーが通信する
サーバーとAPIサーバーが通信する
DBを使う
イマドキ(どーでもよw)
指示
このアプリを作らせるための指示を考えます。こんな感じでしょうか。
大事なのは進め方ですね。
サブタスクを存分に生かしてもらいます。でないとローカルではコンテキストが足りなくなる。
Pythonとvue3を使ったLLMチャットWEBアプリを作成してください。
#アプリの仕様
- WEB画面からLLMとチャットできる(履歴は不要の単発とし、入力と出力の入る場所があればよい)
#制約
- プロジェクト内にすでにVue3のテンプレート環境があります。これを編集して使う
- Bootstrap5がインストール済み。CSSはこれを使う
- チャットのやり取りはfetchで行う
#環境
- LLM API OpenAI互換API(llama-server)がlocalhost:8082でホストしている前提とする
#その他
不鮮明な点は事前にユーザーに確認を取ってから進めること
#進め方
まずはプロジェクトの状態を確認しまとめる。その後、実装計画を立ててから実装に移る。
テストは不要。ユーザーが実際に動かす。
start.batを実行するだけで動かない状態の場合は、事前準備方法をユーザーに伝えるか、readmeを作成しておくこと。
できるだけタスクは細分化してサブタスクに投げること。
調査/分析、計画、実装(機能やコンポーネント毎)と可能な範囲でタスクを分割して実行する。機能追加指示
DBへの履歴書き込みは追加機能とします。
自分で追加したチャット機能に対して正常に履歴の書き込みを追加することができるのか!?
機能変更 DBへの履歴書き込み
#新規実装
- LLMへの入力と回答はDBに履歴として保存する(参照は不要。書き込みのみ)
#制約
- DBはSQLiteを使う。既存のdbファイルにテーブルを追加すること。
#その他
不鮮明な点は事前にユーザーに確認を取ってから進めること
#進め方
まずはプロジェクトの状態を確認しまとめる。その後、実装計画を立ててから実装に移る。
テストは不要。ユーザーが実際に動かす。
できるだけタスクは細分化してサブタスクに投げること。
調査/分析、計画、実装(機能やコンポーネント毎)と可能な範囲でタスクを分割して実行する。実装 - Gemma4 26B-A4 Q8
まずは一番期待しているGemma4 26Bですね!
たのみましたよぉ!
WEBアプリの作成
所要時間:35分程度
所感
数回編集に失敗する場面があり助言をしたものの完遂。こちらの指定通りの仕様のWEBアプリを作成できました。
追加実装
また最初のうちに編集に失敗しましたが、再試行で進みました。
しかし、途中の過程で繰り返しが発生してしまい進行不能。
コミットを忘れたので戻せないので終了とします。
最初のうちから編集に失敗しているので、あまり期待できないというのもあります。
実装 - Gemma4 26B-A4 Q8 Claude蒸留
次はClaudeの思考を学習したパターン。
次はうまくいくか!?
WEBアプリの作成
所要時間:30M
所感
目標を達成することができなかった。
サーバーは起動するが、vue側のビルドが通らないためサイトの閲覧が不可。
初回にいきなり繰り返しに突入したのも問題。
その後もファイルを片っ端から読み込んでしまうので、コンテキストオーバーになる。Claude蒸留なだけあり広大なコンテキスト長がある前提で調整されていると思われる。
なのでコンテキスト自動圧縮をONにしておかないと切り詰めが発生し、整合が取れなくなり崩壊する。
結果として成果物ができなかったので、圧縮を通して情報が失われてしまったものと推測される。
同じサブタスクの多重作成をしてしまうなど、ローカルRooCodeとは相性が悪い印象。
もっと広大なコンテキストを与えれば違うのかもしれないが、初期に繰り返す時点で伸ばしてやるのはリスクが高いので今回はここで終わらせるとする
実装 - Gemma4 31B Q4
WEBアプリの作成
所要時間:60M
所感
終始安定して動作した。
トップ画面にリンクを貼ってはくれなかったものの、きちんと"/chat"にアクセスしてくださいという記述があるためアクセスはできた。
チャットの画面が26Bと違いチャットっぽさが出ているのと、こちらの指定通り単発のため、毎回履歴が消える。
その代わり動作速度が遅いので1Hかかってしまった。
追加実装
所要時間:53M

所感
途中から書き込みが安定しなかった。こういう場合はユーザーが別のアプローチを指示すれば修正できる場合もあるが、なかなかいうことを聞かなかった結果繰り返し失敗する。
コンテキストの圧縮を実行して何とか軌道修正してタスクを完了できた。
しかし、DBにデータは書き込まれなかった。
せっかくなので修正を依頼し、書き込むDBファイルが間違っていたことが判明(確かにファイルは指示してなかった)。修正してDBに履歴を書き込むことができた。
良くも悪くも堅実?31Bという密モデルの割にはちょっとツール呼び出しが甘いのではないかと感じた。
実装 - Qwen3.6 35B-A3 Q4
さて、チャットボットアリーナにいない3.6の実力は如何に!?
WEBアプリの作成
所要時間:13M
所感
Gemmaと違って、最初に実行計画をmarkdownファイルで出力してきた。
タスクの範囲を超えて実装しようとする(サブタスクなのに小範囲で終わらせず実装に進みそうになる)。
そこだけ軌道修正してやれば後はすんなりいった。
あと製作時間がGemma4の半分。これはたぶん思考量の違い。Gemma4は考えすぎてる感がある。Qwenのほうがサクッと結論に移行する感触。
追加実装
所要時間:27M

所感
途中で繰り返しに入ってしまったがコンテキスト圧縮で復活。
簡単な不備があったのでそこだけ手で消しただけで動作した。
履歴の形式は発言順にそのまま記録されるというものだった。確かに入力応答が対になるようにとは言ってないがこの形はないだろう。また、プロパティがいっぱいあるんだがw素直なQwenシリーズらしいといえばらしいな。
実装 - Qwen3.6 35B-A3 Q4 Claude蒸留版
ここまでで善戦しているQwenの軽量。果たして強化版はどんなものになっているのか!?
WEBアプリの作成
所要時間:13M
所感
Gemmaの時と同様、Claudeを蒸留したものはとにかくファイルを読みたがる。初回一気にファイルを読んだ時ばびっくりした。
それ以外はそこそこすんなり行った感じ。ただ、初動は明示的にサブタスク使えって言わないとそのまま進めたがるな…。
さらに言えば、実は初回コケてTake2だったりするのだが、初回くらい見逃してやる。
追加実装
所要時間:11M

所感
終始安定して動作していた印象。まぁサブタスクの活用は言わないとだめだけどw
ツール呼び出しに終始失敗しなかったのってこの時点で初めてな気がする。結構優秀?しかもほかのは改修に時間がかかるのにこのモデルはかかってない。
ただし…SQLの追加する場所が間違っていたので、あとで追加指示をしている。確かにどこに書けとは言ってないけど、他のモデルは察して入れてくれたぞwたまたまかな?
実装 - Qwopus3.6-27B Q4
3.6密モデル+蒸留パワー見せてもらいましょう
WEBアプリの作成
所要時間:50M
※わりとGPU HUNGで落ちてるのでもう少し早いと考えていいかも。
所感
一発目はキー名不一致により動かなかったが、画面上のエラーを伝えただけで修正、動くようになった。
編集の失敗もほぼなく安定している。
ほかのClaude蒸留シリーズに比べてコンテキストの消費が抑えられている印象。
追加実装
動画がどこか行きました…
所要時間:80M
GPUが頻繁に落ちるのもあって時間かかった印象

所感
改修を一発では完遂できなかった。
具体的にはほぼできたものの、初期化スクリプトにテーブルがないので作られないという落とし穴。ぶっちゃけ指示が悪いか。
密モデルなだけありすごく時間がかかった。
実装 - Granite 4.1 30B
さて、唯一の思考無しモデルですね。結果は如何に
WEBアプリの作成

所要時間:15M
目標を完遂できなかった。差分を見ても、フロントのVueは生成されてるっぽいが、ルートの追加無しバックエンド未改修で完了と宣ってきた。
ちょっとこれはどうなの?思考無しでGemma4に勝ったって本当?

所感
めっちゃ遅い。
t/sはほかの30B級と変わらないが、トークンの分割の問題だろうか?多分日本語1文字1トークンで出ている。他は単語で1トークンっぽい。なので遅く感じる。
さすがにここまで遅いと他の思考前提モデルのほうが結局早い。
あと、日本語が下手。漢字が間違ってるどころの騒ぎではない。意味不明。
IBMのモデルなんだよな?中華系なら漢字混じりの日本語で中国語が出てきてしまうのは仕方ないにせよ、US系なんだよな?どういうこと?

追加実装
前提が無理だったので実施しません。
実装 - Qwen3.6 35B-A3 Q4 Claude蒸留版 NoThink
優秀だと思うモデルを、思考無しで動かしたらどうなるか見てみます!
WEBアプリの作成
所要時間:11M
所感
普通にできた。思考無しでも結構優秀なのでは?
特にツール呼び出し失敗などもなく、UIもさっきよりかっこいい。
追加実装
所要時間:21M
所感
目標を達成できなかった。テーブルができなかったので指摘して作られたが、履歴が入らない。数回指摘すれば行けそうな感じもするが、ここまでとする。
また、claude蒸留特有のファイル爆読みが発動し、調査段階でコンテキスト圧縮が発動!読み込んだところで、その結果どうなったのかまとめておかないと圧縮で消えるから無意味なんだよなぁ。
まぁ思考無しなので圧縮もそこまで時間かからないんだけどさ。
んで、繰り返し発動&圧縮で復帰。ちょっと安定しないかも?だが書き込みツールが失敗しないのは高評価。
まとめ

今回は最近出てきた高性能モデルを実際に使って、ローカルバイブコーディングさせるなら何がいいのか比較してみました。
AIにやらせる場合、タスクごとにちゃんとコミットしたほうがいいですね。RooCodeは戻せるはずなんですが、なんかうまく機能せず戻りませんでした。
思ったよりGemma4シリーズは全体的に微妙な感じ、あるいはRoocodeとは相性が悪いか?逆にQwenシリーズは素晴らしい安定感を見せてきました。
やっぱり動かしてみないとわからないですね。安定性や癖が全然違います。
UIはGemmaのほうがそれっぽくかっこいいですが、指示してないのでQwenのタイプでも正解です。
3.5シリーズはだいぶ順位が下でしたが、3.6がアリーナに正式に入ってきたらだいぶ上行くのでは?少なくとも私的にはGemma4より上なんですが。使い方によるところはありそう。
この結果をもとに、今後使っていくモデルを決めようと思います。
リンク集
使用したモデル
https://huggingface.co/unsloth/gemma-4-26B-A4B-it-GGUF
https://huggingface.co/TeichAI/gemma-4-26B-A4B-it-Claude-Opus-Distill-v2-GGUF
https://huggingface.co/unsloth/gemma-4-31B-it-GGUF
https://huggingface.co/unsloth/Qwen3.6-35B-A3B-GGUF
https://huggingface.co/lordx64/Qwen3.6-35B-A3B-Claude-4.7-Opus-Reasoning-Distilled-IQ4_XS-GGUF
https://huggingface.co/Jackrong/Qwopus3.6-27B-v1-preview-GGUF
https://huggingface.co/unsloth/granite-4.1-30b-GGUF
感想投稿フォーム
コメントは公開で恥ずかしい!! Rcatだけに送りたい人向け
ミニPCにLinuxをインストール
クイック結果まとめ
ここから先は
情報が役に立ったと思えば、僅かでも投げ銭していただけるとありがたいです。
