ローカルLLMまとめ(2026年2月)
Qwen3.5-35B-A3B-GGUF
https://huggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF
Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled
https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled
Qwen3.5-27B-Claude-4.6-Opus-Distilled-MLX-4bit
https://huggingface.co/mlx-community/Qwen3.5-27B-Claude-4.6-Opus-Distilled-MLX-4bit
Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF
https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF
brew install llama.cpp
# Start a local OpenAI-compatible server with a web UI:
llama-server -hf unsloth/Qwen3.5-35B-A3B-GGUF:Q4_K_M
# Run inference directly in the terminal:
llama-cli -hf unsloth/Qwen3.5-35B-A3B-GGUF:Q4_K_MHolo3-35B-A3B
https://huggingface.co/Hcompany/Holo3-35B-A3B
llm-jp-moshi-v1
https://huggingface.co/llm-jp/llm-jp-moshi-v1
NVIDIA-Nemotron-Nano-9B-v2-Japanese
https://huggingface.co/nvidia/NVIDIA-Nemotron-Nano-9B-v2-Japanese
GPUなしで動作する軽量なAI OCRツール「NDLOCR-Lite」、
国会図書館のラボから無償公開
https://forest.watch.impress.co.jp/docs/news/2088188.html
https://github.com/ndl-lab/ndlocr-lite
RWKV7-G1d-13.3B-GGUF
https://huggingface.co/shoumenchougou/RWKV7-G1d-13.3B-GGUF/tree/main
GPT-OSS-Swallow-20B
https://huggingface.co/mmnga-o/GPT-OSS-Swallow-20B-SFT-v0.1-gguf/tree/main
GPT-OSS-Swallow-120B
https://huggingface.co/mmnga-o/GPT-OSS-Swallow-120B-RL-v0.1-gguf/tree/main
・それと、これはローカルLLMではないんですが、
こういうのも出たらしいですね。↓
・その他についてはこちら。↓
《llama.cppのセットアップ手順》
(2026年2月25日時点)
・最新リリース:b8149(本日公開)Windowsユーザー向けに、
一番簡単な方法から順に説明します。
方法1:Pre-builtバイナリ
(一番おすすめ・5分で完了)
最新リリース b8149 を探して
→ llama-b8149-bin-win64.zip をダウンロードする。(約200-300MB)任意のフォルダに解凍する。(例:C:\llama)
中の bin フォルダに llama-server.exe があります。
・これで完了! ビルド不要です。
方法2:ソースからビルド
(CUDA/Vulkanフル活用したい場合)
(1)CMake 3.15以上をインストール
(2)GPUを使う場合:
・NVIDIAなら CUDA Toolkit 12.x
・または Vulkan SDK
(3)コマンドプロンプトで、以下を一行ずつ入力していく。↓
git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
mkdir build
cd build
cmake .. -DLLAMA_CUDA=ON # CUDAを使いたい場合
# または cmake .. -DLLAMA_VULKAN=ON
cmake --build . --config Release(4)llama.cppフォルダをわかりやすいところに移動させる
・C:\Users\ユーザー名に、llama.cppフォルダが作られていますので、
Cドライブの直下に移動させます。
(これは実行ファイルのパスを短くするためです。)
・ビルドが成功していたら、llama.cpp\build\bin\Releaseフォルダ内には
llama-server.exe というサーバーの実行ファイルが生成されています。
(5)モデルを用意する
おすすめ:
Qwen2.5-Coder-32B-Instruct-Q4_K_M.gguf
DeepSeek-Coder-V2-Lite-Instruct-Q5_K_M.gguf
ダウンロード場所:Hugging Face
例:https://huggingface.co/Qwen/Qwen2.5-Coder-32B-Instruct-GGUF
・Q4_K_M ファイルだけダウンロードして
C:\models\qwen-coder-32b-q4.gguf に置く。
・自動ダウンロードも可能。(後述コマンドで -hf フラグ)
・llama-server.exe の起動(あなたのアプリ用)
・C:\llama\bin に移動して、
以下のコマンドをコマンドプロンプトで実行:
C:\llama.cpp\build\bin\Release\llama-server.exe -m C:\llama.cpp\models\Qwen3.5-35B-A3B-Q5_K_M.gguf --temp 0.65 --top-p 0.9 --repeat-penalty 1.15 --n-gpu-layers 18 --ctx-size 3072 --flash-attn auto --port 8080 --host 127.0.0.1 --chat-template qwen2 --jinja・-ngl 99 … GPUに全レイヤーオフロード。
(VRAM足りなければ35とかに下げて)
・-c 8192 … コンテキスト長(コード長め対応)
・起動すると、 http://127.0.0.1:8080 でAPI待機が開始される。
ブラウザで確認:
・http://127.0.0.1:8080 にアクセスすると、
Web UIが出てくる。↓
(ctrlキーを押しながらアドレスのところをクリック)




・ソースコードはこちら。↓
※あまり無理をして大きなモデルをロードすると、
ビデオメモリに収まりきれずに壊れて
支離滅裂なトークになります。
LMStudioでは、パラメータを自動的に調整しているため、
中クラスぐらいまでのモデルなら、普通に答えてくれます。
よくある問題と解決(Windowsゲーム開発者向け)
「何も起きない / 黒い画面だけ」
→ Visual C++ Redistributable 最新版をインストールする。(MS公式)
アンチウイルスがブロック
→ 除外を設定する。
CUDAエラー
→ NVIDIAドライバ + CUDA Toolkit を再インストールする。
VRAM不足
→ -ngl 35 に減らす。(RTX 4060 8GBなら32BモデルでOK)
ポート8080使えない
→ --port 8081 に変えて、HttpClientも変更する。
