ローカルLLMまとめ(2026年2月)




Qwen 3.5
https://huggingface.co/collections/Qwen/qwen35

Qwen3.5-35B-A3B-GGUF
https://huggingface.co/unsloth/Qwen3.5-35B-A3B-GGUF

Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled
https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled

Qwen3.5-27B-Claude-4.6-Opus-Distilled-MLX-4bit
https://huggingface.co/mlx-community/Qwen3.5-27B-Claude-4.6-Opus-Distilled-MLX-4bit

Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF
https://huggingface.co/Jackrong/Qwen3.5-27B-Claude-4.6-Opus-Reasoning-Distilled-v2-GGUF


brew install llama.cpp

# Start a local OpenAI-compatible server with a web UI:
llama-server -hf unsloth/Qwen3.5-35B-A3B-GGUF:Q4_K_M

# Run inference directly in the terminal:
llama-cli -hf unsloth/Qwen3.5-35B-A3B-GGUF:Q4_K_M


Holo3-35B-A3B
https://huggingface.co/Hcompany/Holo3-35B-A3B


GLM-5-GGUF
https://huggingface.co/unsloth/GLM-5-GGUF

GLM-OCR
https://huggingface.co/zai-org/GLM-OCR


llm-jp-moshi-v1
https://huggingface.co/llm-jp/llm-jp-moshi-v1


NVIDIA-Nemotron-Nano-9B-v2-Japanese
https://huggingface.co/nvidia/NVIDIA-Nemotron-Nano-9B-v2-Japanese


KittenTTS
https://github.com/KittenML/KittenTTS


GPUなしで動作する軽量なAI OCRツール「NDLOCR-Lite」、
国会図書館のラボから無償公開

https://forest.watch.impress.co.jp/docs/news/2088188.html

https://github.com/ndl-lab/ndlocr-lite

RWKV7-G1d-13.3B-GGUF
https://huggingface.co/shoumenchougou/RWKV7-G1d-13.3B-GGUF/tree/main


GPT-OSS-Swallow-20B
https://huggingface.co/mmnga-o/GPT-OSS-Swallow-20B-SFT-v0.1-gguf/tree/main

GPT-OSS-Swallow-120B
https://huggingface.co/mmnga-o/GPT-OSS-Swallow-120B-RL-v0.1-gguf/tree/main


VODER
https://github.com/HAKORADev/VODER



・それと、これはローカルLLMではないんですが、
 こういうのも出たらしいですね。↓



・その他についてはこちら。↓



《llama.cppのセットアップ手順》

(2026年2月25日時点)


・最新リリース:b8149(本日公開)Windowsユーザー向けに、
 一番簡単な方法から順に説明します。

方法1:Pre-builtバイナリ

(一番おすすめ・5分で完了)

  1. https://github.com/ggml-org/llama.cpp/releases にアクセスする。

  2. 最新リリース b8149 を探して
    → llama-b8149-bin-win64.zip をダウンロードする。(約200-300MB)

  3. 任意のフォルダに解凍する。(例:C:\llama)

  4. 中の bin フォルダに llama-server.exe があります。

・これで完了! ビルド不要です。

方法2:ソースからビルド

(CUDA/Vulkanフル活用したい場合)

(1)CMake 3.15以上をインストール 

(2)GPUを使う場合:

 ・NVIDIAなら CUDA Toolkit 12.x
 ・または Vulkan SDK

(3)コマンドプロンプトで、以下を一行ずつ入力していく。↓

git clone https://github.com/ggml-org/llama.cpp.git
cd llama.cpp
mkdir build
cd build
cmake .. -DLLAMA_CUDA=ON # CUDAを使いたい場合
# または cmake .. -DLLAMA_VULKAN=ON
cmake --build . --config Release


(4)llama.cppフォルダをわかりやすいところに移動させる


C:\Users\ユーザー名に、llama.cppフォルダが作られていますので、
 Cドライブの直下に移動させます。
 (これは実行ファイルのパスを短くするためです。)

・ビルドが成功していたら、llama.cpp\build\bin\Releaseフォルダ内には
 llama-server.exe というサーバーの実行ファイルが生成されています。


(5)モデルを用意する

おすすめ:

  • Qwen2.5-Coder-32B-Instruct-Q4_K_M.gguf

  • DeepSeek-Coder-V2-Lite-Instruct-Q5_K_M.gguf

ダウンロード場所:Hugging Face

例:https://huggingface.co/Qwen/Qwen2.5-Coder-32B-Instruct-GGUF

・Q4_K_M ファイルだけダウンロードして
 C:\models\qwen-coder-32b-q4.gguf に置く。

・自動ダウンロードも可能。(後述コマンドで -hf フラグ)
・llama-server.exe の起動(あなたのアプリ用)
・C:\llama\bin に移動して、
 以下のコマンドをコマンドプロンプトで実行:

C:\llama.cpp\build\bin\Release\llama-server.exe -m C:\llama.cpp\models\Qwen3.5-35B-A3B-Q5_K_M.gguf --temp 0.65 --top-p 0.9 --repeat-penalty 1.15  --n-gpu-layers 18 --ctx-size 3072 --flash-attn auto --port 8080 --host 127.0.0.1 --chat-template qwen2 --jinja

-ngl 99 …  GPUに全レイヤーオフロード。
 (VRAM足りなければ35とかに下げて)

-c 8192 … コンテキスト長(コード長め対応)
 
・起動すると、 http://127.0.0.1:8080 でAPI待機が開始される。

ブラウザで確認:

http://127.0.0.1:8080 にアクセスすると、
 Web UIが出てくる。↓ 
 (ctrlキーを押しながらアドレスのところをクリック)

英語で普通に会話しているところ


日本語も話せるみたいです
リバーシのブラウザゲームを作ってほしいとお願いすると・・・


リバーシも一発で生成

・ソースコードはこちら。↓


※あまり無理をして大きなモデルをロードすると、
 ビデオメモリに収まりきれずに壊れて
 支離滅裂なトークになります。

 LMStudioでは、パラメータを自動的に調整しているため、
 中クラスぐらいまでのモデルなら、普通に答えてくれます。

よくある問題と解決(Windowsゲーム開発者向け)


「何も起きない / 黒い画面だけ」
 → Visual C++ Redistributable 最新版をインストールする。(MS公式)

アンチウイルスがブロック
 → 除外を設定する。

CUDAエラー
 → NVIDIAドライバ + CUDA Toolkit を再インストールする。

VRAM不足
 → -ngl 35 に減らす。(RTX 4060 8GBなら32BモデルでOK)

ポート8080使えない
 → --port 8081 に変えて、HttpClientも変更する。

いいなと思ったら応援しよう!