オープンソースLLMのトップランナー(2025年8月版)
ランキング概要:3つのベンチマークで見るトップランナー
Vellum AI(Humanity's Last Exam / 総合)
1位 Kimi K3(56.0%)
2位 GLM 5.2-max(54.7%)
3位 Kimi K2.6(54.0%)
4位 DeepSeek V4 Flash(51.6%)
5位 DeepSeek V4 Pro(48.2%)
LMArena Chatbot Arena(人間評価 Eloレート:オープンウェイト限定)
1位 GLM 5.2-max(Z.ai)Elo 1471
2位 Mimo V2.5-Pro(Xiaomi)Elo 1468
3位 GLM 5.1(Z.ai)Elo 1467
4位 Kimi K2.6-thinking(Moonshot)Elo 1461
5位 Hy3 / GLM 5(Tencent / Z.ai)Elo 1457
LLMPM Rankings(BBH, GPQA, IFEval, MATH, MMLU-Pro の平均スコア)
1位 Kimi K2.5(77.3%)
2位 Kimi K2.6(74.7%)
3位 Qwen3.5-122B-A10B(72.3%)
4位 Qwen3.5-27B(71.4%)
上位モデルの詳細プロフィール
Kimi Kシリーズ(Moonshot AI / ByteDance系)
最新作 Kimi K3 の数値は圧巻。Humanity's Last Exam(HLE)56.0%・GPQA Diamond 93.5%・BrowseComp 91.2%。全ベンチでトップクラス。ByteDance傘下のMoonshot AIが開発した大規模推論モデル。複雑なマルチステップ推論、Web探索タスクにおいて、ClosedSourceのLLM(GPT-4、Claude Opus等)にも匹敵する性能を出している。
Kimi K2.6 はK3の直前のバージョン。HLE 54.0%・Chatbot Arena Elo 1461・SWE Bench 80.2%。バランスが取れている。Agentic Coding分野でも上位圏に位置し、実務利用にも十分耐え得る性能。
Kimi K2.5-thinking はElo 1450・総合Avgスコア77.3%でLLMPMランキング1位を獲得。推論(Reasoning)専門のバージョン。Chain-of-Thoughtを駆使した高度な推論タスクに特化している。
ライセンス:Modified MIT
アーキテクチャ:MoE(Stable LatentMoE)採用、コスト効率重視
総パラメータ:2.8T(世界初3Tクラス・オープンウェイトモデル)
活性化パラメータ:~104B / トークン
routed experts:896 per layer
1 tokenあたり active:16 + shared experts 2
強み:総合知能、科学推論、Web探索、マルチモーダル対応
用途:研究開発、高度な推論が必要な業務、一般会話
GLMシリーズ(Z.ai / Zai Lab)—— Chatbot Arena王者
GLM 5.2-max はLMArena Chatbot ArenaでElo 1471。オープンウェイトモデル中No.1。Humanity's Last Examでは54.7%・GPQA Diamondでも91.2%。科学・医学・数学の難問に強い。Z.ai(旧Zai Lab)がMITライセンスで公開しており、商用利用も可能。
GLM 5.1、Hy3(Tencent × Z.ai協働)もElo 1457–1467圏で安定して上位に入っている。GLMシリーズは一貫して「人間との対話品質」の高さを売りにしている。マルチターン会話、ツール利用、ブラウザ操作などの実用的なタスクに優れる。
ライセンス:MIT / Apache 2.0(モデルによる)
アーキテクチャ:MoE + DeepSeek Sparse Attention(DSA)のハイブリッド。GLM 5.x全てがMoEベース
GLM 5 / 5.1 / 5.2:共通の744B(総)/ 40B(active)MoE
routed experts:256 per layer、top-8 active + shared expert 1
Multi-Latent Attention(MLA)搭載、78 layers
GLM-5.2:IndexShare機構(1M contextで2.9x FLOP削減)
強み:人間評価トップクラス、多言語(中国語・英語優位)、ツール活用
用途:カスタマーサポート、チャットボット、マルチモーダルアプリ
Qwen3.5シリーズ(Alibaba)
Qwen3.5 は0.8Bから397Bまで広範なパラメータ規模でリリース。用途に応じて最適なサイズを選べる、最大の特徴。LLMPM Rankingsでは122B-A10B版が72.3%・27B版が71.4%。比較的小規模でも高性能を維持している。
Apache 2.0ライセンスなので商用利用は自由にできる。中国語・英語・日本語を含む多言語対応に優れる。推論(Thinking)モードと非推論モードの両方をサポート。複雑なタスクではChain-of-Thoughtを発動する。
ライセンス:Apache 2.0
展開サイズ(モデルごとアーキテクチャが異なる):
Denseモデル(小~中規模):0.8B / 3B / 7B / 14B / 32B / 72B
MoEモデル(大規模):122B-A10B / 235B-A22B(Thinking)/ 397B-A17B(Thinking)
小規模モデルほどDense、大規模モデルほどMoEという設計思想
強み:マルチサイズ展開、多言語対応、推論モード付き、商用利用自由
用途:エッジデバイスからクラウドまで幅広く活用可能
DeepSeek V4シリーズ(DeepSeek)
DeepSeek V4 Pro はSWE Bench(実際のGitHub Issueをコードで解決するベンチマーク)で80.6%。オープンソースモデルNo.1。V4 Flash はFlash版としてコストを抑えたバリエーション。HLE 51.6%・BrowseComp 85.9%を記録している。
DeepSeekは一貫して「高性能 × コスト効率」を追求。V4シリーズはMoEアーキテクチャと高度なトレーニング手法でこれを体現している。MITライセンスでの公開により、企業のAI導入でも選択肢になり得る。
ライセンス:MIT
アーキテクチャ:両モデルともMoEベースのハイブリッド設計(Dense attention + MoE layers)
V4 Pro:1.6T(総)/ 49B(active per token)。CSA + HCAのハイブリッド・マルチプルAttention
V4 Flash:284B(総)/ 13B(active per token)
DeepSeekMoE(Hash Routing、Sqrt(Softplus) Gating)
mHC(Manifold-Constrained Hyper-Connections)、Muon Optimizer搭載
FP4 Quantization対応
強み:Agentic Coding分野No.1、コストパフォーマンス最高峰、コード生成・デバッグに特化
用途:開発支援エージェント、コードリファクタリング、Bug Fix自動化
MiniMax M3(MiniMax)
GPQA Diamondで93.0%(Kimi K3に次ぐ2位)、SWE Benchでも80.5%(DeepSeek V4 Proに肉薄)。推論とコーディングの両方で上位に入る、珍しいモデル。中国のAI企業MiniMaxが開発し、比較的新しい参入ながら即座にトップクラスの性能を達成した。
科学・数学分野での推論能力が高く、研究支援や教育用途での注目度が高まっている。
ライセンス:公開状況要確認
アーキテクチャ:MoE + Sparse Attentionのハイブリッド
総パラメータ:~428B / 活性化:~23B per token
128 routed experts、top-4 active + shared expert 1
MiniMax Sparse Attention(MSA)搭載、1M context対応
Multi-Token Prediction(MTP)による推論速度向上
強み:GPQA Diamond 2位、SWE Bench 2位と二冠候補、バランス型
用途:学術研究、高度な質問応答、コード生成
Gemma-4-31B(Google)
Gemma 4 シリーズの31B版は、Chatbot ArenaでElo 1451を獲得。中規模モデル(~32Bクラス)の最高峰。Apache 2.0ライセンスで商用利用は自由にできる。Google独自のトレーニングデータと手法。「小さいけど驚異的」な性能を実現した。
リソースが限られた環境でも高性能なモデルが必要な場合、有力な選択肢になる。Gemma 4シリーズには他にも**26B A4B(MoE版)**があり、こちらはtotal ~25.2B / active 3.8B per tokenで、推論速度を優先するAgenticワークフローに特化している。
ライセンス:Apache 2.0
アーキテクチャ:
Gemma 4 31B(Dense):~30.7B total / 60 layers / BF16推論時に~64GB VRAM必要。単一GPUでの動作が可能
Gemma 4 26B A4B(MoE):~25.2B total / 3.8B active per token / 128 experts + shared expert 1 / top-8 active
Hybric Attention(sliding window + global attention 6:1)、Multi-Token Prediction(MTP)搭載
強み:スモールサイズながら高性能、Google製としての信頼性
用途:オンプレミス導入、リソース制約のある環境での本格利用
Mimo V2.5-Pro(Xiaomi)
Mimo V2.5-Pro は中国のスマートフォンメーカーXiaomiが開発したモデル。Chatbot Arena Elo 1468、オープンウェイトNo.2の座に就いている。スマートフォン・IoTデバイス向けの最適化にも注力。「エッジでの高性能AI」の実現者。
MITライセンスで公開されており、スマホ端末でのローカル推論との親和性が高い。
ライセンス:MIT
アーキテクチャ:MoE + Sliding Window Attentionのハイブリッド
総パラメータ:1.02T(~1,023B)/ 活性化:42B per token
70 layers(1 dense layer + 69 MoE layers)
384 routed experts、top-8 active
Hybrid Attention(Global 10 layers / Sliding Window 60 layers、6:1 ratio)
Multi-Token Prediction(MTP)、27T tokensでpre-training済み
FP8(E4M3)Mixed precision対応、1M context
強み:スマートフォン最適化、チャット品質の高さ、エッジ推論対応
用途:モバイルデバイス内蔵AI、スマートスピーカー、IoTアシスタント
モデルのアーキテクチャ比較(MoE vs Dense)
上位モデルのうち、どのモデルがMoEを採用し、どれがDenseか。
MoE採用モデル
Kimi K3(Moonshot):2.8T total / 104B active
GLM 5.x全系列(Z.ai):744B total / 40B active
GLM 5 / 5.1 / 5.2が全てMoEベース
DeepSeek V4 Pro / Flash(DeepSeek):1.6T / 284B、両方MoE
Qwen3.5大~中規模モデル(Alibaba):122B-A10B / 235B-A22B / 397B-A17B、MoE
MiniMax M3(MiniMax):428B total / 23B active
Mimo V2.5-Pro(Xiaomi):1.02T total / 42B active
Gemma 4 26B A4B(Google):~25.2B total / 3.8B active(MoE版)
Dense採用モデル
Gemma 4 31B(Google):~30.7B totalのフラッグシップDenseモデル。単一GPUで推論可能
Qwen3.5小規模モデル(Alibaba):0.8B / 3B / 7B / 14B / 32B / 72B、全てDense
Qwen3.5はサイズによってアーキテクチャを使い分ける
まとめ:2025年8月のOpen LLMトレンド
Kimi K / GLMの躍進:中国・ByteDance系・Zai系のモデルが総合ベンチで覇権を握る
MoEアーキテクチャの標準化:高性能 × コスト効率を求めるならMoEがデファクトに
マルチサイズ展開:Qwen3.5のように0.8B~397Bまで揃える流れに。小規模=Dense、大規模=MoEという設計思想も定着
Agentic Coding競争激化:SWE Benchスコアが実務価値の指標に
ライセンスの緩やかさ:MIT / Apache 2.0で商用利用自由なモデルが増加
注目すべきは、Kimi K3 がHLE 56%と閉じたLLMと肩を並べること。そして GLM 5.2-max が人間評価(Chatbot Arena)でNo.1という点。どちらもMITライセンスで商用利用可能。
