オープンソースLLMのトップランナー(2025年8月版)

ランキング概要:3つのベンチマークで見るトップランナー

Vellum AI(Humanity's Last Exam / 総合)

  • 1位 Kimi K3(56.0%)

  • 2位 GLM 5.2-max(54.7%)

  • 3位 Kimi K2.6(54.0%)

  • 4位 DeepSeek V4 Flash(51.6%)

  • 5位 DeepSeek V4 Pro(48.2%)

LMArena Chatbot Arena(人間評価 Eloレート:オープンウェイト限定)

  • 1位 GLM 5.2-max(Z.ai)Elo 1471

  • 2位 Mimo V2.5-Pro(Xiaomi)Elo 1468

  • 3位 GLM 5.1(Z.ai)Elo 1467

  • 4位 Kimi K2.6-thinking(Moonshot)Elo 1461

  • 5位 Hy3 / GLM 5(Tencent / Z.ai)Elo 1457

LLMPM Rankings(BBH, GPQA, IFEval, MATH, MMLU-Pro の平均スコア)

  • 1位 Kimi K2.5(77.3%)

  • 2位 Kimi K2.6(74.7%)

  • 3位 Qwen3.5-122B-A10B(72.3%)

  • 4位 Qwen3.5-27B(71.4%)


上位モデルの詳細プロフィール

Kimi Kシリーズ(Moonshot AI / ByteDance系)

最新作 Kimi K3 の数値は圧巻。Humanity's Last Exam(HLE)56.0%・GPQA Diamond 93.5%・BrowseComp 91.2%。全ベンチでトップクラス。ByteDance傘下のMoonshot AIが開発した大規模推論モデル。複雑なマルチステップ推論、Web探索タスクにおいて、ClosedSourceのLLM(GPT-4、Claude Opus等)にも匹敵する性能を出している。

Kimi K2.6 はK3の直前のバージョン。HLE 54.0%・Chatbot Arena Elo 1461・SWE Bench 80.2%。バランスが取れている。Agentic Coding分野でも上位圏に位置し、実務利用にも十分耐え得る性能。

Kimi K2.5-thinking はElo 1450・総合Avgスコア77.3%でLLMPMランキング1位を獲得。推論(Reasoning)専門のバージョン。Chain-of-Thoughtを駆使した高度な推論タスクに特化している。

  • ライセンス:Modified MIT

  • アーキテクチャ:MoE(Stable LatentMoE)採用、コスト効率重視

    • 総パラメータ:2.8T(世界初3Tクラス・オープンウェイトモデル)

    • 活性化パラメータ:~104B / トークン

    • routed experts:896 per layer

    • 1 tokenあたり active:16 + shared experts 2

  • 強み:総合知能、科学推論、Web探索、マルチモーダル対応

  • 用途:研究開発、高度な推論が必要な業務、一般会話

GLMシリーズ(Z.ai / Zai Lab)—— Chatbot Arena王者

GLM 5.2-max はLMArena Chatbot ArenaでElo 1471。オープンウェイトモデル中No.1。Humanity's Last Examでは54.7%・GPQA Diamondでも91.2%。科学・医学・数学の難問に強い。Z.ai(旧Zai Lab)がMITライセンスで公開しており、商用利用も可能。

GLM 5.1、Hy3(Tencent × Z.ai協働)もElo 1457–1467圏で安定して上位に入っている。GLMシリーズは一貫して「人間との対話品質」の高さを売りにしている。マルチターン会話、ツール利用、ブラウザ操作などの実用的なタスクに優れる。

  • ライセンス:MIT / Apache 2.0(モデルによる)

  • アーキテクチャ:MoE + DeepSeek Sparse Attention(DSA)のハイブリッド。GLM 5.x全てがMoEベース

    • GLM 5 / 5.1 / 5.2:共通の744B(総)/ 40B(active)MoE

    • routed experts:256 per layer、top-8 active + shared expert 1

    • Multi-Latent Attention(MLA)搭載、78 layers

    • GLM-5.2:IndexShare機構(1M contextで2.9x FLOP削減)

  • 強み:人間評価トップクラス、多言語(中国語・英語優位)、ツール活用

  • 用途:カスタマーサポート、チャットボット、マルチモーダルアプリ

Qwen3.5シリーズ(Alibaba)

Qwen3.5 は0.8Bから397Bまで広範なパラメータ規模でリリース。用途に応じて最適なサイズを選べる、最大の特徴。LLMPM Rankingsでは122B-A10B版が72.3%・27B版が71.4%。比較的小規模でも高性能を維持している。

Apache 2.0ライセンスなので商用利用は自由にできる。中国語・英語・日本語を含む多言語対応に優れる。推論(Thinking)モードと非推論モードの両方をサポート。複雑なタスクではChain-of-Thoughtを発動する。

  • ライセンス:Apache 2.0

  • 展開サイズ(モデルごとアーキテクチャが異なる):

    • Denseモデル(小~中規模):0.8B / 3B / 7B / 14B / 32B / 72B

    • MoEモデル(大規模):122B-A10B / 235B-A22B(Thinking)/ 397B-A17B(Thinking)

    • 小規模モデルほどDense、大規模モデルほどMoEという設計思想

  • 強み:マルチサイズ展開、多言語対応、推論モード付き、商用利用自由

  • 用途:エッジデバイスからクラウドまで幅広く活用可能

DeepSeek V4シリーズ(DeepSeek)

DeepSeek V4 Pro はSWE Bench(実際のGitHub Issueをコードで解決するベンチマーク)で80.6%。オープンソースモデルNo.1。V4 Flash はFlash版としてコストを抑えたバリエーション。HLE 51.6%・BrowseComp 85.9%を記録している。

DeepSeekは一貫して「高性能 × コスト効率」を追求。V4シリーズはMoEアーキテクチャと高度なトレーニング手法でこれを体現している。MITライセンスでの公開により、企業のAI導入でも選択肢になり得る。

  • ライセンス:MIT

  • アーキテクチャ:両モデルともMoEベースのハイブリッド設計(Dense attention + MoE layers)

    • V4 Pro:1.6T(総)/ 49B(active per token)。CSA + HCAのハイブリッド・マルチプルAttention

    • V4 Flash:284B(総)/ 13B(active per token)

    • DeepSeekMoE(Hash Routing、Sqrt(Softplus) Gating)

    • mHC(Manifold-Constrained Hyper-Connections)、Muon Optimizer搭載

    • FP4 Quantization対応

  • 強み:Agentic Coding分野No.1、コストパフォーマンス最高峰、コード生成・デバッグに特化

  • 用途:開発支援エージェント、コードリファクタリング、Bug Fix自動化

MiniMax M3(MiniMax)

GPQA Diamondで93.0%(Kimi K3に次ぐ2位)、SWE Benchでも80.5%(DeepSeek V4 Proに肉薄)。推論とコーディングの両方で上位に入る、珍しいモデル。中国のAI企業MiniMaxが開発し、比較的新しい参入ながら即座にトップクラスの性能を達成した。

科学・数学分野での推論能力が高く、研究支援や教育用途での注目度が高まっている。

  • ライセンス:公開状況要確認

  • アーキテクチャ:MoE + Sparse Attentionのハイブリッド

    • 総パラメータ:~428B / 活性化:~23B per token

    • 128 routed experts、top-4 active + shared expert 1

    • MiniMax Sparse Attention(MSA)搭載、1M context対応

    • Multi-Token Prediction(MTP)による推論速度向上

  • 強み:GPQA Diamond 2位、SWE Bench 2位と二冠候補、バランス型

  • 用途:学術研究、高度な質問応答、コード生成

Gemma-4-31B(Google)

Gemma 4 シリーズの31B版は、Chatbot ArenaでElo 1451を獲得。中規模モデル(~32Bクラス)の最高峰。Apache 2.0ライセンスで商用利用は自由にできる。Google独自のトレーニングデータと手法。「小さいけど驚異的」な性能を実現した。

リソースが限られた環境でも高性能なモデルが必要な場合、有力な選択肢になる。Gemma 4シリーズには他にも**26B A4B(MoE版)**があり、こちらはtotal ~25.2B / active 3.8B per tokenで、推論速度を優先するAgenticワークフローに特化している。

  • ライセンス:Apache 2.0

  • アーキテクチャ

    • Gemma 4 31B(Dense):~30.7B total / 60 layers / BF16推論時に~64GB VRAM必要。単一GPUでの動作が可能

    • Gemma 4 26B A4B(MoE):~25.2B total / 3.8B active per token / 128 experts + shared expert 1 / top-8 active

    • Hybric Attention(sliding window + global attention 6:1)、Multi-Token Prediction(MTP)搭載

  • 強み:スモールサイズながら高性能、Google製としての信頼性

  • 用途:オンプレミス導入、リソース制約のある環境での本格利用

Mimo V2.5-Pro(Xiaomi)

Mimo V2.5-Pro は中国のスマートフォンメーカーXiaomiが開発したモデル。Chatbot Arena Elo 1468、オープンウェイトNo.2の座に就いている。スマートフォン・IoTデバイス向けの最適化にも注力。「エッジでの高性能AI」の実現者。

MITライセンスで公開されており、スマホ端末でのローカル推論との親和性が高い。

  • ライセンス:MIT

  • アーキテクチャ:MoE + Sliding Window Attentionのハイブリッド

    • 総パラメータ:1.02T(~1,023B)/ 活性化:42B per token

    • 70 layers(1 dense layer + 69 MoE layers)

    • 384 routed experts、top-8 active

    • Hybrid Attention(Global 10 layers / Sliding Window 60 layers、6:1 ratio)

    • Multi-Token Prediction(MTP)、27T tokensでpre-training済み

    • FP8(E4M3)Mixed precision対応、1M context

  • 強み:スマートフォン最適化、チャット品質の高さ、エッジ推論対応

  • 用途:モバイルデバイス内蔵AI、スマートスピーカー、IoTアシスタント


モデルのアーキテクチャ比較(MoE vs Dense)

上位モデルのうち、どのモデルがMoEを採用し、どれがDenseか。

MoE採用モデル

  • Kimi K3(Moonshot):2.8T total / 104B active

  • GLM 5.x全系列Z.ai):744B total / 40B active

    • GLM 5 / 5.1 / 5.2が全てMoEベース

  • DeepSeek V4 Pro / Flash(DeepSeek):1.6T / 284B、両方MoE

  • Qwen3.5大~中規模モデル(Alibaba):122B-A10B / 235B-A22B / 397B-A17B、MoE

  • MiniMax M3(MiniMax):428B total / 23B active

  • Mimo V2.5-Pro(Xiaomi):1.02T total / 42B active

  • Gemma 4 26B A4B(Google):~25.2B total / 3.8B active(MoE版)

Dense採用モデル

  • Gemma 4 31B(Google):~30.7B totalのフラッグシップDenseモデル。単一GPUで推論可能

  • Qwen3.5小規模モデル(Alibaba):0.8B / 3B / 7B / 14B / 32B / 72B、全てDense

    • Qwen3.5はサイズによってアーキテクチャを使い分ける


まとめ:2025年8月のOpen LLMトレンド

  • Kimi K / GLMの躍進:中国・ByteDance系・Zai系のモデルが総合ベンチで覇権を握る

  • MoEアーキテクチャの標準化:高性能 × コスト効率を求めるならMoEがデファクトに

  • マルチサイズ展開:Qwen3.5のように0.8B~397Bまで揃える流れに。小規模=Dense、大規模=MoEという設計思想も定着

  • Agentic Coding競争激化:SWE Benchスコアが実務価値の指標に

  • ライセンスの緩やかさ:MIT / Apache 2.0で商用利用自由なモデルが増加

注目すべきは、Kimi K3 がHLE 56%と閉じたLLMと肩を並べること。そして GLM 5.2-max が人間評価(Chatbot Arena)でNo.1という点。どちらもMITライセンスで商用利用可能。


References

いいなと思ったら応援しよう!