Qwen3.8 27B評価結果(推論ONのみ)
早速リリースされたので評価してみました。今回はLMstudioのモデル一覧にすでにあったのでローカルで実行してみました。
結果はこんな感じです。
スコアとしては意外とMidがいまいちで逆にLowが検討していますね。あとはちゃんと時間を比較した方がいいですがX-highとLowでも処理時間がほとんど変わりませんでした。
ちょっと気になったのは以下の3項目です。
1.推論部分が表示されないー>これはLMstudio側の問題かと思うのですが
2.推論オンでも出力開始が早いー>従来は推論プロセスが終わってから回答分出力なのですが1、2秒後には回答出力が始まっているようです
3.推論レベルが3段階ー>これに加えて推論オフもできるのでちゃんとやろうとすると4段階になるので評価する時の回数が増えてしまいます。多分ここら辺はまだ試行錯誤状態でユーザに委任しているような感じですね。ちょうどクルマでいうマニュアルミッションという感じかなと。この先には自動的に適した推論レベルで実行してくれるようになるのでしょうかね?
あとは時間ができたときに推論OFFおよび各モードでの処理時間比較を行えればと思っています。
