Deepseek久しぶりの評価結果(V4 Falsh 0731)
ハギングフェイスの人気モデルリストで上の方にあったので評価してみました。ただしパラメータサイズの小さいFlashの0731版のみです。
結果としては推論レベルがLowは朝やった時には回答に中国語が含まれるなど不安定でしたがその後やり直したらまあまあかなと。
ただしどうせならHighが一番いい感じでMaxだと逆に推論しすぎで出力が不安定かもしれません。LLMArenaで連続して質問していたら最後の問題の回答は1問の質問でなく5問の問題の回答が出てきました。
まあDeepseekのモデルとしては日本語の質問でも結構ちゃんと回答できるようになっては来ましたが今はQwenがあるとこのパラメータサイズだとあまりメリットはないかもしれませんね。
