32Bクラスの性能評価

32Bクラスの観測データの分析性能を評価しているのですが結構時間がかかりそうです。

最初の15サンプルだとGemmaとQwenではGemmaの方がいいという結果だったのでN数を増やして傾向が変わらなければ早めに切り上げられるかと思っていたのですが次の15サンプルでは正反対の結果になってしまいました。今度はGemmaの方が悪い傾向。

なので結局あと40から60サンプルくらい検証しないと傾向はつかめなさそうです。

本当は早めに切り上げてQwen3.8での評価に移行したかったのですが....

いいなと思ったら応援しよう!