HuggingFace に上がっていた判断専用モデル「lev」を検証しました。Qwen3.5-4B に LoRA を当てたもので、文章を1トークンも生成せず選択肢のロジットから答えを読みます。当社が自前で動かしているサービスと同じ設計で、ベースまで同じなので、アダプタ170MBを足すだけで載せ替えられる位置にありました。
自社の実運用と同じ設問10問(日本語7・英語3)で比べた結果は9対9の同点。「English only」と明記されていますが日本語6問は正解で、ただし当社の現行が外す問題を lev も同じように外しました。
明確に上だったのは確信度の質です。当社のものは正解に 1.000 を付けますが、これは較正されていない最大値です。lev は温度を当ててあり、外した問題で 0.462 と低く出ました。
採用しなかった決め手はライセンスでした。名指しされた訓練元18件を当たると、4件が CC-BY-NC、RACE は「派生データも商用不可」と原文に明記。18件中8件が商用の可否をはっきりさせられません。精度の利得がゼロなら、この不確かさを抱える理由がありません。
この記事は要約版です。続きは元記事でどうぞ: