ページ

2026年9月26日土曜日

ベンチマークではなく自社の10問で測る — ローカルAI判断モデルの検証記録

HuggingFace に上がっていた判断専用モデル「lev」を検証しました。Qwen3.5-4B に LoRA を当てたもので、文章を1トークンも生成せず選択肢のロジットから答えを読みます。当社が自前で動かしているサービスと同じ設計で、ベースまで同じなので、アダプタ170MBを足すだけで載せ替えられる位置にありました。

自社の実運用と同じ設問10問(日本語7・英語3)で比べた結果は9対9の同点。「English only」と明記されていますが日本語6問は正解で、ただし当社の現行が外す問題を lev も同じように外しました。

明確に上だったのは確信度の質です。当社のものは正解に 1.000 を付けますが、これは較正されていない最大値です。lev は温度を当ててあり、外した問題で 0.462 と低く出ました。

採用しなかった決め手はライセンスでした。名指しされた訓練元18件を当たると、4件が CC-BY-NC、RACE は「派生データも商用不可」と原文に明記。18件中8件が商用の可否をはっきりさせられません。精度の利得がゼロなら、この不確かさを抱える理由がありません。

この記事は要約版です。続きは元記事でどうぞ:

「英語専用」のAI判断モデルを日本語で測ったら同点だった|訓練データ18件を当たって採用をやめた話

Vitalik Buterinが描くEthereumの2030年ビジョンと、Qwen 27BによるローカルLLMの躍進 09-28

Vitalik Buterin氏は、Ethereumが単なるブロックチェーンの枠組みを超え、より広範なシステムへと進化する2030年に向けた壮大なビジョンを明らかにしました。この計画では、現在の技術的定義を塗り替えるような次世代のインフラへの変遷が詳しく詳述されています。 ユー...