ゴールデンデータセットって何?
AIの良し悪しを測るには「模範解答」が要ります。ゴールデンデータセットは、人が丁寧にラベル付けし、「これが正解」と合意された高品質なテストサンプルの集まり。試験の「解答例」のように、モデルを採点し、本当の実力を見るためのものです。なぜ「ゴールデン」なのか
ラベルの質が高い1件1件、人が何度も確認しています。適当に集めたデータではなく、「模範解答」レベルのもの。
唯一の審判
データチームでは、ゴールデンセットが評価の基準です。新しいモデルを出す前にゴールデンセットを走らせ、スコアが上がったか下がったかを見ます。
普通のテストセットとの違いは?
普通のテストセット:量は多いがノイズもあるプログラムや弱いラベルで作られることが多く、間違いも混じります。
ゴールデンセット:量は少ないが、どれも信頼できる
数百から数千件でも、1件1件が確かで、「正誤」の最終的なよりどころです。
どう使う?
リグレッションテストモデルやプロンプトを変えるたびに走らせ、「1つ直して10こ壊す」を防ぎます。
モデル選びとパラメータ調整
候補モデルがいくつもあるなら、ゴールデンセットのスコアを比べて、データに決めさせます。
まとめ:ゴールデンデータセットはAIの「模範解答集」。普段はこれで採点し、変更後はこれで下支えして、改悪を防ぎます。
コメント