「評価は一回やれば終わり」は危ない?品質評価エンジニアが教えるAI評価の中身

「評価は一回やれば終わり」は危ない?品質評価エンジニアが教えるAI評価の中身

記事
IT・テクノロジー

はじめに

AIシステムの品質評価を本業にしているエンジニアです。

前回の記事では、AIの品質を確かめる際の入口について記載しました。
同じ質問を何度か聞く、作った人以外に試してもらう、といった今日からできる方法も紹介しました。

今回は、私が本業で実際にやっている「評価」の全体像をお話しします。
前回よりも専門用語が増えますが、用語には図で例を添えますので、雰囲気を掴んでいただければ幸いです。

1. 評価は「回し続ける」もの

AIの評価は、一度テストして終わりではありません。
いくつもの工程をぐるぐると回し続ける作業です。
図1 評価のサイクル@1x.png

公開したあともサイクルは止まらず、継続的に確認していく中で見つかった問題が、次の観点に繋がっていきます。

前回「物差し」と呼んでいたものは、専門的には「評価指標(メトリクス)」と呼びます。
正確さ、根拠があるか、言ってはいけないことを言わないか、といった観点ごとに、どう点数をつけるかを決めて測ります。

2. 評価を支える4つのキーワード

評価の現場で、毎日のように飛び交う言葉を4つ紹介します。

評価データセット

評価の土台になるのが「評価データセット」です。
AIに投げる質問と、「こう答えてほしい」という期待する答えを組にしたものです。
図2 評価データセット@1x.png

よくある質問だけでなく、聞き方を変えたもの、答えてはいけないもの、資料に答えがないものなど、意図的に幅を持たせて作ります。
数十件から、多いときは数百件以上になります。

LLM-as-a-Judge

数百件の答えを、人がすべて読んで採点するのは大変です。
そこで、AIの答えを別のAIに採点させる方法がよく使われます。
これを「LLM-as-a-Judge(AIを審査員にする方法)」と呼びます。
図3 LLM-as-a-Judge@1x.png
大量の答えを同じ基準で素早く採点できるのが強みです。
ただし、審査員のAIも間違えることがあります。
これは3章でお話しします。

RAG(検索拡張生成)

社内チャットボットの多くは、「RAG(検索拡張生成)」という仕組みで動いています。
質問を受けると、まず社内資料の中から関係のありそうな部分を探し、その内容をもとに答えを作る仕組みです。
図4 RAGの2か所の失敗@1x.png

RAGでは、「探し間違い」と「答え間違い」の2か所で失敗が起こります。
答えが間違っていたとき、どちらで失敗したのかを切り分けないと、正しく直せません。

レッドチーミングとプロンプトインジェクション

「レッドチーミング」は、わざと攻撃する側に回って、AIの弱いところを探す確かめ方です。
代表的な攻撃が「プロンプトインジェクション」で、質問の中に命令をまぎれこませて、AIに決められたルールを破らせようとするものです。
図5 プロンプトインジェクション@1x.png

攻撃の手口は日々増えているので、一度確かめて終わりにはできません。

3. 評価そのものにも懸念点がある

上記の4点を使えば、AIをしっかり評価できそうに見えます。
ところが、評価という作業そのものにも懸念点があります。
図6 評価の懸念点@1x.png

採点するAIも間違える
LLM-as-a-Judgeの審査員AIにも、得意不得意や好みがあります。
長い答えを高く採点しがち、自分と似た書き方を好む、といった偏りが知られています。

対策方法は、審査員AIの採点を人の採点と突き合わせて、ズレがないかを定期的に確かめることです。
つまり、評価する側も評価する必要があります。

点数が回すたびにブレる

AIの答えは毎回変わるので、同じ評価データセットで測っても、点数が少しずつ変わります。
一度の点数だけを見て「良くなった」「悪くなった」と判断すると、ただのブレを見間違えることがあります。

対策方法は、何回か回して、点数の幅を見た上で判断することです。

評価データセットが古くなる

社内の制度や資料が変われば、「期待する答え」も変わります。
古いままのデータセットで測ると、正しく答えているAIを間違いと判定してしまいます。

対策方法は、資料が更新されるたびに、データセットも見直すことです。

公開後に使われ方が変わる

公開してしばらくすると、利用者の聞き方や、よく聞かれる話題が変わっていきます。
機械学習では、運用中に入力データの傾向や分布が変わることを「データドリフト」と呼びます。

もともとは学習時のデータと本番データのずれを表す言葉ですが、
生成AIの評価でも、本番の利用傾向が変わることで、
「固定した評価データセットが実際の利用状況を十分に代表できなくなる」という同様の問題が起こります。

対策方法は、公開後の実際の質問を観測し、評価データセットに取り込んでいくことです。

4. 今日からできる3つのチェック

全部をやるのは大変そうに感じたかもしれません。
それでも、次の3つから始めるだけで、確かめ方の質はぐっと上がります。
図7 今日からできるチェック@1x.png

まずは小さく、期待する答えを書くところから始めてみてください。

5. まとめ

AIの評価は、評価データセットを作り、採点し、結果を読み解き、直して、また測る、というサイクルを回し続ける作業です。
しかも、採点するAIのズレや点数のブレ、データの古さ、使われ方の変化といった、評価そのものの懸念点とも付き合い続ける必要があります。

評価は一度きりの作業ではなく、回し続ける仕組みです。

ご案内

次回は、公開したあとのAIを見守り続ける「継続的モニタリング」についてお話しします。

ココナラでは、AIの回答品質を確かめるサービスを出品しています。
評価データセットづくりから採点、結果のご報告までお受けしています。

また、AIを使ったツールやチャットボットの開発もお受けしています。
当方のAI開発では、この記事でご紹介したような評価を基本料金に含めてお渡ししています。






サービス数40万件のスキルマーケット、あなたにぴったりのサービスを探す