はじめに
AIシステムの品質評価を本業にしているエンジニアです。
前回の発展編では、AI評価の中身として、工程の多さと評価そのものの懸念点を紹介しました。
その中で「公開後も見守る」「データドリフト」という言葉に少しだけ触れました。
今回はその答え合わせです。
公開前にどれだけしっかり評価しても、AIの答えの質は公開した日から少しずつ変わっていきます。
変わっていくものを見守り続ける取り組みを、継続的モニタリングと呼びます。
公開前の評価と、公開後のモニタリング
まずは公開前の評価と、公開後のモニタリングを比べてみます。
公開前の評価は「その時点で大丈夫か」を確かめるもの、モニタリングは「今も大丈夫か」を確かめ続けるものです。
では、AI本体を何も触っていないのに、なぜ答えの質が変わるのでしょうか。
社内規程に答えるチャットボットのように、資料を検索して答えるAI(RAG)の場合、答えの質はAI本体だけでは決まりません。
AI本体に手を入れていなくても、この4つのどれかが変われば答えの質は変わります。
そこでモニタリングは、次のサイクルで回します。
公開時点の数値を基準値(ベースライン)として残し、そこからの変化を追いかけるのが基本の考え方です。
モニタリングでわかること・わからないこと
ここで大事なのは、記録を眺めるだけでは「答えが正しいか」まではわからないことです。
本番の質問には正解が付いていないからです。
そのため、本番のやりとりから一部を抜き出して評価する、サンプリング評価を組み合わせます。
採点には、前回紹介したLLM-as-a-Judgeや人の目を使います。
モニタリングは評価の代わりではなく、「いつ、どこを評価し直すべきか」を教えてくれる仕組みです。
公開後のAIに起こる懸念点
公開後のAIに起こりやすい懸念点は、次の5つです。
1つずつ見ていきましょう。
ナレッジの鮮度切れ
規程や料金、手順が変わったのに、AIが参照する資料が古いままになることです。
対策方法は、制度や資料の改定と、AIのナレッジ更新を同じ手順の中に入れておくことです。
データドリフトとコンセプトドリフト
データドリフトはもともと、機械学習で、学習に使ったデータと運用中に入ってくるデータの傾向がずれていくことを指す言葉です。
同じことがAIチャットでも起こります。
公開前の評価データセットになかった種類の質問が、だんだん増えていくのです。
もう一つ、コンセプトドリフトという言葉もあります。
こちらは、入力と正解の関係そのものが変わることです。
同じ質問なのに、正しい答えが変わってしまう状態です。
対策方法は、質問のトピックの割合をベースラインと比べて変化に気づけるようにすることと、本番で増えた質問を評価データセットに足していくことです。
モデルの更新
AIの提供元が裏側のモデルを更新・終了すると、同じ質問への答え方が変わることがあります。
対策方法は、使うモデルのバージョンを固定し、切り替える前に回帰評価を通すことです。
静かな劣化
答えの質が少しずつ落ちていても、利用者は苦情を言わずに使うのをやめるだけ、ということがよくあります。
数字の上では何も起きていないように見えるのが厄介です。
対策方法は、苦情を待たずに、定期的なサンプリング評価で質を確かめることです。
アラート疲れ
通知を出しすぎると、そのうち誰も見なくなります。
本当に大事な変化が来たときに見逃されてしまいます。
対策方法は、閾値を絞り込み、通知が来たら誰が何をするかまで決めておくことです。
5つのうち、いちばん出会いやすいのがナレッジの鮮度切れです。
制度や料金は、AIの都合とは関係なく、業務の都合で変わるからです。
AIの担当者が知らないところで変わることも珍しくありません。
制度が変わった直後は、その制度についての質問がいちばん集中するタイミングです。
つまり、AIが間違えたときの影響がいちばん大きいタイミングでもあります。
ただし、「在宅勤務についての質問が急に増えた」ということ自体は、モニタリングで見える変化です。
この変化に気づければ、間違った案内が広がる前に資料を直すことができます。
これがコンセプトドリフトを、ナレッジの鮮度切れの段階で止めるということです。
今日からできるチェック
専用の仕組みがなくても、今日から始められることがあります。
公開前に決めた質問は、そのまま自分たちのベースラインになります。
まとめ
公開前の評価はその時点の健康診断で、公開後の品質は、質問・ナレッジ・モデル・設定の変化によって動いていきます。
モニタリングでわかるのは変化の兆しで、答えが正しいかどうかは評価と組み合わせて確かめます。
公開後のAIには、ナレッジの鮮度切れ、ドリフト、モデルの更新、静かな劣化、アラート疲れという5つの懸念点があり、どれにも対策方法があります。
いちばん出会いやすいのはナレッジの鮮度切れで、制度が変わった直後こそ見守りの価値がいちばん出る場面です。
そして、質問を10個決めておくだけでも、見守りの第一歩になります。
AIは、公開してからが本番です。
ご案内
公開後の見守りを社内で回せるようにしたい方は、見守り体制づくりの相談の詳細はこちら
公開中のAIが今も期待どおりに答えているか、第三者の目で確かめたい方は、AI品質チェックの出品をご覧ください。
AI品質チェックの詳細はこちら
これからAIを作りたい方には、AI開発の出品もご用意しています。
当方のAI開発では、評価を基本料金に含めてお渡ししています。
AI開発の詳細はこちら