AIの成熟性と信頼性を測かれるか?

AIの成熟性と信頼性を測かれるか?

記事
IT・テクノロジー
AIの成長は会話回数と文字数で測れるのか?

以前、
「機械学習とプロンプト調整は全く違う!」というブログを書きました。

そこでは、AIそのものを学習させることと、会話や指示によってAIの振る舞いを調整していくことは別のものだ、という話をしました。

GAOSで考えている「AIを育てる」も、AIモデルそのものを毎回機械学習させるという意味ではありません。

役割、ルール、記憶、ユーザー情報、過去の修正内容などを積み重ねながら、その人に合ったAIとの関係を作っていく。
では、その先です。

育ててきたAIの成熟性や信頼性は、何らかの形で測ることができるのでしょうか。
今回は、その方法を考えてみます。「前より良くなった」を数字で見られないかです。

AIと長く会話していると、
・「以前より話が通じるようになった」
・「こちらの意図を理解するようになった」
・「同じ説明を繰り返さなくなった」
と感じることがあります。
しかし、これだけでは感覚的な評価です。

そこでまず、AIとのやり取りを数値として残す
・会話回数
・累計文字数
です。

これは、AIがどれだけ優秀なのかを直接示す数値ではありません。
そのAIと、どれだけの会話を積み重ねてきたのか
を見るための基礎データです。

■ハルシネーション指摘回数を記録する

次に記録するのが、ハルシネーション指摘回数
です。
本来、ハルシネーションという言葉は、AIが事実ではない情報を生成する現象などに使われます。

今回の運用では、評価を簡単に始めるため、少し広い意味で、
人がAIに対して「そこは違う」と修正した回数として記録します。

例えば、
・事実と異なる回答。
・文脈の読み違い。
・ユーザーが言っていない内容の補完。
・指示内容の取り違え。
こうしたものを、まずは一つの指摘回数として残します。

最初から細かく分類するのではなく、
実際の会話の中で明らかな間違いで、何回補正が必要
だったのか見るところから始めます。

最初に使う3つの指標、まず記録するのは、
・会話回数
・累計文字数
・ハルシネーション指摘回数
会話回数と文字数によって、

「どれだけAIと会話してきたのか」が分かります。
そこにハルシネーション指摘回数を加えることで、

「その会話の中で、どの程度人による補正が必要だったのか」
も見ることができます。

これによって、

「なんとなく以前より良くなった」という感覚だけではなく、
AIとの運用状況を一つの参考指標として残せるのではないかと考えています。

育っていくのはAIだけではありません。

人間側のAIの使い方も、同時に変わっていきます。

これは、前回書いた「プロンプト調整」の延長線上にあります。

GAOSでは、そこに役割、記憶、規約、ユーザー情報、継承情報などを組み合わせて管理していきます。

今回使う指標は、AIの優劣を自動的に決める点数ではありません。

・AIがどんな傾向を持っているのか。
・どのくらい人の補正を必要としているのか。
・人とのやり取りがどのように変化しているのか。

それを見るための参考情報です。

AIは、情報を整理できます。
違う視点を提示できます。
人が見落としている可能性を指摘することもできます。

GAOSでは、そうしたAIを、参謀として考えています。

参謀は、判断材料を出します。
しかし、最終決定をするのは参謀ではありません。
最終的に判断するのは、あなた自身です。

だからこそ、AIを無条件に信用するのではなく、必要以上に疑うのでもなく、
どのような特徴を持ったAIなのかを把握する。
そのための参考情報として、成熟性や信頼性を指標化してみよう、
というのが今回の試みです。

最後に


以前、機械学習とプロンプト調整は違うという話をしました。
今回は、その延長として、プロンプト調整や会話の積み重ねによって変化してきたAIを、どう評価するのか、を考えてみましたが、また、以下もかなり重要ですよね。

そして、人の聞き方も重要です。
主語なし、同義語が混ざり、突然別の話、などは誤認しやすい所です。
リターンを押す前にもう一度、内容確認してみてください。
サービス数40万件のスキルマーケット、あなたにぴったりのサービスを探す