出来ないではなく、出来る方法を模索する(AIによる文字起こし)

出来ないではなく、出来る方法を模索する(AIによる文字起こし)

記事
IT・テクノロジー
# AIに長時間音声を文字起こしさせたら、全部読めていなかった

先日、約18分の音声データをAIに文字起こしさせました。

最初は普通に処理できたように見えました。

「文字起こし完了」

それらしい文章も出てきます。

ところが元の音声と照らしてみると、どうもおかしい。

後半で話していた内容がかなり抜けていました。

つまりAIは、

**「全部処理したように見えて、実際には途中までしか拾えていなかった」*

という状態でした。

## 長い音声を、そのまま渡すのをやめた


そこで方法を変えました。

音声を数分ごとに分割して、ひとつずつAIに渡します。

すると、最初の文字起こしでは抜けていた部分まで拾えるようになりました。

同じ音声、同じAIでも、
**一度に処理させる量を変えるだけで結果が大きく変わった**わけです。

## AIは「全部できました」と言うことがある

今回、一番気になったのはここです。

AIは、「途中までしか処理できませんでした」
とは言いませんでした。

普通に、「文字起こししました」
と返してきます。

使う側が元の内容を把握していなければ、そのまま正しい結果だと思ってしまう可能性があります。

だから、AIの出力は、

**出てきたから正しい**ではなく、

**本当に全部処理できているか確認する**
必要があります。

## 分割すると安定した


今回の実験では、数分単位に分割することで、かなり安定しました。

さらに分割位置で会話が途切れる可能性もあるので、境界部分を少し重ねる方法も有効です。

長時間音声を一気に処理させるより、

**短く分ける
境界を少し重ねる
毎回同じ指示を入れる**

この方が結果を確認しやすくなります。

## AIは、使い方で結果が変わる


今回の文字起こしで改めて感じたのは、AIは単純に
「できる・できない」
だけで見るものではないということです。

同じAIでも、

・入力の長さ
・指示の出し方
・分割方法
・確認方法

で結果が変わります。

AIを使うというより、

**AIが正しく動ける条件を作る**
ことが大切なのだと思います。

失敗したから終わりではなく、

**どこで抜けたのかを確認し、方法を変える。**
今回の文字起こしは、その分かりやすい実例になりました。

サービス数40万件のスキルマーケット、あなたにぴったりのサービスを探す