録音を外部に出さずに文字起こしするには、公開されている音声認識のモデル(Whisper)を手元のパソコンで動かします。Apple シリコンの Mac なら音声の長さの 4 分の 1 ほどの時間で起こせます。固有名詞と話者は機械では崩れるので、聞きながら直す時間を 60 分あたり 2〜3 時間見ておきます。
録音を外部のサービスに上げたくないのは、どんなときですか
・社内会議や面接、取材の録音に、人の名前や取引先の話が入っている
・相手に「録音は外に出しません」と約束している
・文字起こしのサービスは便利だが、どこに保存され、いつ消えるのかが契約書を読まないと分からない
手元のパソコンだけで書き起こすには、何を使いますか
公開されている音声認識のモデル(Whisper)を、手元のパソコンで動かします。音声はパソコンから出ません。Apple シリコンの Mac なら、mlx-whisper という道具で、音声の長さの 4 分の 1 ほどの時間で書き起こせます。60 分の録音なら 15 分前後です。Windows でも同じモデルを動かす道具があり、速さは機械の性能で変わります。
1. 録音を 16 kHz のモノラルの音声に変換します(ffmpeg という無料の道具で 1 行)
2. モデルは「large-v3-turbo」を選びます。日本語の精度と速さの釣り合いがよく、初回だけモデルの取得(1.6 GB ほど)があります
3. 出力は、開始と終了の時刻がついた区間の並びです。これを Excel や Word に流し込みます
精度の癖は、固有名詞が崩れることです。会社名や商品名、人名は聞いて直す前提にします。数字と敬体の文は安定しています。
納品までの段取りは、どう組みますか
1. 機械で起こす: 時刻つきの区間を Excel(開始・終了・話者・本文・備考の 5 列)と SRT に出します。話者の列は空欄にしておきます
2. 聞きながら直す: 固有名詞、言い直し、相づちを直し、話者の列を埋めます。60 分の対談で 2〜3 時間。ここが仕上がりを決めます
3. 指定の書式へ: 依頼主の書式(Word の段落、1 分ごとの時刻、発言者の見出しなど)に合わせて整えます。SRT は字幕にそのまま使えます
「ケバ取り」(えー、あの、を消す)や「整文」(話し言葉を書き言葉に直す)をどこまでやるかは、始める前に決めます。取材記事の素材なら整文まで、議事録なら発言のまま、が多いです。
自分でやるか、頼むか
Mac なら mlx-whisper、Windows なら whisper.cpp や faster-whisper で、初回の準備は 30 分ほどです。聞きながら直す時間が取れないとき、録音を外に出せないまま人に頼みたいときは、手元のパソコンで起こして、時刻つきの Excel と Word、字幕用の SRT でお納めします。
ココナラの出品「録音を外部に出さず文字起こしします」もご覧ください。