高精度な音声認識AI(large-v3)をGPUで動かし、動画・音声をタイムスタンプ付きテキストに変換します。55分の音声を12分で処理できる速度を確認済みで、24時間以内の納品に対応します。
【標準料金でカバーする範囲】
5,000円は、音声30分程度(文字数目安6,000字程度)までを想定した価格です。これを超える場合は、超過分について文字単価による追加料金をいただきます。音声の長さが分かる場合は、ご注文前にお知らせいただければ概算をお伝えします。
【納品物】
標準:タイムスタンプ付きテキスト(.txt/.md)
オプション:整文版(読みやすく整えた文章)/要約(見出し付き)/字幕ファイル(SRT/VTT)
【精度を上げるために】
固有名詞・専門用語・人名は誤認識が起きやすいため、可能であれば用語集をご共有ください。この一手間で仕上がりの精度が大きく変わります。
【対応が難しいケース】
雑音が多い音源、複数人の発言が頻繁に重なる音源は精度が落ちる場合があります。ご不安な場合は短いサンプル音声でお試しいただけます。
【ご発注の流れ】
①見積り・サンプルのご相談→②音声・動画ファイルのお預かり→③(任意)用語集のご共有→④文字起こし・照合→⑤納品
ご購入後、以下をお知らせください。
①音声・動画ファイル(音声のみでも可)
②音声の長さ(分単位)※標準料金は30分程度までを想定しています。超える場合は文字単価による追加料金をご案内します
③希望納期(未指定の場合は標準納期で対応します)
④用語集(固有名詞・専門用語・人名など。あるほど精度が上がります)
⑤オプション(整文版・要約・字幕・追加時間・デザイン化)のご希望があればその旨
ファイルはトークルームに添付、または大容量の場合はギガファイル便等のリンクをお送りください。