Alibaba、会話と環境音をまとめて生成する音声モデルを発表

記事
IT・テクノロジー
Alibaba Cloudは2026年9月22日、AI戦略に関する発表の一環として、音声生成モデル「Qwen-Audio-3.1-TTS-Next」を案内した。テキストの台本から、セリフ(会話)と環境音・効果音を組み合わせた音響表現を一度に生成できるモデルとして紹介されている。

公式発表によると、同モデルはオーディオブック、映画・テレビ番組、ポッドキャスト、ゲームといったプロ向けの制作用途を想定して設計されているという。「映画のような音響表現をまとめて作り出せる」という趣旨の説明がなされているが、これはAlibaba側の訴求表現であり、独立した第三者機関による品質評価ではない点には留意したい。

今回、発表元のプレスリリースとは別に、Alibaba Cloudが公開している開発者向けのモデル資料(Model Studioのドキュメント)も確認した。同資料は、Qwen-Audio-3.1-TTS-Nextの推論サービスとHTTPS APIによる利用方法を案内しており、複数話者による対話(マルチスピーカー)にも対応しているという。生成できる音声の長さには上限があり、ポッドキャスト用途では最大240秒(4分)、それ以外の用途では最大120秒とされ、入力できるテキストは最大3,000文字までとされている。対応言語としては中国語と英語が明記されており、今回確認した資料の範囲では日本語対応についての記載は見当たらなかった。料金は、中国(北京)リージョンにおいて100万トークンあたり入力0.848ドル・出力1.696ドルと案内されているが、この料金・提供地域の情報は中国リージョンについてのものであり、他地域での提供状況や商用利用条件は今回確認できていない。

なお、今回の発表はAlibabaの音声・画像関連モデル群をまとめて紹介するものの一部であり、通常版のTTSモデルや音声認識(ASR)、リアルタイム対話モデル、同時通訳モデル「LiveTranslate」、スマートフォン向けAIエージェント基盤「Qwen Intelligence」なども同時に言及されている。これらは今回のQwen-Audio-3.1-TTS-Nextとは別のモデル・サービスであり、本稿ではTTS-Nextに絞って扱った。

【出典】
Alibaba CloudのフルスタックAI戦略に関する公式発表(2026年9月22日)、Model Studio公式ドキュメント「Qwen-Audio-3.1-TTS-Next」。
サービス数40万件のスキルマーケット、あなたにぴったりのサービスを探す