Inworldとは?2026年版|機能・料金・注意点
Inworldはリアルタイム音声とエージェント基盤を提供します。2026年5月のResearch PreviewであるRealtime TTS-2は、複数ターン音声文脈、自然言語によるVoice Direction、広い多言語対応を追加しました。
公式サイトを開く現行製品・バージョン: Realtime TTS-2 research preview, May 2026
順位は意思決定の参考情報です。現時点の能力、製品の成熟度、利用しやすさ、用途への適合性、情報の透明性を評価し、スポンサーの有無では決めません。
低遅延で表現力のある音声、ゲーム会話、多言語体験を作る開発者。
2026年で注目すべきVoice Stackですが、3D Mesh生成が主価値ではないためこの分類では10位です。
TTS-2はPreviewです。Voice Cloneには権利と同意が必要で、100超言語が同品質とは限りません。
このレビューの調査方法
本記事は公開情報に基づく調査レビューであり、非公開の実験室テストを行ったという意味ではありません。公式の製品ページ、ドキュメント、リリースノート、料金・プラン情報を確認し、用途への適合性、成熟度、利用しやすさ、制御性、導入リスクを評価しました。
優れている点
- 文脈と指示に反応する音声。
- 多数言語で同一Voice Identity。
- Realtime API/SDK。
- STT、Routing、TTSを統合。
制約とリスク
- Previewで変更可能性。
- 利用増で費用増。
- Network品質に依存。
- Character Logic/Animationは別。
料金と利用方法
USD建てCreditと従量価格、Enterpriseがあります。音声時間、同時数、Routing、Retryをモデル化します。
向いている利用者
音声、遅延、多言語がボトルネックなら有力。固有名、数字、感情、割り込み、各対象言語を試します。
比較したい代替候補
Convai、ElevenLabs、Cartesia、OpenAI Realtime、自社Stack。
よくある質問
Realtime TTS-2とは?
複数ターン音声文脈と自然言語の話し方指示を使うResearch Previewモデルです。
3Dキャラクターを生成しますか?
現在の中心は音声・Agent基盤です。Avatar、Rig、Animationは別途必要です。
2026年で注目すべきVoice Stackですが、3D Mesh生成が主価値ではないためこの分類では10位です。