2026年8月版

Inworldとは?2026年版|機能・料金・注意点

Inworldはリアルタイム音声とエージェント基盤を提供します。2026年5月のResearch PreviewであるRealtime TTS-2は、複数ターン音声文脈、自然言語によるVoice Direction、広い多言語対応を追加しました。

公式サイトを開く
2026年8月11日に事実確認

現行製品・バージョン: Realtime TTS-2 research preview, May 2026

順位は意思決定の参考情報です。現時点の能力、製品の成熟度、利用しやすさ、用途への適合性、情報の透明性を評価し、スポンサーの有無では決めません。

おすすめ用途

低遅延で表現力のある音声、ゲーム会話、多言語体験を作る開発者。

編集部の評価

2026年で注目すべきVoice Stackですが、3D Mesh生成が主価値ではないためこの分類では10位です。

重要な注意点

TTS-2はPreviewです。Voice Cloneには権利と同意が必要で、100超言語が同品質とは限りません。

このレビューの調査方法

本記事は公開情報に基づく調査レビューであり、非公開の実験室テストを行ったという意味ではありません。公式の製品ページ、ドキュメント、リリースノート、料金・プラン情報を確認し、用途への適合性、成熟度、利用しやすさ、制御性、導入リスクを評価しました。

優れている点

  • 文脈と指示に反応する音声。
  • 多数言語で同一Voice Identity。
  • Realtime API/SDK。
  • STT、Routing、TTSを統合。

制約とリスク

  • Previewで変更可能性。
  • 利用増で費用増。
  • Network品質に依存。
  • Character Logic/Animationは別。

料金と利用方法

USD建てCreditと従量価格、Enterpriseがあります。音声時間、同時数、Routing、Retryをモデル化します。

向いている利用者

音声、遅延、多言語がボトルネックなら有力。固有名、数字、感情、割り込み、各対象言語を試します。

比較したい代替候補

Convai、ElevenLabs、Cartesia、OpenAI Realtime、自社Stack。

よくある質問

Realtime TTS-2とは?

複数ターン音声文脈と自然言語の話し方指示を使うResearch Previewモデルです。

3Dキャラクターを生成しますか?

現在の中心は音声・Agent基盤です。Avatar、Rig、Animationは別途必要です。

最終評価

2026年で注目すべきVoice Stackですが、3D Mesh生成が主価値ではないためこの分類では10位です。

公式サイトを開く