オンデバイス音声合成ミドルウェア

アイリア AI Voice 数行のコードで、
あなたのアプリに声を。

クラウド不要。PyTorch などの重い依存関係も不要。
pip install だけで、10 秒のリファレンス音声から任意の声を再現できます。

  • 日本語 / 英語 / 中国語
  • Windows / macOS / Linux / iOS / Android
  • Python / C++ / Unity / Flutter / Kotlin
アイリア AI Voice のイラスト

WHY ailia AI Voice

アイリア AI Voice が選ばれる理由

クラウドAPI型のTTSとも、OSSをそのまま動かす方法とも違う、第三の選択肢です。

依存関係ゼロで、すぐ動く

PyTorch 不要・ONNX で動作するため、フレームワークの複雑な依存関係がありません。
Python なら pip install ailia_voice の 1 コマンド。 モデルファイルも自動ダウンロードされ、数行のコードで音声合成が完了します。

ゼロショットで、好きな声に

GPT-SoVITS を搭載し、約 10 秒のリファレンス音声を与えるだけで、 その声質・話し方での音声合成が可能。学習やファインチューニングは不要です。 ゲームキャラクターからナレーションまで、声を自在に切り替えられます。

独自の高速蒸留モデル

アイリアが独自に蒸留した高速モデルを提供。OSS の GPT-SoVITS v2-pro と比較して 1.8 倍高速な推論を実現し、GPU のないエッジデバイスや モバイルでもリアルタイムに近い応答が可能です。用途に応じて標準モデルと切り替えられます。

※ 当社測定による

DEMO

まずは、聞いてみてください

1 つの日本語リファレンス音声(約 10 秒)から、同じ声のまま日本語・英語・中国語を読み上げます。
学習・ファインチューニングは行っていません。すべてゼロショットでの合成結果です。

INPUT — リファレンス音声

つくよみちゃんコーパス(日本語・約10秒)

日本語のリファレンス音声 1 ファイルだけを入力として、下の 3 言語すべてを合成しています。

日本語

「こんにちは。今日はいい天気ですね。」

合成結果(GPT-SoVITS v2-pro)

English

"Hello. It's a beautiful day today."

合成結果(GPT-SoVITS v2-pro)

中文

「你好。今天天气真好。」

合成結果(GPT-SoVITS v2-pro)

蒸留モデルを聴き比べる

アイリア独自の蒸留モデルは、OSS の GPT-SoVITS v2-pro 比で 1.8 倍高速。 上と同じリファレンス音声・同じテキストでの合成結果を比較できます。

※ 当社測定による

標準モデル(GPT-SoVITS v2-pro)
アイリア蒸留モデル — 1.8倍高速

本デモの音声合成には、フリー素材キャラクター「つくよみちゃん」(© Rei Yumesaki)が無料公開している音声データを使用しています。
つくよみちゃんコーパス(CV.夢前黎)

USE CASES

ご利用シーン

音声合成AIは、さまざまなシーンで活用できます。

AIエージェントに声をプラス

LLM を使用したチャットボットに声をプラスして、喋る AI エージェントを作成できます。アイリア LLM・AI Speech と組み合わせれば完全オフラインの対話システムに。

通訳アプリでの読み上げ

翻訳後のテキストを、日本語・英語・中国語で自然に読み上げます。ネットワークのない現場でも動作します。

ゲーム・アニメの声のローカライズ

元の声質を保ったまま別言語の音声を合成。産業用機器の音声ガイダンスの多言語化にも使えます。

プレゼン動画に声を付与

プレゼン動画や V コンテなどのナレーションを、テキストから自動生成できます。

ゲーム内キャラクターの発話

Unity 対応なので、ゲーム内でキャラクターにリアルタイムに喋らせることが可能です。

CASE STUDY

採用実績

EXPO 2025 大阪・関西万博 パビリオン null²

アート・体験型パビリオン

EXPO 2025 大阪・関西万博「null²」(落合陽一氏)

来場者が自分の AI 分身「Mirrored Body®」と対話する体験型パビリオンに、 音声認識・音声合成・低遅延エッジAI・生成AIをアイリアで実装。 来場者数十万人規模のインタラクティブ体験を支えました。 関連アプリの利用者は 15 万人を超えています。

また、落合氏が演出を務める日本フィルハーモニー交響楽団の音楽会では、 アイリア AI Voice によるナレーション音声の制作にもご活用いただいています。

対談記事を読む →

MODELS

用途で選べる、複数の音声合成モデル

同じ API のまま、引数を変えるだけでモデルを切り替えられます。
プロトタイプは高品質モデルで、量産は蒸留モデルで、といった使い分けが可能です。

モデル 特長 速度 品質 おすすめ用途
Tacotron2 英語ベースライン 高速 標準 英語のみの軽量用途
GPT-SoVITS v1 最軽量のボイスクローン 高速 良好 省リソース環境
GPT-SoVITS v2 日本語アクセント・話速制御に対応 やや高速 良好 リアルタイム用途の標準
GPT-SoVITS v2-pro v3 のテキスト解析 + v2 の高速ボコーダ + 話者照合 やや高速 高品質 品質と速度のバランス重視(推奨)
GPT-SoVITS v3 ディフュージョンによる最高音質 中速 最高 ナレーション・コンテンツ制作
アイリア独自 蒸留モデル GPT-SoVITS v2-pro を独自に蒸留。OSSモデル比 1.8倍高速 最速 良好 モバイル・組み込みのリアルタイム応答

各モデルに日本語 / 英語 / 中国語版があります。出力は 32 kHz モノラルです。※ 当社測定による。

VS CLOUD TTS

クラウドTTS APIとの比較

クラウドTTSは手軽な一方、量産製品では「コストのスケール」と「挙動の安定性」が課題になります。
アイリア AI Voice はライセンス費用のみで、推論回数・ユーザー数による追加課金がありません。

アイリア AI Voice クラウドTTS API
APIコスト good推論回数・ユーザー数による課金なし。ライセンス費用のみで、利用が増えてもコストは一定 no文字数・リクエスト数による従量課金。ユーザー数に比例して費用が増加し、量産時に予算化が困難
挙動の安定性 goodモデルが自動更新されず挙動が一定。量産製品の検証・長期運用が容易 no提供側の都合でモデル更新・API仕様変更・サービス終了があり、出力が予告なく変わることがある
稼働の安定性 goodデバイス内で完結。通信障害・API障害の影響を受けず、サーバー監視も不要 noネットワーク断・API側の障害・レート制限で停止するリスクがある
レイテンシ good通信往復なし。蒸留モデルでエッジでも高速応答 △ネットワーク往復が必ず発生。回線品質に依存
データの秘匿性 goodテキスト・音声が外部に送信されない。機密情報・オフライン環境でも利用可能 △読み上げテキストを外部サーバーへ送信する必要がある
アプリへの同梱 goodゲーム・アプリのビルドに同梱し、エンドユーザーのデバイス上で実行。再配布権つきで製品出荷できる noクラウド接続が必須のため、オフライン製品や通信不可環境向けの組み込みには不向き
日本語の読み制御 goodユーザー辞書(pyopenjtalk形式)で固有名詞・専門用語の読みを確実に制御。日本語アクセントにも対応 △読み間違いをテキスト側の工夫で回避する必要があり、確実な制御手段が限られる場合が多い
ボイスクローン good10秒のリファレンス音声でゼロショット。追加費用なし △カスタムボイスは別料金・審査・学習期間が必要な場合が多い

※ クラウドTTS APIは一般的なクラウド型音声合成サービスの傾向を記載しています。

FEATURES

特徴と機能

本番運用を支える、充実した機能群。

クラウド不要

完全オフライン動作

エッジデバイスだけで動作。テキストがサーバーに送信されないため、機密情報も安全です。API 従量課金もありません。

多言語

日本語・英語・中国語に対応

日本語音素変換に OpenJTalk、中国語に g2pw + jieba を内蔵。G2P を含めライブラリだけで完結します。

カスタマイズ

ユーザー辞書に対応

pyopenjtalk 形式のユーザー辞書を読み込み可能。固有名詞や専門用語の読み方を正確に制御できます。

クロスプラットフォーム

デスクトップからモバイルまで

Windows / macOS / Linux / iOS / Android に対応。1 つの API で全プラットフォームに展開できます。

多言語バインディング

Python 以外でも動く

Python でプロトタイピングし、そのまま C++ / Unity (C#) / Flutter / Kotlin でモバイルにデプロイ可能です。

安定運用

ONNX による安定動作

依存関係が少なく、モデルが勝手に更新されないため挙動が一定。量産製品の検証が容易です。

制御

話速コントロール

再生速度の調整に対応(v2 以降)。用途に合わせた聞き取りやすい読み上げを実現します。

GPU

GPUアクセラレーション

ailia SDK の CUDA 実装により、GPU を活用できます。

連携

他のアイリア製品と連携

アイリア LLMAI Speech と組み合わせて、聞いて・考えて・喋る対話エージェントを構築できます。

QUICK START

実装は、これだけ。

モデルは初回実行時に自動ダウンロード。requirements との格闘はもう不要です。

Terminal + Python
# インストール(依存はこれだけ)
pip3 install ailia_voice librosa soundfile

# 音声合成
import ailia_voice, librosa, soundfile

ref_audio, rate = librosa.load("reference_10sec.wav", mono=True)
ref_text = "リファレンス音声の書き起こしテキストです。"

voice = ailia_voice.GPTSoVITSV2Pro()
voice.initialize_model(model_path="./models/")  # モデル自動DL
voice.set_reference_audio(ref_text,
    ailia_voice.AILIA_VOICE_G2P_TYPE_GPT_SOVITS_JA, ref_audio, rate)

buf, sr = voice.synthesize_voice("こんにちは。今日はいい天気ですね。",
    ailia_voice.AILIA_VOICE_G2P_TYPE_GPT_SOVITS_JA)
soundfile.write("output.wav", buf, sr)

PRICING

ライセンス・料金

まず無料で評価。本番導入が決まってからライセンス契約。
推論回数による追加課金は一切ありません。

TIER 01

評価版

無料・クレジットカード不要

  • 全機能を30日間利用可能
  • 全モデル(GPT-SoVITS 各バージョン / 蒸留モデル)に対応
  • 全プラットフォームを含む
  • 社内テスト専用
  • 商用配布・本番リリース
  • 第三者へのPoC提供
評価版をダウンロード →

SERVICE

AI開発支援

個別見積もり

  • 蒸留モデルのカスタマイズ・特定デバイス向け最適化
  • 音声機能のアプリ実装支援(アイリア WORKS)
  • コンサルティングからモデル作成まで一貫対応
相談する(無料) →

評価版で動作確認できたら、用途・デバイス数・アプリ構成をお知らせください。最適なライセンスをご提案します。相談・見積もりは無料です。

アイリア SDK 採用企業一覧

ASK Celsys KONICA MINOLTA Randido SEGA