AmiVoice API

AmiVoice APIとは

音声をテキストに変換する Speech to textのAPIです。APIのエンドポイントに音声を送信すると、発話内容をテキストにした結果が得られます。会議の文字起こしや音声対話システムなどの音声対応アプリケーションを作成できます。

発話区間だけが課金対象になる仕組みを表すイラスト

毎月60分無料・発話区間のみの課金

全エンジンが毎月60分無料、低価格ながら高品質な音声認識を提供。音声部分(発話区間)だけが課金され、無音などの時間には課金されないため、運用コストを抑えることが可能です。

専門スタッフによる技術サポートを表すイラスト

導入前から運用まで、技術サポートが無料

導入前のご相談から設定、運用時のご不明点まで、専門スタッフが無料でサポート。音声認識の活用が初めての方でも、安心してご利用いただけます。

業界や用途に合わせた音声認識エンジンを表すイラスト

業界・用途に合わせた専用エンジン

会議、医療、自治体など、業界や利用シーンに合わせた音声認識エンジンを用意。専門用語や固有名詞にも対応し、用途に適した高精度な文字起こしを実現します。

日本地図と音声認識・セキュリティを表すイラスト

日本語の高い認識精度と安心の国内運用

日本企業として長年にわたり日本語に特化した音声研究を続けてきたからこそ実現できる、高い認識精度。
話し言葉のニュアンスや句読点の使い方まで考慮した、自然な日本語テキストを生成します。

主な機能

詳しい機能についてはドキュメントをご覧ください

  • リアルタイム変換・バッチテキスト変換も両方対応

    音声ストリームや短い発話をスピーディに処理し、リアルタイムにテキストへ変換する方式と巨大な音声ファイルをバッチ処理する方式があります。

  • 自動学習で常にアップデート

    会話_汎用エンジンは自動学習システム(ATS)により常に最新版に更新されています。最近出てきた新しい言葉なども認識します。

  • 句読点・疑問符を自動付与

    句読点・疑問符を認識結果に自動的に付与。より正確でわかりやすい話し言葉の文章作成をサポートします。

  • 単語登録で固有名詞も認識

    製品名・固有名詞など、利用シーンに合わせてユーザー辞書に単語を登録することができます。これにより、社内用語や氏名など、特定の単語やフレーズの認識精度が向上します。

  • フィラー(言い淀み)を自動削除

    「えっと」「そのー」「あのー」などの言い淀み(フィラー)を自動削除(削除しない設定も可能)します。認識結果を修正する手間が軽減されます。

  • 不適切用語を非表示

    ビジネスシーンなどオフィシャルな状況において不適切な用語(性的な言葉、差別用語等)はテキスト化されないので安心してご利用いただけます。

  • 読み(よみがな)を表示

    音声認識結果に音声から推定された「読み」が付与されます。子供向けのアプリへの表示のほか、CRMや製品データベースなど後続システムのデータ照合などにも活用いただけます。

  • タイムスタンプ

    音声認識結果に音声データの先頭を0としたミリ秒単位のタイムスタンプが付与されます。これにより各発話の開始時刻および終了時刻を取得することが可能です。

  • 話者ダイアライゼーション

    複数の話者が含まれる音声に対して、誰がいつ話したかがわかるようになる機能です。事前学習なしで、話者を特定してラベルを付与します。

  • 感情分析(オプション)

    音声から話者の感情を分析し、喜び・憤り・ストレス・不満・期待など、20個のパラメータを出力。詳細な声の分析が可能になります

オプション機能

プライベート接続(AWS PrivateLink)

AWS環境をご利用のお客様向けに、「AmiVoice API」へのAWS PrivateLink接続を提供する有償オプションです。お客様のAmazon VPCにVPCエンドポイントを作成することで、パブリックインターネットを経由せず、AWSのネットワーク内から音声認識APIを利用できます。音声認識APIへの接続のために、インターネットゲートウェイやNAT Gateway、パブリックIPアドレスを用意する必要がありません。インターネット接続を禁止または制限しているシステムからも利用でき、ネットワーク構成の簡素化や、構成によっては関連コストの抑制にもつながります。同期APIと非同期APIはそれぞれ個別のオプションです。両方を利用する場合は、それぞれに料金が発生します。ご希望の場合はお問い合わせフォームよりお知らせください。

感情分析機能毎月60分無料

音声から話者の感情を分析し、喜び・憤り・ストレス・不満・期待など、20個のパラメータを約2秒に1回出力します。例えば「ありがとう」という表現の裏に隠れされた感情の起伏を把握できるなど、より詳細な声の分析が可能になります。感情分析結果は、コンタクトセンターやマーケティング・人事・医療などの幅広いシーンで活用できます。イスラエルのNemesysco社が提供する最新の感情分析エンジンをベースに、ESジャパンが日本国内300万音源の検証・研究から開発した「ESAS」技術を提供します。非同期HTTP音声認識APIでご利用いただけます。毎月60分まで無料でご利用いただけますのでお気軽にお試しください。

AmiVoiceAPIの感情分析機能(オプション機能)

AmiVoice APIの導入事例

こんなサービスもおすすめです

APIを無料で利用開始