導入事例

AmiVoice API

株式会社聴覚研究所様

大人数の会話や周囲が騒がしい環境でも高精度で文字起こし
難聴者支援から生まれた「TeamLog」がAmiVoice APIを"一択"と断言する理由

    利用サービス
  • API

株式会社聴覚研究所様では、難聴者の就労支援をはじめ、大規模会議や騒音環境下での議事録作成、講演会の字幕生成など、複数人の会話に特化した音声認識システム「TeamLog」を企画・開発し提供しています。既存の文字起こしツールでは対応しきれなかった「大人数・騒音・発言の重なり」という現場の課題にどのように向き合い、AmiVoice APIがその解決にどのような役割を果たしているのか、採用の背景と導入後の効果について技術部主任の小林 圭介様に伺いました。

課題背景

既存ツールは大人数・騒音環境で機能しなかった

私たちは、耳の聞こえにくい方々、いわゆる難聴者の支援に取り組む法人です。難聴者は、会話に参加する人数が増えるほど会話の内容を把握しづらくなる傾向があります。就労現場などでは、こうしたコミュニケーション不全が仕事のミスやトラブルにつながることも少なくありません。

そこで当初は、既存の文字起こしツールを活用して難聴者を支援できないか検討しました。ところが調べていくうちに、既存のツールには大きな壁があることがわかってきました。大人数の会話や周囲が騒がしい環境、まさに難聴者が最も苦労するような場面では、どのツールもうまく機能しないのです。

さらに難聴者特有の問題として、誤認識が発生してもその誤りを自分の耳で確認できないという点があります。つまり、一般的なユーザーよりもはるかに高い精度が求められていました。こうした課題を解決するために、私たちはゼロからシステム開発に着手しました。音響技術、音声処理技術等、多くの専門家の知見を結集して生まれたのが、音声認識システム「TeamLog」です。

導入の決め手

「発話区間のみ課金する仕組み」と「忠実な認識結果」

開発にあたっては、さまざまな音声認識エンジンを比較検討しました。最終的にAmiVoice APIを選んだ理由は、精度やレスポンス速度はもちろんのこと、それ以上に「発話区間のみ課金する仕組み」と「音声に忠実な認識結果」という2点が、私たちの想定するシステムと非常に相性が良かったからです。

TeamLogはリアルタイムで文字起こしを行うシステムのため、使用中は音声認識エンジンを常時起動したままにしておく必要があります。長時間利用するとエンジンのコストがかさんでしまうのですが、AmiVoice APIは発話区間のみ課金する仕組みのため、発話がない時間帯に無駄なコストが発生しにくい。これは長時間使用を前提とした私たちのサービスにとって、非常に大きな魅力でした。

もう一点、認識の「忠実さ」についても特筆すべき点があります。他の音声認識エンジンは、小さな音や曖昧な音でも強引に文字起こしをしようとする傾向があります。一方AmiVoice APIは、発話以外の音や小さすぎる音は文字起こしをしません。検証を重ねた結果、これによって妙な認識結果が混入しにくいことが確認できました。いろいろな音声認識エンジンサービスを比較しましたが、選択肢としては一択でした。これ以外なかったと思っています。

また、実装時には多くの課題があり苦戦した場面もありましたが、AmiVoice APIのサポートチームのレスポンスが速く、非常に手厚く対応していただいたことで大変助かりました。

導入の効果

「発言が重なっても全部文字起こしされる」現場からの声が手応えに

精度とリアルタイム性にはこだわって開発していますが、AmiVoice APIの特性や機能を活用することで実現できた機能がたくさんありました。
ユーザーや導入企業からは、こんな声をいただいています。

・とにかく精度が高いし、認識のスピードも速い
・名前付きで記録されるので後から見返したときにわかりやすい
・他社製品よりも完成度の高い議事録が作れる
・難聴者や外国人労働者への情報伝達が効率化できた
・発言が重なってもすべて文字起こしされるから、会話の流れがわかる
・誤認識があってもリアルタイムで修正できる点が便利
・専門用語にも対応できるし、「えーっと」みたいな余計な言葉が入らないのがいい

「名前付きで記録される」という点については、複数マイクを使った独自の収音設計によって実現したものです。マイクの感度を上げれば遠くの声は拾いやすくなりますが、それでは雑音も入り込んでしまいます。そこでTeamLogでは、その人の声だけを確実に収音する独自の仕組みを採用しました。これにより大人数の会話でも誰の発言かが一目でわかります。画面から情報を受け取る難聴者にとって、これは特に重要なポイントです。

今後の展望

不明瞭な発音・方言に対応する独自学習エンジンへの期待

AIの進歩が著しい時代ですので、音声認識の技術もこれからさらに進化していくと思っています。近年はE2Eエンジンによる認識精度のさらなる向上や、多言語エンジンの実装なども進んでおり、私たちとしても引き続き機能改善・認識率向上に取り組んでいく考えです。
AmiVoice APIに対しては、難聴者特有の滑舌や地域ごとの方言にも対応できる独自学習エンジンの発展に、特に期待を寄せています。

サービス概要

30人超の大規模会議・80dB超の工場・同時多言語通訳まで対応——「無料ツールでは限界がある現場」のための音声認識システムTeamLog

文字起こしを行う上で本当に重要なのは、いかに「現場で実用的であるか」ということだと私たちは考えています。静かな場所や1人の声の認識精度が高いのは、今や当たり前の時代です。無料ツールでもそれなりの精度が出せるようになっています。

TeamLogが複数人の会話や周囲が騒がしい環境での文字起こしや、とにかく精度を追求したいシーンでご活用いただけるシステムです。

・議論が白熱しがちなミーティング
・30人以上が参加する大規模会議
・大きな音が鳴り響く工場での文字起こしや記録
・誤認識が許されない講演会での字幕生成
・さまざまな言語が入り混じる会話や、母語が異なる複数の外国人への情報伝達

このようなシーンでこそ、TeamLogの真価が発揮されます。マイクが必要なぶん、他の文字起こしツールほど手軽ではありません。ただその分、さまざまな環境に適応できる汎用性と、過酷な現場でも精度の落ちない実用性を兼ね備えています。使用するマイクシステムは多種多様な市販品と組み合わせられるため、ピンマイク・スタンドマイク・無線マイク・ヘッドセットマイクなど、状況に合わせた柔軟な構築が可能です。

既存の文字起こし精度に課題を感じておられる方は、ぜひ一度お試しいただけると嬉しく思います。

>サービス詳細はこちら
>サービス紹介動画はこちら

社名 株式会社聴覚研究所
事業内容 補聴器フィッティングと音声認識システム開発による難聴者支援
URL https://hearing-lab.jp/
APIを無料で利用開始