音声認識
音声認識とは、電子機器が話し言葉を理解する機能です。マイクが人の声を録音し、ハードウェアが信号をアナログ音波からデジタルオーディオに変換します。その後、音声データはソフトウェアによって処理され、音声が個々の単語として解釈されます。
音声認識の一般的な種類に、「音声テキスト変換」または「ディクテーション」ソフトウェアがあります。たとえばDragon Naturally Speakingは、話した内容をテキストとして出力します。音声認識プログラムを購入することもできますが、現在のMacintoshおよびWindowsオペレーティングシステムには、ディクテーション機能が標準で搭載されています。この機能を使うと、テキストを入力したり、基本的なシステムコマンドを実行したりできます。
Windowsでは、音声認識を自動的にサポートするプログラムもあれば、サポートしないプログラムもあります。を選択し、「すべての場所でディクテーションを有効にする」をクリックすると、すべてのアプリケーションで音声認識を有効にできます。OS Xでは、「音声入力と読み上げ」システム環境設定パネルでディクテーションを有効にできます。ディクテーションの横にある「オン」ボタンを選択するだけで、音声テキスト変換機能が有効になります。対応するプログラムでディクテーションを開始するには、を選択します。OS Xでは、「アクセシビリティ」システム環境設定パネルを開いて「音声コマンド項目」を選択すると、音声コマンドを表示および編集することもできます。
音声認識のもう1つの種類に、モバイル機器で一般的な対話型音声認識があります。これにはスマートフォンやタブレットなどが含まれます。iOSとAndroidのどちらの機器でも、話しかけると音声による応答を受け取れます。iOS版は「Siri」と呼ばれ、パーソナルアシスタントとして機能します。Siriに、スマートフォンにリマインダーを保存するよう頼んだり、天気予報を尋ねたり、道順を案内してもらったり、その他多くの質問に答えてもらったりできます。このタイプの音声認識は、話した入力に自然に応答するため、自然なユーザーインターフェースまたは(NUI)と考えられています。
多くの音声認識システムは英語にしか対応していませんが、複数の言語に対応する音声認識ソフトウェアもあります。そのためには、言語ごとに固有の辞書と、異なるアクセントを理解して処理するための追加のアルゴリズムが必要です。Dragon Naturally Speakingなどのディクテーションシステムの中には、ユーザーの声を理解するようトレーニングでき、時間の経過とともに、より正確に理解できるよう適応するものもあります。
知識をテストする