音声認識

音声認識とは、電子機器が話し言葉を理解する機能です。マイクが人の声を録音し、ハードウェアが信号をアナログ音波からデジタルオーディオに変換します。その後、音声データはソフトウェアによって処理され、音声が個々の単語として解釈されます。

音声認識の一般的な種類に、「音声テキスト変換」または「ディクテーション」ソフトウェアがあります。たとえばDragon Naturally Speakingは、話した内容をテキストとして出力します。音声認識プログラムを購入することもできますが、現在のMacintoshおよびWindowsオペレーティングシステムには、ディクテーション機能が標準で搭載されています。この機能を使うと、テキストを入力したり、基本的なシステムコマンドを実行したりできます。

Windowsでは、音声認識を自動的にサポートするプログラムもあれば、サポートしないプログラムもあります。すべてのプログラム → アクセサリ → コンピューターの簡単操作 → Windows音声認識を選択し、「すべての場所でディクテーションを有効にする」をクリックすると、すべてのアプリケーションで音声認識を有効にできます。OS Xでは、「音声入力と読み上げ」システム環境設定パネルでディクテーションを有効にできます。ディクテーションの横にある「オン」ボタンを選択するだけで、音声テキスト変換機能が有効になります。対応するプログラムでディクテーションを開始するには、編集 → ディクテーションを開始を選択します。OS Xでは、「アクセシビリティ」システム環境設定パネルを開いて「音声コマンド項目」を選択すると、音声コマンドを表示および編集することもできます。

音声認識のもう1つの種類に、モバイル機器で一般的な対話型音声認識があります。これにはスマートフォンタブレットなどが含まれます。iOSAndroidのどちらの機器でも、話しかけると音声による応答を受け取れます。iOS版は「Siri」と呼ばれ、パーソナルアシスタントとして機能します。Siriに、スマートフォンにリマインダーを保存するよう頼んだり、天気予報を尋ねたり、道順を案内してもらったり、その他多くの質問に答えてもらったりできます。このタイプの音声認識は、話した入力に自然に応答するため、自然なユーザーインターフェースまたは(NUI)と考えられています。

多くの音声認識システムは英語にしか対応していませんが、複数の言語に対応する音声認識ソフトウェアもあります。そのためには、言語ごとに固有の辞書と、異なるアクセントを理解して処理するための追加のアルゴリズムが必要です。Dragon Naturally Speakingなどのディクテーションシステムの中には、ユーザーの声を理解するようトレーニングでき、時間の経過とともに、より正確に理解できるよう適応するものもあります。

更新日 January 10, 2014 著者: Per C.

quiz知識をテストする

What is the minimum resolution required to be considered HDTV?

A
720x480 (480p)
0%
B
720x576 (576p)
0%
C
1280x720 (720p)
0%
D
1920x1080 (1080p)
0%
Correct! Incorrect!     View the HDTV definition.
More Quizzes →

Tech Terms コンピューター辞書

このページの音声認識の定義は、TechTerms.comの著者が執筆したオリジナルの定義です。このページを参照または引用する場合は、定義の直下にある緑色の引用バーをご利用ください。

私たちの目標は、コンピューター用語をわかりやすく説明することです。すべての定義において正確さとわかりやすさを追求しています。フィードバックや新しい技術用語の提案がある場合は、お問い合わせください

Tech Terms ニュースレター

毎日または毎週のニュースレターで技術知識を高めましょう!今すぐ購読して、新しい用語やクイズをメールでお受け取りください。

無料のTechTermsニュースレターに登録する

メールの受信頻度を選択してください

各メールのリンクから、いつでも登録解除または頻度変更ができます。 ご質問はこちらからお問い合わせください。

注意:ニュースレターは英語で配信されます。