音声認識・音声合成とOCRとは?
音声認識・音声合成とOCRとは、音声認識は、人間の話し声をテキストデータに変換する技術。音声合成は逆に、テキストデータから人工的な音声を生成する技術。OCR(光学文字認識)は、紙面や画像に写った文字を認識してテキストデータに変換する技術。いずれも入力方法をデジタル化する技術として広く応用されている。
高度試験・午前I(全区分共通)の過去問では1回出題されています。
おんせいにんしき・おんせいごうせいとおーしーあーる
音声認識・音声合成とOCRの意味
音声認識は、人間の話し声をテキストデータに変換する技術。音声合成は逆に、テキストデータから人工的な音声を生成する技術。OCR(光学文字認識)は、紙面や画像に写った文字を認識してテキストデータに変換する技術。いずれも入力方法をデジタル化する技術として広く応用されている。
音声認識・音声合成とOCRの具体例
スマートスピーカーへの話しかけを音声認識でテキスト化して指示内容を理解し、応答を音声合成で読み上げる。紙の書類をスキャンしてOCRでテキスト化すれば、検索可能なデジタルデータとして扱える。
音声認識・音声合成とOCRは試験でどう引っ掛けられる?
変換の向きを逆にしないこと。声から文字が音声認識、文字から声が音声合成。またOCRは画像を「テキストデータに変換する」技術であって、単に紙を画像として取り込むスキャン(イメージ化)とは別——PDF化しただけでは文字検索できない。手書き文字を対象とするものはOCRと区別してOCR(手書き文字認識)やICRと呼ばれ、活字より認識率が下がる。いずれの技術も認識精度は100%ではなく、業務で使う際は誤認識を前提とした確認の工程が要る点も見落としやすい。
音声認識・音声合成とOCRと関連する用語
音声認識・音声合成とOCRが出た過去問
AIにおけるディープラーニングに関する記述として、最も適切なものはどれか。
正解:あるデータから結果を求める処理を、人間の脳神経回路のように多層の処理を重ねることによって、複雑な判断をできるようにする。
要点:ディープラーニングは多層ニューラルネットで特徴を自動学習する
ディープラーニングは、人間の脳神経回路を模したニューラルネットワークの中間層を多層に重ね、入力から出力までの特徴抽出を段階的に自動で学習する手法である。層を深くすることで、人手による特徴量設計に頼らずに複雑な判断ができる点が特徴である。画像認識や音声認識で従来手法を大きく上回る精度を実現した。
出典:令和1年度 春期 高度共通_午前I試験 am1 問2(IPA)
最終更新:2026-08-25/解説は資格暗記が独自に作成しています。 過去問の出典は各問題に記載のとおりです。