文献
J-GLOBAL ID:201202205853234654   整理番号:12A0436002

軽量な画像特徴量を用いたマルチモーダル音声認識

著者 (5件):
資料名:
巻: J95-D  号:ページ: 618-627  発行年: 2012年03月01日 
JST資料番号: S0757C  ISSN: 1880-4535  資料種別: 逐次刊行物 (A)
記事区分: 原著論文  発行国: 日本 (JPN)  言語: 日本語 (JA)
抄録/ポイント:
抄録/ポイント
文献の概要を数百字程度の日本語でまとめたものです。
部分表示の続きは、JDreamⅢ(有料)でご覧頂けます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。
音声と動画のマルチモーダル音声認識は,音声のみを用いた場合と比較して高い認識性能が期待される手法であり,これまでの研究で雑音環境下での音声認識に有効であることが示されている。また画像特徴量として,様々なものが提案されている。しかしこれまでは認識性能に注意が向けられ,ポータブル機器等において重要な計算量に注目した研究はほとんど存在しない。実際,代表的な画像特徴量であるオプティカルフローや主成分分析に基づいた手法では,音響特徴量の計算と比べ計算量がかなり大きい。そこで本研究では,計算量と認識性能のバランスに優れた特徴量について検討を行った。発話区間検出を目的として提案された低輝度画素数に着目した特徴量を多次元に拡張し,マルチモーダル音声認識に応用する。実験ではビデオカメラで収録したデータとともにiPhone4で収録したデータを用い,提案輝度特徴量が計算量が少なくどの環境においても認識性能の向上に有効であることを示す。(著者抄録)
シソーラス用語:
シソーラス用語/準シソーラス用語
文献のテーマを表すキーワードです。
部分表示の続きはJDreamⅢ(有料)でご覧いただけます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。

準シソーラス用語:
シソーラス用語/準シソーラス用語
文献のテーマを表すキーワードです。
部分表示の続きはJDreamⅢ(有料)でご覧いただけます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。

分類 (1件):
分類
JSTが定めた文献の分類名称とコードです
パターン認識 
引用文献 (23件):
タイトルに関連する用語 (4件):
タイトルに関連する用語
J-GLOBALで独自に切り出した文献タイトルの用語をもとにしたキーワードです

前のページに戻る