文献
J-GLOBAL ID:202502214680765117   整理番号:25A3113109

Video Vision Transformerを用いた手話認識の検討

著者 (6件):
資料名:
巻: 43rd  ページ: ROMBUNNO.1H5-05  発行年: 2025年 
JST資料番号: L4867A  資料種別: 会議録 (C)
記事区分: 短報  発行国: 日本 (JPN)  言語: 日本語 (JA)
抄録/ポイント:
抄録/ポイント
文献の概要を数百字程度の日本語でまとめたものです。
部分表示の続きは、JDreamⅢ(有料)でご覧頂けます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。
この論文では,Video Vision Transformer(ViViT)モデルを連続手話認識(CSLR)に適用する際の課題について説明する。著者らは,長期的な時間的依存性を効率的に捉えるために,一定の間隔でビデオフレームをサンプリングする前処理方法であるストライド分割を提案している。Phoenix14Tデータセットでの実験では,ゼロからのトレーニングではデータ不足のためにパフォーマンスが制限されることが示されている。Kinetics-400で事前トレーニングされたViViTモデルを使用すると収束が加速されるが,ドメインの不一致が原因で,単語エラー率が大幅に改善されることはない。これらの結果は,CSLRにおけるドメイン適応事前訓練とよりデータ効率的なアーキテクチャの必要性を強調する。(翻訳著者抄録)
シソーラス用語:
シソーラス用語/準シソーラス用語
文献のテーマを表すキーワードです。
部分表示の続きはJDreamⅢ(有料)でご覧いただけます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。

準シソーラス用語:
シソーラス用語/準シソーラス用語
文献のテーマを表すキーワードです。
部分表示の続きはJDreamⅢ(有料)でご覧いただけます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。

分類 (1件):
分類
JSTが定めた文献の分類名称とコードです
図形・画像処理一般 
タイトルに関連する用語 (2件):
タイトルに関連する用語
J-GLOBALで独自に切り出した文献タイトルの用語をもとにしたキーワードです

前のページに戻る