抄録/ポイント:
抄録/ポイント
文献の概要を数百字程度の日本語でまとめたものです。
部分表示の続きは、JDreamⅢ(有料)でご覧頂けます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。
この論文では,Video Vision Transformer(ViViT)モデルを連続手話認識(CSLR)に適用する際の課題について説明する。著者らは,長期的な時間的依存性を効率的に捉えるために,一定の間隔でビデオフレームをサンプリングする前処理方法であるストライド分割を提案している。Phoenix14Tデータセットでの実験では,ゼロからのトレーニングではデータ不足のためにパフォーマンスが制限されることが示されている。Kinetics-400で事前トレーニングされたViViTモデルを使用すると収束が加速されるが,ドメインの不一致が原因で,単語エラー率が大幅に改善されることはない。これらの結果は,CSLRにおけるドメイン適応事前訓練とよりデータ効率的なアーキテクチャの必要性を強調する。(翻訳著者抄録)