抄録/ポイント:
抄録/ポイント
文献の概要を数百字程度の日本語でまとめたものです。
部分表示の続きは、JDreamⅢ(有料)でご覧頂けます。
J-GLOBALでは書誌(タイトル、著者名等)登載から半年以上経過後に表示されますが、医療系文献の場合はMyJ-GLOBALでのログインが必要です。
ソーシャルメディアなどに存在する大量のテキストデータは,新たな価値を創出するビッグデータの一つとして注目されている。しかし,プライバシー保護のために,利用に際して個人情報に相当する文字列を匿名化する必要がある。従来手法では,秘匿属性の設定や固有名詞抽出などを行う必要があった。しかし,属性設定漏れによる匿名化漏れや固有名詞以外の文字列から匿名化済み文字列を特定できるおそれがある。さらに,話し言葉のようなくだけた文には対応できない。文の差異に基づく手法では,有効範囲が定型句で構成されたテキストに限定される。そこで本研究では,文字n-gramフレーズの出現回数に基づいたk-匿名化を提案した。これは,事前の秘匿属性設定が不要,匿名化文字列を固有名詞に限定しないことで文脈からの特定を防止可能,定型句を含まないような多様なテキストに有効,構文解析や単語分析が不要なため話し言葉や未知語にも対応可能という利点がある。実験結果より,kの値の変化と匿名化された文字数の割合がnの値によって異なることを明らかにした。さらに,適切な匿名化状態を定義し,文字特定率から特定不可能性を,人手評価で理解可能性を測った。(著者抄録)