研究内容

データとモデルを観察する

2文の意味関係の分類を頼まれたモデルが、偏った学習データから「後ろの一文だけ見たら分類できる」と学んでしまう様子。

自然言語処理(Natural Language Processing; NLP)は、私たちが日常的に利用している言葉(自然言語)をコンピュータによって理解・処理する方法を考える研究分野です。近年、この分野では、大量の質問文と回答からなるデータセットを用意し、機械学習(深層学習)によってタスクを実行するモデルを得るという、end-to-end な方法論が一般的です。しかし、この方法論ではしばしば、人間の予想外の振る舞いをするモデルが得られることが知られています。

例として、前提となる文1と帰結となる文2からなる文のペアを入力し、文のペアの意味的な関係(含意または矛盾)を出力するタスク(含意関係認識)を考えます。あるデータセットには、文2に Nobody という語が含まれていると98%の確率で矛盾であるという偏りが含まれていましたが、研究者は誰も気付いていませんでした。この偏ったデータセットから学習されたモデルは、全体としては高い精度(80%以上)を達成していましたが、内部的には、文1を参照することなく、文2だけから意味的な関係を勝手に推定していました(Tsuchiya 2018)。

つまり、データとモデルを批判的に観察することなく、単純に end-to-end な方法を適用することは危険であるということです。そのため、当研究室は、タスクの定義とデータの分析から始め、アノテーションでデータを作り、その上でモデルを構築することにこだわっています。

よくある流れ

  1. タスクを選ぶ
  2. 既存のデータセットを選ぶ
  3. モデルを作る

当研究室の流れ

  1. タスク定義とデータ分析
  2. アノテーション(データ作成)
  3. モデルを作り、振る舞いと内部を観察する
見るもの
災害時投稿における地名表記と情報の質
流れのどこか
データ分析、データ作成

災害時の情報発信と言葉

災害時の SNS 投稿の例。冠水した名古屋駅前にいる人は「名古屋駅前が冠水。帰れなくて困ってる」と正式名称で投稿し、自宅でテレビのニュースを見ている人は「名駅大変そう」と略称で投稿している。

災害時の SNS 投稿における地名の表記(正式名称と略称)が、投稿の情報の質とどう関係するかを、LLM による教師データ作成と分類器を用いて大規模に検証します。

直近の活動

見るもの
SNS の言及数と感情、言語ごとの回答の違い
流れのどこか
データ分析、データ作成

多言語・多文化の言語モデルと SNS 分析

SNS 上の情報交換の分析を土台に、日本語・英語以外の言語にも対象を広げています。タイ語、インドネシア語、フィンランド語などで、SNS 投稿やニュース見出しの感情表現、LLM の文化的知識の偏りを検証します。言及数の推移と感情分析を組み合わせると、言及が増えていても内容はネガティブ、といった実態が見えてきます。

直近の活動

見るもの
出典付きと要出典の記述、期限切れ情報の差分
流れのどこか
データ作成、モデル分析

根拠に基づく判断:LLM の信頼性評価

LLM が提示された根拠(Wikipedia の出典、判例など)を、内部知識より優先して正しく参照できているかを評価します。この研究は、ウェブ上の情報が古くなっていないかを自動判定する「情報の賞味期限」の研究から発展しました。情報が現在も正しいかを判断する問題意識を引き継ぎ、テストセットの構築と、モデル内部での処理の解明の両面から取り組んでいます。

直近の活動

  • 2026年8月17日発表
    第21回言語処理若手シンポジウム(YANS2026)で2件発表しました

    発表者:田口 凜采、南 理久

見るもの
精度低下や誤りの原因
流れのどこか
データ分析、モデル分析

LLM は本当に「理解」しているのか

自然言語推論、将棋の局面、固有表現抽出、コード生成を題材に、LLM が表層的なパターンに頼っているのか、構造を捉えているのかを、線形プロービングや活性化パッチングで診断します。精度低下や誤りの原因を、モデルの内部から説明することが目標です。

直近の活動

  • 2026年3月10日発表
    言語処理学会第32回年次大会で発表しました

    発表者:前木場 舜

  • 2024年12月発表
    PACLIC38で発表しました
見るもの
文体・感情・観点に対応するモデル内部の方向
流れのどこか
モデル分析

言語モデルの内部から、文体・感情・立場を探る

Transformer の各層の Attention と Feed-forward からベクトルを取り出し、段どうしの類似度や、入力との類似度が層ごとにどう変わるかを比べる様子を示す図。

LLM の内部表現から、文体、感情、観点といった属性に対応する方向を、スパースオートエンコーダ(SAE)と対照学習・文脈内学習を組み合わせて発見します。日本語の SNS 投稿や口コミを題材に、著者の癖、感情の種類と強さ、評価の観点と方向を分離することを目指しています。