研究内容
データとモデルを観察する

自然言語処理(Natural Language Processing; NLP)は、私たちが日常的に利用している言葉(自然言語)をコンピュータによって理解・処理する方法を考える研究分野です。近年、この分野では、大量の質問文と回答からなるデータセットを用意し、機械学習(深層学習)によってタスクを実行するモデルを得るという、end-to-end な方法論が一般的です。しかし、この方法論ではしばしば、人間の予想外の振る舞いをするモデルが得られることが知られています。
例として、前提となる文1と帰結となる文2からなる文のペアを入力し、文のペアの意味的な関係(含意または矛盾)を出力するタスク(含意関係認識)を考えます。あるデータセットには、文2に Nobody という語が含まれていると98%の確率で矛盾であるという偏りが含まれていましたが、研究者は誰も気付いていませんでした。この偏ったデータセットから学習されたモデルは、全体としては高い精度(80%以上)を達成していましたが、内部的には、文1を参照することなく、文2だけから意味的な関係を勝手に推定していました(Tsuchiya 2018)。
つまり、データとモデルを批判的に観察することなく、単純に end-to-end な方法を適用することは危険であるということです。そのため、当研究室は、タスクの定義とデータの分析から始め、アノテーションでデータを作り、その上でモデルを構築することにこだわっています。
よくある流れ
- タスクを選ぶ
- 既存のデータセットを選ぶ
- モデルを作る
当研究室の流れ
- タスク定義とデータ分析
- アノテーション(データ作成)
- モデルを作り、振る舞いと内部を観察する
災害時の情報発信と言葉

災害時の SNS 投稿における地名の表記(正式名称と略称)が、投稿の情報の質とどう関係するかを、LLM による教師データ作成と分類器を用いて大規模に検証します。
直近の活動
- 2026年3月4日発表第5回計算社会科学会大会で2件発表しました
根拠に基づく判断:LLM の信頼性評価
LLM が提示された根拠(Wikipedia の出典、判例など)を、内部知識より優先して正しく参照できているかを評価します。この研究は、ウェブ上の情報が古くなっていないかを自動判定する「情報の賞味期限」の研究から発展しました。情報が現在も正しいかを判断する問題意識を引き継ぎ、テストセットの構築と、モデル内部での処理の解明の両面から取り組んでいます。
- 受賞 第21回言語処理若手シンポジウム(YANS2026)で株式会社日立製作所賞を受賞しました(2026)
- 受賞 言語処理学会第27回年次大会で委員特別賞を受賞しました(2021)
直近の活動
- 2026年8月17日発表第21回言語処理若手シンポジウム(YANS2026)で2件発表しました
LLM は本当に「理解」しているのか
自然言語推論、将棋の局面、固有表現抽出、コード生成を題材に、LLM が表層的なパターンに頼っているのか、構造を捉えているのかを、線形プロービングや活性化パッチングで診断します。精度低下や誤りの原因を、モデルの内部から説明することが目標です。
直近の活動
- 2026年3月10日発表言語処理学会第32回年次大会で発表しました
- 2024年12月発表PACLIC38で発表しました
言語モデルの内部から、文体・感情・立場を探る

LLM の内部表現から、文体、感情、観点といった属性に対応する方向を、スパースオートエンコーダ(SAE)と対照学習・文脈内学習を組み合わせて発見します。日本語の SNS 投稿や口コミを題材に、著者の癖、感情の種類と強さ、評価の観点と方向を分離することを目指しています。
多言語・多文化の言語モデルと SNS 分析
SNS 上の情報交換の分析を土台に、日本語・英語以外の言語にも対象を広げています。タイ語、インドネシア語、フィンランド語などで、SNS 投稿やニュース見出しの感情表現、LLM の文化的知識の偏りを検証します。言及数の推移と感情分析を組み合わせると、言及が増えていても内容はネガティブ、といった実態が見えてきます。
直近の活動
発表者:太田 俊輔、富澤 光峰