第1回:授業案内・自己紹介と本文の検索

2026年10月6日(火)14:40–16:10・DHラボ B307

1. NLPの課題と方法

自然言語処理(NLP)には多くの課題があります。同じ本文でも、語の区切り、語句の関係、語の意味、指す対象など、課題によって求める判断が異なります。

課題 出力の例 専用の手法・システムの例
形態素解析・品詞付与 語の区切りと品詞 辞書と統計的な解析器
係り受け解析 「本を読む」の「本を」と「読む」の関係 文法規則と学習済みの解析器
意味的類似度 「本を読む」と「読書する」の近さを表す値 語の共起と埋め込みのモデル
語義曖昧性解消 「かける」の意味(電話・眼鏡など) 辞書と周囲の語を使う分類器
固有表現抽出 人名・地名などの範囲と種類 規則と学習済みのNERモデル
共参照解析 「夏目漱石」と「彼」の対応 表現を結び付ける規則・モデル
文章分類 記事の種類(政治・文学など) 語の出現頻度と学習済みの分類器
機械翻訳 日本語の段落の英訳 対訳を用いて学習した翻訳モデル
質問応答 「誰が登ったか」への回答 検索と回答箇所を抽出するモデル
要約 主要な出来事の短い説明 原文の文を評価して選ぶ手法
音声認識 録音した自己紹介の文字起こし 音声のモデルと言語モデル

専用のシステムは、複数のモデル、辞書、規則を組み合わせることもあります。

NLPとソフトウェアの変化

資料 見る範囲と問い
Andrej Karpathy:Software Is Changing (Again)(Y Combinator、2025年、英語) 1:25–6:10の4分45秒。コードを書く、モデルを学習する、LLMに言葉で指示する、という三つの方法を比べてください。
Christopher Manning:History of Natural Language Processing(Stanford CS224N、2026年、英語)。授業サイト・講義動画(2024年、YouTube) スライド2「Four eras of NLP」。規則による方法、統計的な機械学習、深層学習の流れを確認してください。
  • NLPでは、課題に合わせたモデルやシステムが多く使われてきました。
  • 共通の事前学習済みモデルやLLMは、複数の課題を扱えます。
  • 課題ごとに求める出力の基準と評価が必要です。

任意:3Blue1BrownのLLM解説

2. 固有表現抽出:基準と方法

人名の範囲を決める

田中さんは東京で夏目漱石の『こころ』を読んだ。

  • 「田中さん」の「さん」を人名に含めますか?
  • 夏目漱石の名前があることから、その場にいる人物だと言えますか?

規則やモデルの結果を比べるには、人名の範囲と、何を取り出す課題なのかを揃える必要があります。

固有表現抽出で比較する

次の方法による固有表現抽出(NER)の結果を比べてください。

比べる方法 授業で確かめる問い
文字列・辞書・規則による検索 規則を読んで結果を説明できるか。別の表記や文脈を見落とさないか。
固定カテゴリのNERモデル(GiNZA・BERT・RoBERTa系など) 学習した言語・資料と今回の本文は合うか。調べたい種類が学習時のカテゴリにあるか。
カテゴリを指定するNERモデル(GLiNER系) 調べたい種類を指定できるか。カテゴリの説明を変えると結果はどう変わるか。
生成型の大規模言語モデル(LLM) 指示を変えると何が変わるか。示した引用や説明を本文から確認できるか。

固有表現抽出の比較

「蜘蛛の糸」の同じ四段落を、人名・地名と、神仏・罪人・刑罰の場所で比べてください。「極楽」はどちらの場所カテゴリに入るかを予想してください。カテゴリの変更に対応できるのは、どの方法ですか?

3. 本文を調べ、根拠を残す

読む資料

図書カードはこの版を「新字新仮名」としています。Soranohaの本文表示にはルビがあり、プレーンテキストにはルビや編集注記が含まれません。

検索の一致と出来事

検索で下りろが見つかったとします。実際の下降は「起きた」「起きていない」「この情報だけではわからない」のどれでしょうか?

プレーンテキストを開き、MacではCommand+F、Windows・LinuxではCtrl+Fで下りろを検索してください。見つかった箇所の前後を読み、誰が誰に何を求めているかを確認してください。そのうえで最初の予想を見直してください。

この表現は下降の命令です。検索で見つかったことから、命令された人が実際に下りたとは判断できません。「下へ向かう言葉」と「実際に起きた下降」を分けて記録してください。

自分で調べる:上昇と下降

共通の問いは、物語の中で上へ向かう動きと下へ向かう動きが、どのような言葉で表されるかです。

  1. 検索する前に、上昇と下降を表しそうな語を一つずつ予想してください。
  2. 作品を読み、自分の検索語をプレーンテキストで試してください。迷ったら、上昇にはのぼ、下降には落ちを使ってください。
  3. 上昇と下降の箇所を一つずつ選び、前後の段落を読んでください。部(一・二・三)、主体、短い表現、方向を記録してください。
  4. 各箇所が実際の動き、仮定、否定、命令などのどれに当たるか、本文から説明してください。判断を保留した箇所は、その理由を残してください。
  5. ペアで一つの判定を比べ、本文の根拠または検索語を見直してください。

ブラウザーの検索は入力した文字列を探します。活用形や複合語が同じ動詞かどうかは判断しません。0件なら本文の表記を確認し、検索語を一つ変えて試してください。

Soranohaを開けない場合は、本文のコピーを使ってください。

同じ箇所を別々に判定する

判定が同じなら、根拠にした表現も同じでしょうか?判定が違えば、どの表現や前後の文脈が違いの理由になったでしょうか?判断を保留した場合も、その理由を比べてください。

次回につながるメモ

今日のメモは提出せず、次回に持参してください。

残すもの 内容
問いと予想 本文から確かめたい小さな問いと、検索前の予想
資料と検索 作品のURLと使った検索語
二つの根拠箇所 部、主体、短い表現、方向、文脈からの判断
修正と未解決点 変えた検索語や解釈、その理由、まだ判断できないこと

「何を調べたか」「本文から何が言えるか」「次に何を変えるか」を各一文で書いてください。例えば、第二部の登る表現について、実際の動きと仮定を分けて探せるかを問いにできます。