デジタルヒューマニティーズB(言語処理と情報検索)
2026年度秋冬学期
授業資料
第1回・10月6日
14:40–16:10・DHラボ B307。本文は授業中に読んでください。ラボPCを利用できます。
授業の目的
人文学研究に自然言語処理(NLP)と情報検索を用いるための実践的な技能を学びます。近代日本文学と英文学を題材に、従来のNLPと近年のAIによる手法を比較し、結果、限界、必要な計算資源、再現性を評価します。
学習目標
- コーパスとメタデータを整備し、検索する。
- Pythonで基礎的なテキスト処理を書き、可視化を作成・解釈する。
- 本文の検索、トピックモデル、固有表現抽出(NER)、文章分類を適用する。
- 共通の本文と評価基準を用い、辞書・規則、GLiNER系などの学習済みモデル、生成型の大規模言語モデル(LLM)を比較する。
- 研究の問い、方法、根拠、限界を説明する、再実行可能な分析ノートブックまたは説明付きプログラムを作成する。
資料・ツール
- Natsume Simple(Natsume):日本語の共起検索
- Soranoha:青空文庫の本文と書誌情報
- BERTopic:埋め込みを用いたトピックモデル
- Gensim / LDA:語の出現頻度を用いたトピックモデル
- Hugging Face Models:学習済みモデルの検索・ダウンロード
- Hugging Face Datasets:データセットの検索・ダウンロード
- Speech and Language Processing: An Introduction to Natural Language Processing, Computational Linguistics, and Speech Recognition, with Language Models(Daniel Jurafsky・James H. Martin、2026):第3版オンライン原稿(2026年8月19日公開)