【DS検定対策】言葉のバリエーションをまとめる!「ステミング」の仕組みと役割
英語などのテキストを分析する際、同じ意味の単語であっても「run」「running」「ran」のように活用変化していると、コンピュータは「すべて別々の単語」として認識してしまいます。これを防ぐために単語の語幹を切り詰めて統一する前処理が「ステミング(Stemming)」です!
1. 【 問題 】
自然言語処理の前処理において、単語の語尾(活用形や複数形など)を機械的に切り落としたり変換したりして、同じ意味を持つ単語の語幹を一つに統一する手法を何と呼ぶでしょうか?
① ステミング(Stemming / 語幹処理)
② ストップワード除去(Stop Word Removal)
③ 特徴量ハッシング(Feature Hashing)
④ 位置エンコーディング(Positional Encoding)
2. 【 解答 】
3. 整理:ステミングの目的と具体例
テキストマイニングや検索エンジンのインデックス作成において、なぜステミングが必要なのかを整理しましょう。
| 項目 | 内容・具体例 |
|---|---|
| 具体的なイメージ | ・「connected」「connecting」「connection」 ➔ 「connect」 のような共通の形にまとめる。 ・単語の種類(語彙数)が圧縮され、モデルがパターンを学習しやすくなる。 |
| 行う目的 | 単語のバラつき(表記ゆれ)をなくすことで、文書の特徴量を正確に抽出し、検索漏れや機械学習の精度低下を防ぐ。 |
4. 関連する発展技術:レマタイゼーション(見出し語化)との違い
・ステミング(Stemming):
ルールに基づいて「機械的に語尾を切り詰める」手法(例:「studies」➔「studi」など、実在しない単語になることもある)。処理が高速。
・レマタイゼーション(Lemmatization):
辞書や文法を参照し、品詞を判別しながら「正しい原形(見出し語)」に変換する手法(例:「better」➔「good」、「was」➔「be」)。精度が高いが計算コストがかかる。
5. DS検定形式:実戦4択クイズ
問:自然言語処理における「ステミング(Stemming)」に関する記述として、最も適切なものはどれか。
① 動詞の過去形や複数形などの語尾をルールに基づいて切り詰め、単語の語幹を統一することで語彙数を削減する前処理手法である。
② 「the」や「is」のような、ほぼすべての文書に出現する意味の薄い単語をあらかじめテキストから完全に除外する手法である。
③ 離散的なトークンIDを連続値の多次元ベクトルに変換し、単語の意味的な近さを空間上にマッピングする入力層の仕組みである。
④ 文章を形態素や単語に分解せず、ランダムな文字数で強制的にスライスして特徴量を作成する次元削減手法である。
【 正解: ① 】
解説: ステミングの目的と仕組みを問う標準問題です。
①が正解です。語尾を切り詰めて語幹を統一し、単語のバリエーションをまとめます。
②は「ストップワード除去」、③は「埋め込み層」、④はステミングの説明ではありません。
6. まとめ
DS検定や資格試験で「動詞や名詞の形を統一する」「語幹をまとめる」「語尾を切り詰める前処理」といったキーワードが出たら、正解は「ステミング(Stemming)」です! 直前に確認したストップワード除去とセットで、自然言語処理の前処理の定番として押さえておきましょう!