忍者ブログ
統計、機械学習、AIを学んでいきたいと思います。 お役に立てば幸いです。

【DS検定対策】過学習の正体を見破る!「バリアンス(分散)」の仕組み

機械学習モデルの予測誤差は、大きく「バイアス(偏り)」と「バリアンス(分散)」の2つに分解できます。そのうち、「訓練データの選び方によって予測結果がどのくらいブレるか」を表す指標が「バリアンス(Variance)」です!

1. 【 問題 】

機械学習における予測誤差の構成要素において、異なる訓練データセットを用いてモデルを学習させた際に、モデルの予測値がどれだけ変動(ブレ)するかを表す概念を何と呼ぶでしょうか?

① バリアンス(分散:Variance)
② バイアス(偏り:Bias)
③ 不可避誤差(Irreducible Error)
④ 正則化項(Regularization Term)


2. 【 解答 】

正解: ① バリアンス(分散:Variance)

3. 整理:「バイアス」と「バリアンス」の違い(的当ての例え)

機械学習の誤差はよく「ダーツの的当て」に例えられます。この2つの違いを完璧に整理しましょう!

用語意味・状態モデルの状態
バイアス
(Bias)
予測値の平均が「真の値(中心)」からどれだけ離れているか(根本的なずれ・表現力不足)。 高バイアス = 未学習
(Underfitting)

モデルが単純すぎる。
バリアンス
(Variance)
訓練データが変わったときに、予測値がどれだけばらつくか(データへの過敏さ・ブレ)。 高バリアンス = 過学習
(Overfitting)

モデルが複雑すぎる。

4. 超重要:バイアス・バリアンスのトレードオフ

モデルの複雑さ(表現力)を変えたとき、バイアスとバリアンスは相反する動きを見せます。

・モデルを単純にする(例:直線で近似):
→ データが変わっても予測結果があまりブレない(低バリアンス)
→ ただし、真の複雑なパターンを捉えきれない(高バイアス = 未学習)

・モデルを複雑にする(例:高次多項式や深い決定木):
→ 訓練データの細かいノイズまで完璧に丸暗記できる(低バイアス)
→ ただし、別の訓練データを使うと予測結果がガラリと変わってしまう(高バリアンス = 過学習)

★ 目標:
「バイアス」と「バリアンス」の合計である全体誤差(トータルリスク)が最小になるちょうどいい複雑さのモデルを目指すのが機械学習のゴールです。

5. DS検定形式:実戦4択クイズ

問:機械学習における「バリアンス(分散)」に関する記述として、最も適切なものはどれか。

① バリアンスが高いモデルは、訓練データに含まれるノイズや偶発的な特徴まで過剰に学習してしまっている(過学習状態である)可能性が高い。
② バリアンスとは、モデルの予測値の平均と真の値との間の根本的なズレを表すものであり、モデルの表現力が不足している場合に高くなる。
③ モデルの複雑さを上げれば上げるほど、バイアスとバリアンスの双方を同時にゼロへ近づけることができる。
④ バリアンスを抑えるための手法として、モデルのパラメータ数や決定木の深さを極限まで大きくすることが推奨される。

【 正解: ① 】

解説: バリアンスの性質と過学習との関係を問う問題です。
①が正解です。高バリアンスは訓練データ(のノイズ)に過剰にフィットしている過学習状態を意味します。
②は「バイアス(未学習)」の説明です。
③バイアスとバリアンスはトレードオフの関係にあり、同時にゼロにすることはできません。
④モデルを複雑にするとバリアンスは高くなります。バリアンス(過学習)を抑えるには正則化の導入やモデルの単純化が有効です。


6. まとめ

DS検定や資格試験で「訓練データの違いによる予測のブレ」「過学習状態」「モデルが複雑すぎる」といったキーワードが出たら、正解は「バリアンス」です! 「バイアス=未学習(単純すぎる)」「バリアンス=過学習(複雑すぎる)」という対比構造を頭に叩き込んでおきましょう!

PR

【DS検定対策】実務で直面する最大の壁!「不均衡データ」の仕組みと対処法

「分類モデルを作ったら精度99%が出た!…と思ったら、単に数の多いクラスを当てずっぽうで予測していただけだった」という失敗は、データサイエンスの現場で頻繁に起こります。この原因となるのが「不均衡データ(Imbalanced Data)」です!

1. 【 問題 】

機械学習の分類問題において、ターゲットとなるクラス間のデータ件数に極端な偏り(例:正常99% vs 不正1%)が存在するデータを何と呼ぶでしょうか?

① 不均衡データ(Imbalanced Data)
② 多項データ(Multinomial Data)
③ 構造化データ(Structured Data)
④ 時系列データ(Time Series Data)


2. 【 解答 】

正解: ① 不均衡データ(Imbalanced Data)

3. 整理:なぜ危険?「正解率(Accuracy)の罠」

例えば「1,000件中、正常が990件・不正が10件」という不均衡データがあるとします。

・AIが何も学習せず、「すべてのデータを正常」と予測するバカなモデルを作ったとします。
・この場合でも、1,000件中990件が当たるため、正解率(Accuracy)は「99%」になってしまいます!

★ 問題点:
本当に検出したい「10件の不正」は1件も見つけられていないのに、正解率だけを見ると優秀なモデルに見えてしまうのが「正解率の罠(Accuracy Paradox)」です。

4. 不均衡データへの「2大対処法(リサンプリング)」

データの偏りを解消してモデルに正しく学習させるため、以下のデータ調整手法が使われます。

手法名仕組み特徴・注意点
オーバーサンプリング
(Oversampling)
少ない方のクラスのデータを増やしてバランスを整える(SMOTEなどの合成手法が有名)。 データが増えるため計算コストが増すが、情報損失がない。過学習に注意。
アンダーサンプリング
(Undersampling)
多い方のクラスのデータを削って減らし、少ない方にサイズを合わせる。 計算スピードは速くなるが、元あった貴重なデータを捨てる(情報損失)リスクがある。

※評価指標についても、正解率(Accuracy)ではなく「適合率(Precision)」「再現率(Recall)」「F1値」「AUC」などを用いて正しくモデルを評価します。


5. DS検定形式:実戦4択クイズ

問:機械学習における「不均衡データ」の扱いに関する記述として、最も適切なものはどれか。

① 不均衡データに対して正解率(Accuracy)を評価指標として用いると、少数クラスを一切予測できないモデルであっても見かけの精度が高く評価されてしまうリスクがある。
② アンダーサンプリングとは、少数クラスのデータを複製・合成することによってデータ件数を増やす手法のことである。
③ 不均衡データを学習させる際は、多数派クラスと少数派クラスの分類ミスに対する「重み(コスト)」を等しく設定するのが鉄則である。
④ オーバーサンプリングを行うと元のデータ数が減るため、モデルの学習時間を短縮させたい場合に用いられる。

【 正解: ① 】

解説: 不均衡データの評価における注意点を問う王道問題です。
①が正解です。正解率(Accuracy)だけに頼るとモデルの欠陥を見落とす危険があります。
②少数クラスを増やすのは「オーバーサンプリング」です。
③少数クラスの分類ミス(見逃し)に大きなペナルティ(重み)を与える「コスト考慮型学習」などが有効です。
④データが増えるため、学習時間は長くなります。データ数を減らして高速化するのは「アンダーサンプリング」です。


6. まとめ

DS検定や資格試験で「クラス間のデータ件数に偏りがある」「正解率(Accuracy)が使えない」「オーバーサンプリング / アンダーサンプリング」「SMOTE」といったキーワードが出たら、正解は「不均衡データ」です! 実務でも必ず直面するテーマですので、評価指標(F1値やAUC)とセットで確実に押さえておきましょう!

【DS検定対策】精度重視の特徴量選び!「ラッパー法」の仕組みと代表的手法

前回の「フィルター法」はモデルの学習を行わずに高速処理する手法でした。それに対し、実際に機械学習モデルの学習と評価を何度も繰り返し、最も精度の高くなる特徴量の組み合わせを探し出すアプローチが「ラッパー法(Wrapper Method)」です!

1. 【 問題 】

特徴量選択の手法において、特定の特徴量のサブセット(部分集合)を用いてモデルの学習と評価を反復し、モデルの予測精度が最も高くなる最適な特徴量の組み合わせを探索するアプローチを何と呼ぶでしょうか?

① ラッパー法(Wrapper Method)
② フィルター法(Filter Method)
③ 埋め込み法(Embedded Method)
④ 差分プライバシー(Differential Privacy)


2. 【 解答 】

正解: ① ラッパー法(Wrapper Method)

3. 整理:ラッパー法の代表的な3つのアルゴリズム

ラッパー法では「どのように特徴量を増減させて最適な組み合わせを探すか」によって、いくつかの探索アルゴリズムが存在します。

手法名探索の進め方・仕組み
前進選択法
(Forward Selection)
特徴量が「0個」の状態からスタート。1つずつ特徴量を加えてモデルを学習・評価し、最も精度が向上する特徴量を順に追加していく。
後退消去法
(Backward Elimination)
「すべての特徴量」が入った状態からスタート。1つずつ特徴量を除外してモデルを学習・評価し、削っても最も影響がない(精度が下がらない)特徴量を順に削除していく。
再帰的特徴削減
(RFE:Recursive Feature Elimination)
全特徴量で学習後、モデルから出力された重要度(重みなど)が最も低い特徴量を削減し、残った特徴量で再度学習…というループを希望の数になるまで繰り返す。

4. メリットとデメリット(フィルター法との違い)

★ メリット(長所):
・実際のモデルを使って評価するため、モデルに最適な高精度の特徴量セットが得られやすい。
・複数特徴量の組み合わせ効果(交互作用)も評価できる。

★ デメリット(短所):
・特徴量の組み合わせごとに何度もモデル学習をやり直すため、計算コスト・時間が膨大になる。
・特徴量数が多すぎると(組み合わせ爆発が起きるため)適用できない。

5. DS検定形式:実戦4択クイズ

問:特徴量選択の手法である「ラッパー法(Wrapper Method)」に関する記述として、最も適切なものはどれか。

① 機械学習モデルの学習を一切使わず、特徴量同士の相関係数や分散などの統計量のみに基づいて不要な特徴量を削る手法である。
② 特徴量の組み合わせを変えながら実際にモデルの学習と評価を何度も繰り返し、最適な組み合わせを探索するため、計算コストが非常に高くなる傾向がある。
③ Lasso回帰のように、モデルの損失関数に正則化項を加えることで、学習プロセスと同時に自動的にパラメータをゼロにする手法である。
④ 既存の特徴量を線形結合することによって、次元数を削減した全く新しい無相関な特徴量を作り出す手法である。

【 正解: ② 】

解説: ラッパー法の特徴と弱点を問う標準問題です。
②が正解です。モデル学習を反復するため高精度になりますが、計算コストが非常に重くなります。
①は「フィルター法(Filter Method)」の説明です。
③は「埋め込み法(Embedded Method)」の説明です。
④は「主成分分析(PCA)」などの特徴抽出(Feature Extraction)の説明です。


6. まとめ

DS検定や資格試験で「モデルの学習と評価を繰り返す」「反復して最適な組み合わせを探す」「ステップワイズ法(前進選択・後退消去)」「RFE」「計算コストが高い」といったフレーズが出たら、正解は「ラッパー法」です! 「高速だが粗いフィルター法」との対比で覚えておきましょう!

【DS検定対策】高速で特徴量を絞り込む!「フィルター法」の仕組みと特徴

機械学習モデルに投入するデータ(特徴量)が多すぎると、「学習に時間がかかる」「過学習が起きやすい(次元の呪い)」といった問題が発生します。そこで不要な特徴量を削ぎ落とす手法(特徴量選択)の中でも、最も高速でシンプルなアプローチが「フィルター法(Filter Method)」です!

1. 【 問題 】

特徴量選択(Feature Selection)の手法において、機械学習モデルの学習を一切行わず、特徴量と目的変数との相関係数や相互情報量、分散などの統計的な値(重要度)に基づいて特徴量を絞り込むアプローチを何と呼ぶでしょうか?

① フィルター法(Filter Method)
② ラッパー法(Wrapper Method)
③ 埋め込み法(Embedded Method)
④ 主成分分析(PCA)


2. 【 解答 】

正解: ① フィルター法(Filter Method)

3. 整理:特徴量選択の「3大アプローチ」徹底比較

特徴量選択は「どのタイミングで、モデル学習を使うかどうか」によって以下の3種類に大別されます。DS検定・G検定の超頻出エリアです!

手法名仕組み・特徴長所・短所
フィルター法
(Filter Method)
モデル学習を行わず、統計量(相関係数や分散など)だけで特徴量をふるい落とす(フィルターをかける)。 【長所】 処理速度が圧倒的に速い。
【短所】 特徴量同士の組み合わせ(交互作用)を考慮できない。
ラッパー法
(Wrapper Method)
特徴量のセットを変えながら何度もモデル学習と評価を繰り返し、最適な組み合わせを探す(ステップワイズ法など)。 【長所】 高い精度が出やすい。
【短所】 学習を繰り返すため計算コストが非常に重い。
埋め込み法
(Embedded Method)
モデルの学習プロセス自体に特徴量選択が組み込まれている手法(Lasso回帰のL1正則化、決定木の重要度など)。 【長所】 フィルター法とラッパー法のイイトコ取り(高速かつ高精度)。

4. フィルター法でよく使われる具体的な統計指標

フィルター法では、以下のような統計量を計算して閾値(しきい値)を下回る特徴量を削除します。

・分散(VarianceThreshold):
ほとんど値が変化しない(分散がゼロに近い)特徴量は、予測に役立たないため削除。

・ピアソンの相関係数:
目的変数との相関が著しく低い特徴量を削除(あるいは多重共線性を防ぐため特徴量同士の相関が高すぎる一方を削除)。

・カイ二乗検定 / 相互情報量:
カテゴリ変数と目的変数との間の関連性の強さを測定して選択。

5. DS検定形式:実戦4択クイズ

問:機械学習における「フィルター法」を用いた特徴量選択に関する記述として、最も適切なものはどれか。

① 実際にあらゆる機械学習モデルを何度も学習させ、最も検証精度が高かった特徴量の組み合わせを包み込むように選択する手法である。
② モデルの学習を行わずに各特徴量の統計的性質(相関係数など)のみに基づいて選択を行うため、計算量が非常に少なく高速に処理できる。
③ Lasso回帰のように、重みパラメータをゼロに近づける正則化項を損失関数に組み込むことで自動的に選択を行う手法である。
④ 既存の複数の特徴量を合体・変換して、新しい合成特徴量(主成分)を作り出す次元削減手法のことである。

【 正解: ② 】

解説: フィルター法のアプローチ特性を問う問題です。
②が正解です。モデル学習を挟まないため高速である点が最大の強みです。
①は「ラッパー法(Wrapper Method)」の説明です。
③は「埋め込み法(Embedded Method)」の説明です。
④は「主成分分析(PCA)」などの特徴抽出(Feature Extraction)の説明であり、特徴量選択(Feature Selection)とは区別されます。


6. まとめ

DS検定や資格試験で「モデルの学習を行わない」「統計量から選択」「計算速度が速い」「相関係数・分散」といったキーワードが出たら、正解は「フィルター法」です! ラッパー法・埋め込み法との違い、そして「まずフィルター法で大雑把に削ってから、ラッパー法やモデル学習へ進む」という実務の流れまで整理しておきましょう!


【DS検定対策】少ない試行で最高精度を狙う!「ベイズ最適化」の仕組み

ハイパーパラメータの組み合わせを闇雲にしらみつぶし(グリッドサーチ)に試すと、計算時間がいくらあっても足りません。そこで「過去の試行結果から学習し、次に最も有望な設定を予測して試す」という賢い探索を行うのが「ベイズ最適化(Bayesian Optimization)」です!

1. 【 問題 】

機械学習のハイパーパラメータチューニングにおいて、これまでに試したパラメータの設定値と得られた精度の履歴をもとに確率モデル(ガウス過程など)を構築し、「次にどのパラメータを試せば最も性能が向上しそうか」を予測しながら効率的に探索を進める手法を何と呼ぶでしょうか?

① ベイズ最適化(Bayesian Optimization)
② グリッドサーチ(Grid Search)
③ ランダムサーチ(Random Search)
④ 勾配降下法(Gradient Descent)


2. 【 解答 】

正解: ① ベイズ最適化(Bayesian Optimization)

3. 整理:なぜ「過去の結果から予測」すると効率的なのか?

ベイズ最適化は、過去の探索データを元に「目的関数の形状(どのあたりで精度が高くなるか)」をブラックボックス関数として確率的に推測します。

【 ベイズ最適化の探索ステップ 】

[ステップ1]いくつか適当な初期値(ランダムなど)でモデルを学習・評価する。
↓
[ステップ2]【事後分布の更新】
これまでの結果から「パラメータと精度」の関係性を確率モデル(代理モデル)で推測する。
↓
[ステップ3]【獲得関数の計算】
「精度が高そうな場所(活用)」と「まだ試しておらず不確実性が高い場所(探索)」のバランスを計算し、次に試すべき最適な地点を決定する。
↓
[ステップ4]決定した地点でモデルを評価し、履歴を追加してステップ2へ戻る(繰り返す)。

このアプローチにより、「見込みの薄い領域」を何度も無駄に試すことを避けられるため、少ない試行回数で効率よく最適解(最高の精度)に到達できます。


4. 代表的なハイパーパラメータ探索手法の最終比較

DS検定やG検定で問われる3大探索手法の特徴を整理しておきましょう。

手法名探索の進め方計算効率・特徴
グリッドサーチ 指定した候補値のすべての組み合わせを格子状に全試行。 確実だが、候補が増えると組合せ爆発を起こす。
ランダムサーチ 指定範囲からランダムに抽出して試行。 グリッドサーチより広い範囲を効率よく探せる。
ベイズ最適化 過去の履歴から「次に有望な地点」を確率的に予測して試行。 最も計算効率が高い。PythonのOptuna等で標準利用。

5. DS検定形式:実戦4択クイズ

問:ハイパーパラメータの自動探索手法である「ベイズ最適化」に関する記述として、最も適切なものはどれか。

① 探索の途中で過去の試行結果を一切参照せず、常に完全にランダムな値を生成して評価を繰り返す手法である。
② これまでの試行履歴に基づいて代理モデルを構築し、過去の結果から最も性能向上が期待できるパラメータを適応的に選択して探索する。
③ パラメータの候補値をあらかじめ網目状に固定し、そのすべての組み合わせを順番に評価していく手法である。
④ ディープラーニングの重み(パラメータ)を微分の勾配方向に沿って自動で更新していく最適化アルゴリズムである。

【 正解: ② 】

解説: ベイズ最適化の特徴を問う基礎問題です。
②が正解です。過去の履歴を活用して「次に評価すべき有望な地点」を計算します。
①は「ランダムサーチ」の説明(過去の履歴を活用しない)です。
③は「グリッドサーチ」の説明です。
④は「SGDやAdamなどの勾配降下法」の説明であり、ハイパーパラメータ探索ではなくモデル本体の学習処理です。


6. まとめ

DS検定や資格試験で「過去の試行結果・履歴を利用する」「確率モデル」「次に有望なパラメータを予測」「少ない試行で効率的に探索」「Optuna」といったフレーズが出たら、正解は「ベイズ最適化」です! 前回の「グリッドサーチ」、そして「ランダムサーチ」との違いと合わせて、セットで完璧に整理しておきましょう!