忍者ブログ
統計、機械学習、AIを学んでいきたいと思います。 お役に立てば幸いです。

【DS検定対策】高速で特徴量を絞り込む!「フィルター法」の仕組みと特徴

機械学習モデルに投入するデータ(特徴量)が多すぎると、「学習に時間がかかる」「過学習が起きやすい(次元の呪い)」といった問題が発生します。そこで不要な特徴量を削ぎ落とす手法(特徴量選択)の中でも、最も高速でシンプルなアプローチが「フィルター法(Filter Method)」です!

1. 【 問題 】

特徴量選択(Feature Selection)の手法において、機械学習モデルの学習を一切行わず、特徴量と目的変数との相関係数や相互情報量、分散などの統計的な値(重要度)に基づいて特徴量を絞り込むアプローチを何と呼ぶでしょうか?

① フィルター法(Filter Method)
② ラッパー法(Wrapper Method)
③ 埋め込み法(Embedded Method)
④ 主成分分析(PCA)


2. 【 解答 】

正解: ① フィルター法(Filter Method)

3. 整理:特徴量選択の「3大アプローチ」徹底比較

特徴量選択は「どのタイミングで、モデル学習を使うかどうか」によって以下の3種類に大別されます。DS検定・G検定の超頻出エリアです!

手法名仕組み・特徴長所・短所
フィルター法
(Filter Method)
モデル学習を行わず、統計量(相関係数や分散など)だけで特徴量をふるい落とす(フィルターをかける)。 【長所】 処理速度が圧倒的に速い。
【短所】 特徴量同士の組み合わせ(交互作用)を考慮できない。
ラッパー法
(Wrapper Method)
特徴量のセットを変えながら何度もモデル学習と評価を繰り返し、最適な組み合わせを探す(ステップワイズ法など)。 【長所】 高い精度が出やすい。
【短所】 学習を繰り返すため計算コストが非常に重い。
埋め込み法
(Embedded Method)
モデルの学習プロセス自体に特徴量選択が組み込まれている手法(Lasso回帰のL1正則化、決定木の重要度など)。 【長所】 フィルター法とラッパー法のイイトコ取り(高速かつ高精度)。

4. フィルター法でよく使われる具体的な統計指標

フィルター法では、以下のような統計量を計算して閾値(しきい値)を下回る特徴量を削除します。

分散(VarianceThreshold):
ほとんど値が変化しない(分散がゼロに近い)特徴量は、予測に役立たないため削除。

ピアソンの相関係数:
目的変数との相関が著しく低い特徴量を削除(あるいは多重共線性を防ぐため特徴量同士の相関が高すぎる一方を削除)。

カイ二乗検定 / 相互情報量:
カテゴリ変数と目的変数との間の関連性の強さを測定して選択。

5. DS検定形式:実戦4択クイズ

問:機械学習における「フィルター法」を用いた特徴量選択に関する記述として、最も適切なものはどれか。

① 実際にあらゆる機械学習モデルを何度も学習させ、最も検証精度が高かった特徴量の組み合わせを包み込むように選択する手法である。
② モデルの学習を行わずに各特徴量の統計的性質(相関係数など)のみに基づいて選択を行うため、計算量が非常に少なく高速に処理できる。
③ Lasso回帰のように、重みパラメータをゼロに近づける正則化項を損失関数に組み込むことで自動的に選択を行う手法である。
④ 既存の複数の特徴量を合体・変換して、新しい合成特徴量(主成分)を作り出す次元削減手法のことである。

【 正解: ② 】

解説: フィルター法のアプローチ特性を問う問題です。
②が正解です。モデル学習を挟まないため高速である点が最大の強みです。
①は「ラッパー法(Wrapper Method)」の説明です。
③は「埋め込み法(Embedded Method)」の説明です。
④は「主成分分析(PCA)」などの特徴抽出(Feature Extraction)の説明であり、特徴量選択(Feature Selection)とは区別されます。


6. まとめ

DS検定や資格試験で「モデルの学習を行わない」「統計量から選択」「計算速度が速い」「相関係数・分散」といったキーワードが出たら、正解は「フィルター法」です! ラッパー法・埋め込み法との違い、そして「まずフィルター法で大雑把に削ってから、ラッパー法やモデル学習へ進む」という実務の流れまで整理しておきましょう!


PR

【DS検定対策】少ない試行で最高精度を狙う!「ベイズ最適化」の仕組み

ハイパーパラメータの組み合わせを闇雲にしらみつぶし(グリッドサーチ)に試すと、計算時間がいくらあっても足りません。そこで「過去の試行結果から学習し、次に最も有望な設定を予測して試す」という賢い探索を行うのが「ベイズ最適化(Bayesian Optimization)」です!

1. 【 問題 】

機械学習のハイパーパラメータチューニングにおいて、これまでに試したパラメータの設定値と得られた精度の履歴をもとに確率モデル(ガウス過程など)を構築し、「次にどのパラメータを試せば最も性能が向上しそうか」を予測しながら効率的に探索を進める手法を何と呼ぶでしょうか?

① ベイズ最適化(Bayesian Optimization)
② グリッドサーチ(Grid Search)
③ ランダムサーチ(Random Search)
④ 勾配降下法(Gradient Descent)


2. 【 解答 】

正解: ① ベイズ最適化(Bayesian Optimization)

3. 整理:なぜ「過去の結果から予測」すると効率的なのか?

ベイズ最適化は、過去の探索データを元に「目的関数の形状(どのあたりで精度が高くなるか)」をブラックボックス関数として確率的に推測します。

【 ベイズ最適化の探索ステップ 】

[ステップ1]いくつか適当な初期値(ランダムなど)でモデルを学習・評価する。

[ステップ2]【事後分布の更新】
これまでの結果から「パラメータと精度」の関係性を確率モデル(代理モデル)で推測する。

[ステップ3]【獲得関数の計算】
「精度が高そうな場所(活用)」と「まだ試しておらず不確実性が高い場所(探索)」のバランスを計算し、次に試すべき最適な地点を決定する。

[ステップ4]決定した地点でモデルを評価し、履歴を追加してステップ2へ戻る(繰り返す)。

このアプローチにより、「見込みの薄い領域」を何度も無駄に試すことを避けられるため、少ない試行回数で効率よく最適解(最高の精度)に到達できます。


4. 代表的なハイパーパラメータ探索手法の最終比較

DS検定やG検定で問われる3大探索手法の特徴を整理しておきましょう。

手法名探索の進め方計算効率・特徴
グリッドサーチ 指定した候補値のすべての組み合わせを格子状に全試行。 確実だが、候補が増えると組合せ爆発を起こす。
ランダムサーチ 指定範囲からランダムに抽出して試行。 グリッドサーチより広い範囲を効率よく探せる。
ベイズ最適化 過去の履歴から「次に有望な地点」を確率的に予測して試行。 最も計算効率が高い。PythonのOptuna等で標準利用。

5. DS検定形式:実戦4択クイズ

問:ハイパーパラメータの自動探索手法である「ベイズ最適化」に関する記述として、最も適切なものはどれか。

① 探索の途中で過去の試行結果を一切参照せず、常に完全にランダムな値を生成して評価を繰り返す手法である。
② これまでの試行履歴に基づいて代理モデルを構築し、過去の結果から最も性能向上が期待できるパラメータを適応的に選択して探索する。
③ パラメータの候補値をあらかじめ網目状に固定し、そのすべての組み合わせを順番に評価していく手法である。
④ ディープラーニングの重み(パラメータ)を微分の勾配方向に沿って自動で更新していく最適化アルゴリズムである。

【 正解: ② 】

解説: ベイズ最適化の特徴を問う基礎問題です。
②が正解です。過去の履歴を活用して「次に評価すべき有望な地点」を計算します。
①は「ランダムサーチ」の説明(過去の履歴を活用しない)です。
③は「グリッドサーチ」の説明です。
④は「SGDやAdamなどの勾配降下法」の説明であり、ハイパーパラメータ探索ではなくモデル本体の学習処理です。


6. まとめ

DS検定や資格試験で「過去の試行結果・履歴を利用する」「確率モデル」「次に有望なパラメータを予測」「少ない試行で効率的に探索」「Optuna」といったフレーズが出たら、正解は「ベイズ最適化」です! 前回の「グリッドサーチ」、そして「ランダムサーチ」との違いと合わせて、セットで完璧に整理しておきましょう!

【DS検定対策】ハイパーパラメータ自動調整の基本!「グリッドサーチ」の仕組み

機械学習モデルの精度を最大限に引き出すには、人間があらかじめ設定する設定値(ハイパーパラメータ)の最適な組み合わせを見つける必要があります。その最もシンプルで直感的な探索手法が「グリッドサーチ(Grid Search)」です!

1. 【 問題 】

機械学習において、調整したいハイパーパラメータの候補値をあらかじめ複数指定し、それらすべての組み合わせ(格子状の点)についてモデルを学習・評価して最も制度が高かった組み合わせを選択する探索手法を何と呼ぶでしょうか?

① グリッドサーチ(Grid Search)
② ランダムサーチ(Random Search)
③ ベイズ最適化(Bayesian Optimization)
④ 勾配降下法(Gradient Descent)


2. 【 解答 】

正解: ① グリッドサーチ(Grid Search)

3. 整理:グリッドサーチのイメージとメリット・デメリット

例えば、調整したいパラメータが2つ(パラメータA:3候補、パラメータB:4候補)ある場合、3 × 4 = 合計12通りの全組み合わせを1つずつ順番に試します。

【 ハイパーパラメータ探索手法の比較 】

手法名仕組みメリット・デメリット
グリッドサーチ
(Grid Search)
指定した候補値の「すべての組み合わせ」をしらみつぶしに試す。 【長所】 候補の中に必ず最良の組み合わせがあれば確実に見つけられる。
【短所】 パラメータ数や候補が増えると計算量が爆発する(組合せ爆発)。
ランダムサーチ
(Random Search)
パラメータの探索範囲から「ランダムに値を抽出」して試す。 【長所】 試行回数を指定できるため計算量を制御しやすい。広範囲を浅く探すのに向く。
【短所】 運要素があり、最良の組み合わせを絶対見つけられるとは限らない。
ベイズ最適化
(Optuna等)
過去の試行結果から「次はどの値が良さそうか」を確率的に予測しながら探索する。 【長所】 少ない試行回数で効率的に良いパラメータにたどり着ける。
【短所】 アルゴリズム自体の理解や設定がやや複雑。

4. 実務の鉄則:交差検証(Cross Validation)とのセット運用

グリッドサーチを行う際、単に1回評価するだけだと「その分割データにたまたま適したパラメータ(過学習)」を選んでしまうリスクがあります。

そのため実務やScikit-learn等のライブラリでは、「グリッドサーチ + 交差検証(GridSearchCV)」を組み合わせて、各パラメータ組み合わせごとに交差検証の平均精度を算出し、最も汎化性能が高い組み合わせを選ぶのが標準手順となっています。


5. DS検定形式:実戦4択クイズ

問:機械学習のハイパーパラメータ探索手法に関する記述として、最も適切なものはどれか。

① グリッドサーチはパラメータの最適な連続値を微分計算によって代数的に求める手法であるため、試行回数は常に1回で済む。
② パラメータの数や各パラメータの指定候補数が多くなると、グリッドサーチで試すべき組み合わせの数が指数関数的に増加し、計算時間が非常に長くなる。
③ グリッドサーチを行う際は、検証用データ(テストデータ)の精度が最も高くなるパラメータが得られるまで、テストデータを何度も使って検索を繰り返すべきである。
④ ランダムサーチは常にグリッドサーチよりも精度が低くなるため、実務で使われることは一切ない。

【 正解: ② 】

解説: ハイパーパラメータ探索の性質を問う王道問題です。
②が正解です。候補値が増えると全組み合わせの数が爆発的に増えるのがグリッドサーチ最大の弱点です。
①微分で自動更新するのはモデルの重みパラメータ(勾配降下法など)であり、ハイパーパラメータではありません。
③テストデータをパラメータ選定に何度も使うと「テストデータへの過学習(データリーク)」が起きるため、探索には交差検証用の学習・検証データを用います。
④探索範囲が広い場合や連続値の場合は、ランダムサーチの方がグリッドサーチより効率よく良解を見つけられるケースも多いです。


6. まとめ

DS検定やG検定で「あらかじめ指定した候補のすべての組み合わせを試す」「格子状に探索する」「全探索」といったキーワードが出たら、正解は「グリッドサーチ」です! ランダムサーチやベイズ最適化(Optunaなど)との違い、そして「交差検証(GridSearchCV)とセットで使う」という実務テクニックまであわせて押さえておきましょう!

【DS検定】軽量モデルの必須テクニック!「グループ畳み込み」の仕組み

画像認識モデル(CNN)の計算量とパラメータ数を劇的に減らすために使われる発展的なテクニックが「グループ畳み込み(Grouped Convolution)」です。モバイル端末などで高速にAIを動かす「軽量化モデル」のバックボーンとなる重要構造を整理しましょう!

1. 【 問題 】

通常の畳み込み(Normal Convolution)ではすべての入力チャネルと出力チャネルが全結合のように計算されるのに対し、入力チャネルと出力チャネルをいくつかの「グループ」に分割し、グループ内で独立して畳み込み処理を行うことで、パラメータ数と計算量を削減する手法を何と呼ぶでしょうか?

① グループ畳み込み(Grouped Convolution)
② 点別畳み込み(Pointwise Convolution)
③ 転置畳み込み(Transposed Convolution)
④ 空白畳み込み(Dilated Convolution)


2. 【 解答 】

正解: ① グループ畳み込み(Grouped Convolution)

3. 整理:なぜ計算量とパラメータ数が減るのか?

通常の畳み込みとグループ畳み込みの違いは、「チャネル間の計算をどこまでやるか」です。

【 通常の畳み込み vs グループ畳み込み 】

通常の畳み込み:
すべての入力チャネル(例:64個)とすべての出力チャネル(例:64個)が密に結合して計算されます。

グループ畳み込み(例:G 個のグループに分割):
入力チャネルと出力チャネルを G 個のグループに切り分けます。
・グループ1:入力1〜32チャネル => 出力1〜32チャネルのみ計算
・グループ2:入力33〜64チャネル => 出力33〜64チャネルのみ計算

最大のメリット:
グループをまたぐ計算が発生しないため、パラメータ数および計算量が「1 / G(グループ数分の一)」に激減します!

4. 応用・派生技術:Depthwise Separable Convolution

グループ畳み込みの概念を極限まで押し進めたのが、スマホ用AIの定番モデル「MobileNet」などで使われる超重要技術です。

手法名仕組み・特徴
Depthwise Convolution
(チャネルごとの畳み込み)
グループ数を「入力チャネル数と同じ(G = チャネル数)」にした極限のグループ畳み込み。1つのチャネルに1つのフィルタだけを適用するため、空間方向の計算量が最小化される。
Depthwise Separable
Convolution
上記の「Depthwise Convolution(空間方向)」と「1×1 Pointwise Convolution(チャネル方向)」を分離して組み合わせる手法。MobileNetの超軽量化の秘密。

5. DS検定形式:実戦4択クイズ

问:畳み込みニューラルネットワーク(CNN)における「グループ畳み込み」に関する記述として、最も適切なものはどれか。

① グループ数を増やすほど、モデル全体のパラメータ数と計算量は増加し、推論速度が大幅に低下する。
② 入力チャネルと出力チャネルを複数のグループに分割し、グループをまたぐ計算を無くすことで、パラメータ数と計算量を削減できる。
③ グループ畳み込みは画像解像度を縦横に拡大(アップサンプリング)するための特殊な層であり、軽量化目的では使われない。
④ 1つの画像をRGBの3色グループに分ける操作のことであり、中間層(隠れ層)のチャネルには適用できない。

【 正解: ② 】

解説: グループ畳み込みの基本特徴を問う問題です。
②が正解です。グループに分割して相互の計算を独立させることで効率化します。
①グループ数を増やすと、パラメータ数と計算量は「1 / グループ数」に減少します。
③アップサンプリングに使われるのは「転置畳み込み(Transposed Convolution / Deconvolution)」などです。
④RGB画像だけでなく、中間層の数十〜数千チャネルに対しても自由にグループ分割を適用できます。


6. まとめ

DS検定やG検定で「チャネルをいくつかのグループに分ける」「グループごとに独立して畳み込む」「計算量やパラメータ数を1/Gに減らす」といったキーフレーズが出たら、正解は「グループ畳み込み」です! さらにグループ数を極限まで増やした「Depthwise Convolution」や「MobileNet」とも深く関連していますので、セットで押さえておきましょう!

【DS検定】AIを小さく・速く!軽量化技術「知識蒸留」の仕組み

パラメータ数が何千億もある巨大なAIモデル(大規模言語モデルなど)は、高精度ですが「動作が重い」「メモリを大量に消費する」「動かすコストが高い」という課題があります。この高精度な巨大モデルの知識を、軽量な小型モデルへ引き継がせる技術が「知識蒸留(Knowledge Distillation)」です!

1. 【 問題 】

ディープラーニングにおいて、高精度だが巨大で計算コストの大きい「教師モデル(Teacher Model)」の出力や内部表現を学習させることで、性能を極力維持したままパラメータ数が少ない軽量な「生徒モデル(Student Model)」を作成するモデル圧縮手法を何と呼ぶでしょうか?

① 知識蒸留(Knowledge Distillation)
② ファインチューニング(Fine-Tuning)
③ 転移学習(Transfer Learning)
④ 量子化(Quantization)


2. 【 解答 】

正解: ① 知識蒸留(Knowledge Distillation)

3. 整理:なぜ単に正解ラベルを学ばせるより賢くなるのか?

知識蒸留では、生徒モデルは「単なる正解データ(0か1か)」ではなく、「教師モデルが出した予測確率のニュアンス(暗黙知)」までまるごと学習します。

【 知識蒸留の学習イメージ(例:画像分類) 】

[入力データ:犬の写真]

通常の学習(正解ラベル):
犬:100% / 猫:0% / 車:0% (単なる一丸暗記)

教師モデル(巨大AI)の出力(ソフトターゲット):
犬:85% / 猫:14% / 車:1%

ポイント:
教師モデルは「正解は犬だけど、車よりは猫にちょっと似ているよね」というデータ同士の類似性(ニュアンスや余白)を確率として出力しています。生徒モデル(小型AI)はこの細かい確率分布(ソフトな正解)を目標にして学習することで、小さなサイズでありながら巨大モデルに近い賢さや判断基準を獲得できるのです。

4. 試験・実務でよく出る「モデル軽量化テクニック」一覧

DS検定やG検定では、知識蒸留と並んで以下のモデル圧縮技術との違いがよく問われます。

手法名仕組み・特徴
知識蒸留
(Distillation)
巨大な「教師モデル」の知識(予測確率など)を、より小さな「生徒モデル」に学習させて引き継がせる手法。
量子化
(Quantization)
重みの数値(パラメータ)の精度を「32ビット浮動小数点(FP32)」から「8ビット整数(INT8)」などに粗くすることで、メモリ容量と計算量を削減する手法。
プルーニング
(Pruning / 枝刈り)
予測精度にほとんど影響を与えていない不要なパラメータや神経(ノード・重み)をカット(削減)してモデルを小さくする手法。

5. DS検定形式:実戦4択クイズ

問:ディープラーニングモデルの圧縮・軽量化手法である「知識蒸留(Knowledge Distillation)」に関する記述として、最も適切なものはどれか。

① 知識蒸留を行うと、生徒モデルのパラメータ数が教師モデルよりも大幅に増加するため、学習にはより高性能な環境が必要となる。
② 知識蒸留では、教師モデルが出力する確率分布などの情報(ソフトラベル)を生徒モデルの目標として利用することで、モデルの小型化と高精度化を両立する。
③ 知識蒸留とは、モデルの重みパラメータのビット数を減らすことで計算精度を落とし、動作速度を向上させる手法である。
④ 知識蒸留は、正解ラベルが存在しない完全な「教師なし学習」のアルゴリズムであり、教師モデルという概念は存在しない。

【 正解: ② 】

解説: 知識蒸留の正しい定義を問う問題です。
②が正解です。教師モデルの出力(ソフトな確率値)を目標にして生徒モデルを鍛えます。
①生徒モデル(Student)は教師モデル(Teacher)よりもパラメータ数が「少ない(小さい)」モデルです。
③は「量子化(Quantization)」の説明です。
④教師モデルの出力を目標として学習するため、「教師あり(または自己教師あり)」の枠組みとなります。


6. まとめ

DS検定やAI関連の資格試験で、「巨大なモデルから小さなモデルへ知識を移転」「教師モデルと生徒モデル」「モデルの軽量化・高速化」といったキーワードが出たら、迷わず「知識蒸留」を選びましょう! 実務でもスマホ端末での推論やレスポンス改善に欠かせない必須技術ですので、セットで押さえておきましょう!