忍者ブログ
統計、機械学習、AIを学んでいきたいと思います。 お役に立てば幸いです。

【DS検定対策】見た目に騙されるな!「多項式回帰」が線形回帰と呼ばれる理由

データ分析の試験で最も多くの人が引っかかる超・トラップ問題があります。それが「説明変数を2乗や3乗(冪乗)したモデルは、線形回帰か?非線形回帰か?」という問いです。結論から言うと、これは「線形回帰」に分類されます!なぜそうなるのか、理由をスッキリ整理しましょう。

1. 【 問題 】

説明変数 x の2乗や3乗といった冪乗(多項式)を含む回帰モデル「 y = b0 + b1*x + b2*(x^2) 」に関する説明として、最も適切なものはどれか。

① グラフを描くと曲線になるため、「非線形回帰モデル」に分類される。
② 説明変数 x に対して曲線の関係を表すが、推定するパラメータ(係数 b)に関して一次式であるため、「線形回帰モデル」に分類される。
③ 最小二乗法で解くことができず、必ずディープラーニングなどの複雑な数値計算アルゴリズムが必要となる。
④ パラメータの最適化が不可能であるため、実務では使用してはならない。


2. 【 解答 】

正解: ② 説明変数 x に対して曲線の関係を表すが、推定するパラメータ(係数 b)に関して一次式であるため、「線形回帰モデル」に分類される。

3. 整理:なぜ曲線なのに「線形(Linear)」なのか?

「線形=まっすぐな直線」というイメージが強いため混乱しがちですが、統計学における「線形」の意味を正しく理解することがポイントです。

【 「線形」の定義の違い 】

変数の形(x)で見ると
x^2 や x^3 が入っているため、グラフを描くと綺麗な「曲線」を描きます。

パラメータの形(係数 b)で見ると
係数 b0, b1, b2 はすべて「1乗(掛け算・割り算・指数になっていない)」で並んでいます。

決定的な結論:
統計学における「線形回帰」とは、「パラメータ(係数 b)に関して線形(1乗の足し算)であること」を指します!
そのため、x^2 を「新しい別の変数 z」と置き換えれば、単なる普通の「重回帰分析」と全く同じ形になるため、「線形回帰」の一種(多項式回帰)として扱われるのです。

4. 本物の「非線形回帰」とはどんなもの?

では、逆にどういう式が「非線形回帰」になるのでしょうか?比較して覚えておきましょう。

分類モデルの構造(イメージ)特徴
線形回帰
(多項式回帰含む)
y = b0 + b1*x + b2*(x^2)
※パラメータ b はすべて1乗の足し算
x が何乗になっていても、パラメータ b が1乗なら線形回帰。最小二乗法で一発で解ける。
非線形回帰 y = b0 * e^(b1 * x)
※パラメータ b が指数の肩に乗っているなど
パラメータ自体が指数や複雑な関数の内側に入っている。最小二乗法では解けず、繰返し計算(数値最適化)が必要。

5. DS検定形式:実戦4択クイズ

問:多項式回帰(説明変数に2乗や3乗の項を含める線形回帰)を実務で適用する際の注意点として、最も適切なものはどれか。

① 次数(2乗、3乗、4乗…)を大きく増やしていくほど、モデルの表現力が高まり、未知のデータに対する予測精度(汎化性能)は常に向上する。
② 次数を大きくしすぎると、学習データに過剰に適合してしまい、「過学習(オーバーフィッティング)」を起こしやすくなる。
③ 多項式回帰は線形モデルであるため、どれだけ次数を増やしても過学習を起こすことは構造上あり得ない。
④ 説明変数の2乗の項を追加すると、入力データの次元数が減少し、モデルが単純化される。

【 正解: ② 】

解説: 多項式回帰の実務的な注意点を問う良問です。
次数をどんどん大きくしていく(例:10乗、20乗…)と、モデルのグラフは学習データの全ポイントを無理やり通ろうとしてグニャグニャに曲がりくねり、「過学習(オーバーフィッティング)」を起こします。
実務では、適切な次数を選ぶか、Lasso・Ridgeなどの正則化手法と組み合わせて過学習を防ぐ必要があります。


6. まとめ

DS検定や統計検定において、「説明変数が冪乗(xの2乗など)になっているモデルは何か?」と聞かれたら、罠にハマらず「線形回帰(多項式回帰)」と答えられるようにしておきましょう! 「線形か非線形かは、x の形ではなく、パラメータ(係数)の形で決まる」という本質を押さえておけば、どんな引っかけ問題も怖くありません!

PR