忍者ブログ
統計、機械学習、AIを学んでいきたいと思います。 お役に立てば幸いです。

【DS検定対策】「相関」と「因果」は違う!統計的因果推論の基本

データ分析で最も重要な問いの一つが、「その結果は本当にその施策が原因で起きたのか?」ということです。データ同士の「単なる相関関係」と「本当の因果関係」を明確に見極め、正しい意思決定を行うための手法、それが「統計的因果推論」です。

1. 【 問題 】

データ分析において、変数間の単純な関連性(相関関係)だけでなく、交錯因子などのバイアスを取り除いて「ある原因(介入)が特定の結果を引き起こしたか」という因果関係を統計的に推論する枠組みを何と呼ぶでしょうか?

① 統計的因果推論(Causal Inference)
② 主成分分析(PCA)
③ アソシエーション分析
④ 因子分析(Factor Analysis)


2. 【 解答 】

正解: ① 統計的因果推論(Causal Inference)

3. 整理:「相関関係」と「因果関係」の決定的な違い

2つのデータの動きが似ているからといって、そこに原因と結果の関係があるとは限りません。

【 よくある間違い:擬似相関(見せかけの相関) 】

「アイスクリームの売上が増えると、水難事故件数が増える」

・相関関係:あり(アイスが売れる時期に、水難事故も増えている)
・因果関係:なし(アイスを食べたから事故が起きたわけではない)

真の原因(交錯因子):気温の上昇(夏)
「気温が高い」から「アイスが売れる」し、同時に「海や川で泳ぐ人が増えて事故が増える」だけです。この気温のような第3の変数を「交錯因子(錯乱因子)」と呼びます。

4. 試験に出る!因果推論の主なアプローチ

統計的因果推論では、交錯因子の影響を排除して「純粋な効果」を測定するために様々な手法が使われます。

手法・概念仕組み・特徴
ランダム化比較試験
(RCT / A/Bテスト)
対象を無作為(ランダム)に2グループに分け、片方だけに施策を行う。因果推論の黄金律(最も信頼性が高い)とされる手法。
傾向スコアマッチング
(Propensity Score)
ランダム分けができない過去データ(観察データ)において、似た属性(背景)を持つデータ同士をペアにして比較し、バイアスを減らす手法。
反実仮想モデル
(Counterfactual)
「もしこの施策を行わなかったら(もし〜だったら)どうなっていたか?」という「起こらなかった世界の IF 」を推測して効果を比較する考え方。

5. DS検定形式:実戦4択クイズ

問:統計的因果推論およびデータ分析における「相関」と「因果」に関する記述として、最も適切なものはどれか。

① 2つの変数間に高い相関関係(相関係数が 0.9 以上)が認められれば、必ずそこには因果関係が存在すると判定してよい。
② 交錯因子(第3の変数)が存在する場合、実際には因果関係がない2つの変数の間に、あたかも因果関係があるかのような相関が生じることがある。
③ ランダム化比較試験(RCT)を行うと交錯因子の影響が極めて大きくなるため、観察データを用いた回帰分析の方が因果推論に適している。
④ 「あるキャンペーンを実施した結果、売上が上がった」ことを証明するには、キャンペーン期間中の売上データのみを集計すれば十分である。

【 正解: ② 】

解説: 因果推論の基本思想を問う本質的な問題です。
②が正解です。交錯因子の存在によって生じる見せかけの相関を「擬似相関」と呼びます。
①相関係数がどれだけ高くても、擬似相関の可能性があるため因果関係の証明にはなりません。
③RCTはランダム割り当てによって交錯因子を均等化できるため、因果推論において最も理想的な手法です。
④キャンペーンを実施しなかった場合(反実仮想)の売上と比較しなければ、単なる季節変動などの影響と区別できません。


6. まとめ

DS検定や実務において、「単なる相関と因果の違い」「交錯因子の除去」「A/Bテストや傾向スコア」といったテーマが出たら、正解は「統計的因果推論」に関連する知識です。 データを扱うデータサイエンティストにとって、「相関関係=因果関係ではない」という視点は最も重要な倫理・スキルの一つですので、しっかりと押さえておきましょう!


PR

【DS検定対策】評価のブレを防ぐ!「交差検証(クロスバリデーション)」の仕組み

機械学習モデルの精度を測る際、データを1回だけ分ける「ホールドアウト法」では「偶然のデータの偏り(分け方の運)」で評価が変わってしまうリスクがありました。その弱点を解決する標準的な評価手法が「交差検証(クロスバリデーション)」です。仕組みと特徴を整理しましょう!

1. 【 問題 】

手元にある全データを n 等分(または k 等分)に分割し、「n-1 組のデータで学習し、残りの 1 組でテスト(検証)」という処理を、テスト役を順番に交代しながら n 回繰り返して平均精度を出す評価手法は何でしょうか?

① ホールドアウト法
② 交差検証(クロスバリデーション / k-fold Cross Validation)
③ ブートストラップ法
④ 主成分分析(PCA)


2. 【 解答 】

正解: ② 交差検証(クロスバリデーション / k-fold Cross Validation)

3. 整理:交差検証のローテーション構造(k=4 の例)

交差検証では、全データを「捨ててしまうデータ」を作らず、すべてのデータを1回ずつテスト用として活用します。

【 4分割交差検証(4-fold Cross Validation)の流れ 】

データを[グループA][グループB][グループC][グループD]の4つに分割

・1回目: B, C, D で学習 => A でテスト (精度1を計算)
・2回目: A, C, D で学習 => B でテスト (精度2を計算)
・3回目: A, B, D で学習 => C でテスト (精度3を計算)
・4回目: A, B, C で学習 => D でテスト (精度4を計算)

★ 最終評価 = 精度1 〜 精度4 の平均値

全データの評価結果を平均化するため、特定データの偏りに影響されにくく、信頼性の高い「汎化性能(未知データへの強さ)」を測定できます。


4. 試験で問われる発展手法・派生パターン

DS検定やG検定では、通常の交差検証に加えて以下の2つの派生テクニックが頻出です。

派生手法名特徴・使いどころ
層化 k 分割交差検証
(Stratified k-fold)
分類問題で正解ラベルの比率(例:病気 5%:健康 95%)が偏っている場合、各分割グループ内のラベル比率が元のデータと同じになるように分割して交差検証を行う手法。分類問題の超定番。
リーブワンアウト交差検証
(LOOCV:Leave-One-Out)
データ数が極めて少ない場合、「1件だけをテスト用にし、残り全件で学習」する作業をデータ件数(N回)分繰り返す手法。計算量は極めて大きいが、データを極限まで無駄にしない。

5. DS検定形式:実戦4択クイズ

問:交差検証(クロスバリデーション)に関する記述として、最も適切なものはどれか。

① 分割数 k の値を大きく(例:k=5 から k=10 へ)するほど、モデルの学習(トレーニング)回数が減るため、全体の計算時間は短くなる。
② 交差検証を行う主な目的は、学習データの件数を増やすことで最終的なモデルのパラメータを直接更新・強化することである。
③ ホールドアウト法と比較して、特定のデータ分割の偏りによる評価精度のばらつき(影響)を抑え、より客観的なモデル性能の推計が可能になる。
④ 時系列データ(株価や売上予測など)に対して交差検証を行う場合、過去と未来のデータを無作為(ランダム)に混ぜ合わせて分割することが推奨される。

【 正解: ③ 】

解説: 交差検証のメリット・注意点を問う標準問題です。
③が正解です。評価の平均をとることでデータの偏りを打ち消します。
①分割数 k を大きくすると学習回数(k回)が増えるため、計算時間は長くなります。
②交差検証はあくまで「モデル性能の評価・パラメータチューニングの手元比較」のための手法であり、モデルそのものを強化する手順ではありません。
④時系列データで未来のデータを過去の学習に混ぜ込むと「未来のカンニング(データリーク)」になるため、時間の順序を保った特殊な交差検証(TimeSeriesSplit)を使う必要があります。


6. まとめ

DS検定において「データを n 個に分け、入れ替えて n 回テスト」「平均で評価」「信頼性が高い」といったフレーズが出たら、迷わず「交差検証(クロスバリデーション)」を選びましょう! 前回の「ホールドアウト法」との違いや、データ偏りを防ぐ「層化 k 分割(Stratified k-fold)」とあわせてセットで得点源にしておきましょう!


【DS検定対策】モデル評価の基本!「ホールドアウト法」の仕組みと注意点

機械学習モデルを作った際、そのモデルが「未知のデータに対しても正しく予測できるか(汎化性能)」を評価することは必須です。その最も基本的で直感的な手法が「ホールドアウト法」です。仕組みと特徴を整理しましょう!

1. 【 問題 】

手元にある全データを「学習用(トレーニングデータ)」と「検証用(テストデータ)」の2つに分割し、学習用データのみでモデルを構築した後、検証用データを用いてそのモデルの予測性能を評価する手法を何と呼ぶでしょうか?

① ホールドアウト法
② k分割交差検証(k-fold Cross Validation)
③ リーブワンアウト法(LOOCV)
④ ブートストラップ法


2. 【 解答 】

正解: ① ホールドアウト法

3. 整理:ホールドアウト法のイメージと分割割合

なぜデータをわざわざ2つに分けるのでしょうか?それは、「学習に使ったデータをそのままテストに使っても、単に答えを暗記しているだけ(過学習)かどうかが分からないから」です。

【 ホールドアウト法の分割イメージ 】

[ 手元にあるすべてのデータ ]
├─ 学習用データ(Train Data): 70%〜80%
│ → モデルのパラメータを学習させるために使う

└─ 検証用データ(Test Data): 20%〜30%
→ 学習には一切使わず、「初見の問題」として精度チェックに使う

分割時の注意点(層化抽出:Stratified Sampling):
分類問題などで、データ内のクラス割合(例:病気あり1%・なし99%)が偏っている場合、ランダムに分けるとテストデータに病気データが1件も入らないリスクがあります。そのため、「元のデータのクラス比率を維持したまま2つに分ける(層化分割)」のが実務の鉄則です。


4. ホールドアウト法の「メリット」と「デメリット」

試験では、ホールドアウト法と「交差検証(クロスバリデーション)」の比較が非常によく出題されます。

評価手法メリットデメリット
ホールドアウト法 データ分割と学習が1回で済むため、計算時間が短くシンプル。大規模データ(ディープラーニング等)に向く。 データの「分かれ目(運)」によって評価結果が偶然ブレやすい。データ量が少ない場合は不向き
k分割交差検証
(Cross Validation)
データをk個に分け、テスト役を交代しながらk回評価して平均をとるため、評価が安定し信頼性が高い モデルの学習をk回繰り返すため、計算時間がk倍かかる

5. DS検定形式:実戦4択クイズ

問:機械学習モデルの評価手法に関する記述として、最も適切なものはどれか。

① ホールドアウト法は、手元にあるデータを学習用と検証用に分けるため、学習用データとして使えるデータ量が全データ量よりも少なくなってしまう欠点がある。
② ホールドアウト法では、検証用データを一度学習に組み込んで精度を確かめた後、再度学習用データに戻して最終モデルを作成するのが一般的である。
③ データ量が極めて少ない場合、交差検証よりもホールドアウト法を採用した方がモデルの評価精度が安定する。
④ ホールドアウト法において、モデルの精度が一番高くなるまで学習用と検証用の分割パターンを何度も変更して評価を繰り返す操作は、正しい評価手順である。

【 正解: ① 】

解説: ホールドアウト法の本質的な特徴・弱点を問う問題です。
①が正解です。データをテスト用にプールしておく分、学習に使えるデータが減ってしまうのがホールドアウト法のデメリットです。
②検証用データは学習に絶対混ぜてはいけません(データリークの原因になります)。
③データ量が少ない場合は、評価が安定する「交差検証(Cross Validation)」を使うべきです。
④分割パターンを変えて一番良い結果を選ぶ行為は「テストデータに対する過学習」を引き起こすためNGです。


6. まとめ

DS検定やG検定において「データを学習用と検証用の2つに分ける」「処理が高速だがデータ偏りの影響を受けやすい」というキーワードが出たら、正解は「ホールドアウト法」です。 データ量が十分に大きいときはホールドアウト法、データが少ないときは交差検証(クロスバリデーション)、という使い分けもセットで押さえておきましょう!

【Qiskit】CNOTゲートの仕組みを徹底検証!制御ビットで対象が変わる動きを確認しよう

前回までに、1量子ビットでの重ね合わせと測定、そしてQiskit標準シミュレータ(BasicSimulator)を使った実行方法を学びました。

今回はステップアップして、**2量子ビットを使った量子プログラミングの基本パーツ「CNOTゲート(制御NOTゲート)」**の動きを検証してみたいと思います。CNOTゲートが「条件によって標的を反転させる」という挙動を、実際のコードとシミュレーション結果から確かめてみましょう。

1. CNOTゲートとは?

CNOTゲートは、量子コンピュータにおける「もし〜なら〜する(if文)」のような役割を持つ超重要パーツです。2つの量子ビットを使い、次のようなルールで動作します。

  • 制御ビット(Control):条件を決める側の量子ビットです。
  • 標的ビット(Target):制御ビットの状態に応じて値が反転するかどうか変わる側の量子ビットです。
  • 制御が「0」の場合:標的ビットは何もしません(そのまま)。
  • 制御が「1」の場合:標的ビットの値を反転(0なら1に、1なら0に)させます。

2. 比較検証のサンプルコード

制御ビットが「0」の場合と「1」の場合で、CNOTゲートを通った後に標的ビットがどう変わるのかを比較するコードを作成します。

from qiskit import QuantumCircuit
from qiskit.providers.basic_provider import BasicSimulator

simulator = BasicSimulator()

print("=== パターンA: 制御ビットが「0」の場合 ===")
qc_a = QuantumCircuit(2, 2)
# 制御ビット(0番目)は何もしない(初期状態の「0」のまま)
qc_a.cx(0, 1)  # CNOTゲート適用(制御=0, 標的=1)
qc_a.measure(0, 0)
qc_a.measure(1, 1)

result_a = simulator.run(qc_a, shots=1000).result()
print(f"回路図:\n{qc_a.draw(output='text')}")
print(f"実行結果: {result_a.get_counts()}\n")

print("=== パターンB: 制御ビットが「1」の場合 ===")
qc_b = QuantumCircuit(2, 2)
qc_b.x(0)      # Xゲートで制御ビット(0番目)を「1」にする
qc_b.cx(0, 1)  # CNOTゲート適用(制御=0, 標的=1)
qc_b.measure(0, 0)
qc_b.measure(1, 1)

result_b = simulator.run(qc_b, shots=1000).result()
print(f"回路図:\n{qc_b.draw(output='text')}")
print(f"実行結果: {result_b.get_counts()}")

3. 実際の実行結果と回路図

ターミナルでスクリプトを実行すると、それぞれのパターンで以下のような回路図と実行結果が得られます。

=== パターンA: 制御ビットが「0」の場合 ===
回路図:
         ┌─┐   
q_0: ──■──┤M├───
     ┌─┴─┐└╥┘┌─┐
q_1: ┤ X ├─╫─┤M├
     └───┘ ║ └╥┘
c: 2/══════╩══╩═
           0  1 
実行結果: {'00': 1000}

=== パターンB: 制御ビットが「1」の場合 ===
回路図:
     ┌───┐    ┌─┐   
q_0: ┤ X ├──■──┤M├───
     └───┘┌─┴─┐└╥┘┌─┐
q_1: ─────┤ X ├─╫─┤M├
         └───┘ ║ └╥┘
c: 2/═══════════╩══╩═
                0  1 
実行結果: {'11': 1000}

4. 結果の解説:CNOTゲートの動き

得られた結果を整理してみましょう。

  • パターンA(制御が「0」):制御ビットが 0 のため、標的ビットは反転せずそのまま 0 を維持しました。そのため、結果はすべて 00(1,000回)になっています。
  • パターンB(制御が「1」):Xゲートで制御ビットを 1 にしたため、CNOTゲートが働いて標的ビットが反転(0 から 1 へ)しました。その結果、両方とも 1 になり、結果はすべて 11(1,000回)になっています。
CNOTゲートの「条件分岐」動作を完全確認!
制御ビットの値(0か1か)によって、もう一方の標的ビットの運命が変わる様子がシミュレーションでハッキリと証明できました。

まとめ

今回は、2量子ビットの基本操作であるCNOTゲートの挙動をコードとシミュレーションで確認しました。制御ビットの状態に応じて標的が変わる仕組みがよく分かったと思います。このCNOTゲートの組み合わせこそが、量子もつれ(エンタングルメント)を生み出す鍵になります!


【DS検定対策】見た目に騙されるな!「多項式回帰」が線形回帰と呼ばれる理由

データ分析の試験で最も多くの人が引っかかる超・トラップ問題があります。それが「説明変数を2乗や3乗(冪乗)したモデルは、線形回帰か?非線形回帰か?」という問いです。結論から言うと、これは「線形回帰」に分類されます!なぜそうなるのか、理由をスッキリ整理しましょう。

1. 【 問題 】

説明変数 x の2乗や3乗といった冪乗(多項式)を含む回帰モデル「 y = b0 + b1*x + b2*(x^2) 」に関する説明として、最も適切なものはどれか。

① グラフを描くと曲線になるため、「非線形回帰モデル」に分類される。
② 説明変数 x に対して曲線の関係を表すが、推定するパラメータ(係数 b)に関して一次式であるため、「線形回帰モデル」に分類される。
③ 最小二乗法で解くことができず、必ずディープラーニングなどの複雑な数値計算アルゴリズムが必要となる。
④ パラメータの最適化が不可能であるため、実務では使用してはならない。


2. 【 解答 】

正解: ② 説明変数 x に対して曲線の関係を表すが、推定するパラメータ(係数 b)に関して一次式であるため、「線形回帰モデル」に分類される。

3. 整理:なぜ曲線なのに「線形(Linear)」なのか?

「線形=まっすぐな直線」というイメージが強いため混乱しがちですが、統計学における「線形」の意味を正しく理解することがポイントです。

【 「線形」の定義の違い 】

変数の形(x)で見ると
x^2 や x^3 が入っているため、グラフを描くと綺麗な「曲線」を描きます。

パラメータの形(係数 b)で見ると
係数 b0, b1, b2 はすべて「1乗(掛け算・割り算・指数になっていない)」で並んでいます。

決定的な結論:
統計学における「線形回帰」とは、「パラメータ(係数 b)に関して線形(1乗の足し算)であること」を指します!
そのため、x^2 を「新しい別の変数 z」と置き換えれば、単なる普通の「重回帰分析」と全く同じ形になるため、「線形回帰」の一種(多項式回帰)として扱われるのです。

4. 本物の「非線形回帰」とはどんなもの?

では、逆にどういう式が「非線形回帰」になるのでしょうか?比較して覚えておきましょう。

分類モデルの構造(イメージ)特徴
線形回帰
(多項式回帰含む)
y = b0 + b1*x + b2*(x^2)
※パラメータ b はすべて1乗の足し算
x が何乗になっていても、パラメータ b が1乗なら線形回帰。最小二乗法で一発で解ける。
非線形回帰 y = b0 * e^(b1 * x)
※パラメータ b が指数の肩に乗っているなど
パラメータ自体が指数や複雑な関数の内側に入っている。最小二乗法では解けず、繰返し計算(数値最適化)が必要。

5. DS検定形式:実戦4択クイズ

問:多項式回帰(説明変数に2乗や3乗の項を含める線形回帰)を実務で適用する際の注意点として、最も適切なものはどれか。

① 次数(2乗、3乗、4乗…)を大きく増やしていくほど、モデルの表現力が高まり、未知のデータに対する予測精度(汎化性能)は常に向上する。
② 次数を大きくしすぎると、学習データに過剰に適合してしまい、「過学習(オーバーフィッティング)」を起こしやすくなる。
③ 多項式回帰は線形モデルであるため、どれだけ次数を増やしても過学習を起こすことは構造上あり得ない。
④ 説明変数の2乗の項を追加すると、入力データの次元数が減少し、モデルが単純化される。

【 正解: ② 】

解説: 多項式回帰の実務的な注意点を問う良問です。
次数をどんどん大きくしていく(例:10乗、20乗…)と、モデルのグラフは学習データの全ポイントを無理やり通ろうとしてグニャグニャに曲がりくねり、「過学習(オーバーフィッティング)」を起こします。
実務では、適切な次数を選ぶか、Lasso・Ridgeなどの正則化手法と組み合わせて過学習を防ぐ必要があります。


6. まとめ

DS検定や統計検定において、「説明変数が冪乗(xの2乗など)になっているモデルは何か?」と聞かれたら、罠にハマらず「線形回帰(多項式回帰)」と答えられるようにしておきましょう! 「線形か非線形かは、x の形ではなく、パラメータ(係数)の形で決まる」という本質を押さえておけば、どんな引っかけ問題も怖くありません!