忍者ブログ
統計、機械学習、AIを学んでいきたいと思います。 お役に立てば幸いです。

【DS検定対策】外れ値をカットして実態を掴む!「トリム平均」の仕組み

すべての値を足して割る「平均値」は、極端な値(外れ値)が1つあるだけで数値が跳ね上がってしまいます。その弱点を克服するために、上下のデータを一定割合だけ切り落としてから計算するのがトリム平均です。

1. 【 問題 】

統計学において、データの集団から極端に大きい値(最大値側)と極端に小さい値(最小値側)を、あらかじめ決めた一定の割合(または個数)だけ除外した上で、残ったデータを用いて算出する平均値のことを何と呼ぶでしょうか?

① 加重平均
② 幾何平均
③ トリム平均(調整平均)
④ 移動平均


2. 【 解答 】

正解: ③ トリム平均(調整平均)

3. 整理:トリム平均の計算イメージ

例えば、スポーツの審査(フィギュアスケートやスキージャンプなど)で、審判全員がつけた点数のうち「最高点」と「最低点」を除外して残りの平均をとるルールがあります。これがまさにトリム平均の思想です。

【 具体例:10%トリム平均の場合 】

元のデータ:データを大きさ順に並べます。
[ 10, 45, 50, 52, 55, 56, 58, 60, 62, 990 ] (データ数 10個)

トリム処理:上下からそれぞれ10%(1個ずつ)をカットします。
[ 10 ][ 990 ] を除外!

平均を計算:残った中間の8個だけで平均を計算します。
[ 45, 50, 52, 55, 56, 58, 60, 62 ] の平均 = 54.75

--------------------------

ここがメリット:
普通に平均をとると「143.8」になってしまい実態が見えなくなりますが、トリム平均を使うことで、最後の「990」という異常値(外れ値)の影響を完全にシャットアウトし、集団の本来の特徴をきれいに抽出できます。

4. 代表値としての「強さ」の位置づけ

データが外れ値に対してどれくらい強いか(影響を受けにくいか)という性質を「頑健性(ロバスト性)」と呼びます。今回のトリム平均は、ちょうど以下のような中間的なキャラクターを持っています。

平均値:すべてのデータを使う(頑健性は一番低い
トリム平均:端っこだけを削って平均をとる(頑健性は中くらい
中央値:真ん中の1点(または2点)しか使わない(頑健性は一番高い


5. DS検定形式:実戦4択クイズ

問:データの分布が、外れ値のない綺麗な左右対称(正規分布)であるとき、「平均値」「中央値」「トリム平均」の3つの値の関係として、最も適切なものはどれか。

① 平均値 < トリム平均 < 中央値
② 中央値 < トリム平均 < 平均値
③ 3つの値はほぼ一致する
④ トリム平均だけが全く異なる値になる

【 正解: ③ 】

解説: 外れ値がなく、左右が綺麗に対称な分布であれば、上下を均等に削っても中心のバランスは変わりません。そのため、これら3つの代表値はほぼ同じ値に収束します。外れ値がある非対称な分布のときにこそ、トリム平均はその真価を発揮します。


6. まとめ

DS検定において「一定割合の異常値(外れ値)を排除して残りで平均を算出する」という記述が登場したら「トリム平均(調整平均)」です。実務のデータクレンジングや集計ロジックでも頻出の手法ですので、平均値・中央値との違いを意識して整理しておきましょう!

PR

【DS検定対策】「わざわざ回答する人」の偏り!自己選択バイアスの罠

「アンケートにご協力ください」と言われて、進んで回答してくれるのはどんな人でしょうか?そこには最初から強い偏りが存在します。それが自己選択バイアスです。

1. 【 問題 】

統計調査や実験において、調査主体がランダムに対象者を選ぶ(無作為抽出する)のではなく、対象者が「自分の意思で進んで参加(自己選択)する」ことによって、集まったデータに強い偏りが生じる現象を何と呼ぶでしょうか?

① 自己選択バイアス
② 観察者バイアス
③ 回避バイアス
④ 出版バイアス


2. 【 解答 】

正解: ① 自己選択バイアス

3. 整理:なぜ「自分の意思」がバイアスを生むのか?

インターネット上の多くのデータは、このバイアスの影響を強く受けています。実務でもよくある具体例を見てみましょう。

【 自己選択バイアスの具体例 】

事例1:ECサイトの製品レビュー(星評価)
ある商品のレビューを見ると、「星5(大満足)」と「星1(大不満)」ばかりで、中間の星3が極端に少ない。
:普通に満足して何も不満がない「大多数のユーザー」は、わざわざレビューを書くという面倒な行動を起こしません。レビューを書くのは「猛烈に感動した人」か「激怒している人」だけになりがちです(自己選択)。

事例2:ネットの政治世論調査
特定のニュースサイトやSNS上で「〇〇政策に賛成ですか?」と任意のアンケートを取ったところ、賛成が90%になった!
:そのサイトやSNSを普段から利用しており、かつ「そのテーマに強い関心があってわざわざ投票ボタンを押した人」だけの意見に偏っています。日本全体の世論とは大きくかけ離れる危険があります。

4. これまで学んだバイアスとの位置づけ

データ収集の偏りを表す「選択バイアス(Selection Bias)」という大きな引き出しの中に、これまで学んだ重要用語が以下のように整理されます。

脱落バイアス:追跡の「途中」で、対象者がいなくなってしまう偏り。
欠測値バイアス:回答の拒否やエラーで、データが「空欄(NULL)」になる偏り。
自己選択バイアス:データの「入り口」で、特定の熱量を持った人だけが自発的に集まる偏り。


5. DS検定形式:実戦4択クイズ

問:自己選択バイアスを防ぎ、母集団の実態を正しく推測するために、標本調査において最も重視されるサンプリング(データ抽出)の手法はどれか。

① 有意抽出(知り合いや集めやすい人から選ぶ)
② 無作為抽出(ランダムサンプリング)
③ ボランティアサンプリング(公募)
④ スノーボールサンプリング(紹介数珠つなぎ)

【 正解: ② 】

解説: 自発的な参加に頼る(③)と自己選択バイアスが直撃します。これを防ぐには、人間の意思が介在しない「無作為抽出(ランダムに選んで調査を依頼する)」を行うことが統計学的な大原則です。


6. まとめ

DS検定において「対象者が自発的に参加することによる偏り」というキーワードが出たら「自己選択バイアス」です。ネット上に転がっているビッグデータや口コミを分析する際には、常にこのバイアスが裏に潜んでいることを意識できるかどうかが、データサイエンティストの腕の見せ所です!

【DS検定対策】NULLデータの罠!「欠測値」が引き起こす分析の偏り

データベースでおなじみの「空欄(NULL)」。データが足りないからといって、そのレコードを無視して分析すると、結果が完全に歪んでしまうことがあります。それが欠測によるバイアスです。

1. 【 問題 】

アンケートや実験データにおいて、回答の記入漏れや測定エラーなどの「欠測値(欠損値)」が多く含まれる場合、その欠測が発生した原因を考慮せずに、単に欠測値のあるデータを除外して(残ったデータだけで)分析を行うことで、結果に偏りが生じる現象を何と呼ぶでしょうか?

① 欠測値バイアス(欠損による偏り)
② 確定バイアス
③ 回答バイアス
④ 出版バイアス


2. 【 解答 】

正解: ① 欠測値バイアス(欠損による偏り)

3. 整理:なぜ「空欄(NULL)」を除外すると偏るのか?

データが消えた(欠測した)のには、高確率で「人間的な理由やシステムのクセ」が存在します。それを無視して `IS NOT NULL` で削ると、集団の実態を見誤ります。

【 欠測がバイアスを生む具体例 】

事例:年収と顧客満足度のアンケート
あるサービスの顧客満足度を調査した際、「年収」の項目に空欄(欠測)が非常に多かった。
:実は「サービスに不満がある低所得層」が年収を書かずに回答(あるいは途中で離脱)していた場合、空欄をすべて除外して集計すると、「高所得者で、かつ満足している人」だけの偏ったデータになり、平均年収も満足度も実態より高く計算されてしまいます。

4. データサイエンティストはどう戦うか?(欠測値の処理)

試験や実務では、このバイアスを防ぐための「前処理(補完)」がセットで問われます。
1. リストワイズ削除(完全情報解析): 欠測があるレコードを丸ごと消す方法。欠測が完全にランダム(MCAR)でない限り、今回のようなバイアスが発生します。
2. 平均値補完 / 中央値補完: 空欄に、他のデータの平均値などを埋める方法。簡単ですが、データのばらつき(分散)が不自然に小さくなる弱点があります。
3. 多重代入法 / 予測モデルによる補完: 他のカラムの値から、機械学習などを使って空欄の数値を予測して埋める、より高度でバイアスが起きにくい手法です。


5. DS検定形式:実戦4択クイズ

問:データの欠測メカニズムにおいて、体重の重い人が体重の入力を拒否するように、「欠測するかどうかが、その欠測した値自体に依存している(他のデータを見ても欠測の理由を説明できない)」最も扱いが難しい欠測の性質を何と呼ぶか。

① MCAR(完全にランダムな欠測)   ② MAR(条件付きでランダムな欠測)   ③ MNAR(ランダムではない欠測)   ④ 確定論的欠測

【 正解: ③ 】

解説: 「隠したい数値そのもののせいでデータが消える」状態をMNAR(Missing Not At Random:ランダムではない欠測)と呼びます。これがまさに、今回問題にした「最も強いバイアス」を引き起こす原因となります。


6. まとめ

DS検定において「欠測値を含むデータが多い場合に、それを単純に除外することで生じる偏り」というテーマが出たら「欠測値バイアス」の罠を疑いましょう。データが「ない」ということ自体に重要な意味(メッセージ)が隠されているケースが多いことを、しっかり意識しておきましょう!


【DS検定対策】消えたデータの声を聴け!「脱落バイアス」の罠

分析対象者が途中でいなくなってしまう。その「離脱」自体が偏りを生み出す原因になる。それが脱落バイアスです。

1. 【 問題 】

データ収集や実験のプロセスにおいて、調査対象者が「途中で離脱(脱落)」したことにより、最後まで残った対象者だけのデータに偏りが生じ、正しい分析結果が得られなくなる現象(バイアス)を何と呼ぶでしょうか?

① 生存者バイアス(サバイバーシップ・バイアス)
② 脱落バイアス(アトリッション・バイアス)
③ 回答バイアス
④ 確証バイアス


2. 【 解答 】

正解: ② 脱落バイアス(アトリッション・バイアス)

3. 整理:なぜ「脱落」がバイアスを生むのか?

もし、脱落(離脱)が完全にランダムであれば大きな問題にはなりませんが、現実には「離脱するだけの理由」がそこにあるため、結果が歪みます。

【 ビジネスや研究での具体例 】

事例1:教育アプリの効果測定
難関資格の学習アプリで、1ヶ月継続した人の合格率が「90%」だった!
:実は「内容が難しすぎて挫折した人」が途中で大量に脱落(アンインストール)していた場合、最後まで残った「元から優秀な人」だけの結果を見ている可能性があります。

事例2:新薬の臨床試験
ある薬を3ヶ月服用してもらう実験で、副作用が非常に強かった人が途中で通院をやめてしまった。
:最終的に無事完走した人のデータだけを集計すると、「副作用が少なくて効果が高い魔法の薬」に見えてしまう危険があります。

4. 関連して押さえたい「選択バイアス」

脱落バイアスは、統計学における「選択バイアス(Selection Bias)」という大きな分類の1つです。
似た言葉に、歴史的なエピソード(爆撃から生還した戦闘機の補強など)で有名な「生存者バイアス」がありますが、生存者バイアスが「すでに生き残ったもの(結果)」だけを後から見てしまうことに対し、脱落バイアスは「時間の経過とともに進行形で対象者がいなくなっていくプロセス(縦断調査など)」に注目する点が特徴です。


5. DS検定形式:実戦4択クイズ

問:WebサービスのA/Bテストにおいて、新機能(B案)のページが非常に重く、読み込みに時間がかかったため、多くのユーザーが途中でブラウザを閉じて離脱してしまった。この状況で、ページを最後まで読み込んでコンバージョン(購入)したユーザーだけのデータで効果測定を行う際に発生するバイアスとして最も適切なものはどれか。

① 確証バイアス   ② 脱落バイアス   ③ 社会的妥当性バイアス   ④ 出版バイアス

【 正解: ② 】

解説: 「読み込みが遅くてイライラして途中で離脱した人」の存在を無視し、最後まで粘り強く待ってくれた熱狂的なユーザーだけの数値で評価してしまうため、これも典型的な脱落バイアスです。


6. まとめ

DS検定やデータ分析の現場において「途中で対象者が離脱したことで生じる偏り」という記述が出たら、それは「脱落バイアス」を指します。データサイエンスでは、手元にある綺麗なデータだけでなく、「消えてしまったデータ(離脱した人)の理由」にこそ、システム改善の最大のヒントが隠されていることを忘れないようにしましょう!

【DS検定対策】確率・統計の基礎!順列で考える「封筒を開ける順番」

データサイエンスの確率を学ぶ上で、基本となるのが「場合の数の数え上げ」です。今回は、3つの封筒を開ける順番が何通りあるか、画面で崩れない図解と一緒に整理しましょう。

1. 【 問題 】

中身の異なる3つの封筒(A、B、C)があります。これら3つの封筒を1つずつ順番にすべて開けるとき、その開ける順番の組み合わせ(並び順)は全部で何通りあるでしょうか?

① 3通り
② 6通り
③ 9通り
④ 27通り


2. 【 解答 】

正解: ② 6通り

3. 図解:開ける順番の全パターン(ツリー構造)

1番目、2番目、3番目に選ぶ封筒の選択肢と、その結果をシンプルな表で表しました。

1番目に開ける2番目に開ける3番目に開ける完成する並び順
封筒 A 封筒 B 封筒 C ① A → B → C
封筒 C 封筒 B ② A → C → B
封筒 B 放筒 A 封筒 C ③ B → A → C
封筒 C 封筒 A ④ B → C → A
封筒 C 封筒 A 封筒 B ⑤ C → A → B
封筒 B 封筒 A ⑥ C → B → A

表の右端(青い列)を上から数えると、全部で6通りの並び方があることが一目で分かります!


4. 整理:数式(積の法則)でのアプローチ

毎回表を描かなくても、以下のステップを掛け算(積の法則)することで簡単に計算できます。

【 ステップごとの選択肢の数 】

1番目に開ける封筒: まだ全部残っているので 3通り(AかBかC)
2番目に開ける封筒: 1枚開けたので、残りは 2通り
3番目に開ける封筒: 最後に残った 1通りのみ

--------------------------

$$3 \times 2 \times 1 = 6 \text{通り}$$

このように、ある数から1ずつ減らしながら1まで掛け合わせる計算を数学では「階乗(かいじょう)」と呼び、感嘆符を使って $3!$(3の階乗) と表記します。


5. DS検定形式:実戦4択クイズ

問:異なる5つのデータ(A、B、C、D、E)の中から、順序を考慮せずに「3つのデータ」を同時に選び出す(抽出する)組み合わせの数は何通りか。

① 10通り   ② 20通り   ③ 60通り   ④ 120通り

【 正解: ① 】

解説: 今回の封筒問題のように「順番(列)」を意識する場合は順列ですが、順番を気にせず「グループを選ぶだけ」の場合はコンビネーション($_5C_3$)を使います。
計算式は $\frac{5 \times 4 \times 3}{3 \times 2 \times 1} = 10 \text{通り}$ となり、サンプリング(標本抽出)の理論の基礎となります。


6. まとめ

DS検定において、確率の基本となる「並び順(順列)」が出たら、選択肢が1つずつ減っていく掛け算(階乗 $n!$)を連想しましょう。この「数え上げ」の感覚が、のちに学ぶ「確率分布」や「ベイズ統計」の複雑な数式を理解するための強固な土台になります!