私たちの周りには完全なデータなど存在しません。全国民の年収を一人残らず調べることも、すべての製品の耐久性を確認することも不可能です。だからこそ統計は、不完全なデータから「どこまで言えるか」を判断する技術として発展してきました。本稿では、日常で出会う数字やデータをどう読み解くかを、代表値・ばらつき・確率・因果関係・グラフ・偏り・誤差という7つの視点から解説します。
シリーズについて
本サイトのメインテーマは「暮らしの背後にある仕組みを読み解く」こと。中学・高校理科の知識をベースに、特定の専門に偏らず、物事の骨子を見抜く力を養います。記事は「歴史的背景」「科学的原理」「フィールド(実社会での応用)」の3層構造で構成しています。「なぜそうなったか」「どんな仕組みか」「現実で何が見えるか」。この3視点を揃えることで、断片的な知識を「線や面」へとつなげ、社会を生き抜くための判断の源泉を提供します。
平均・中央値・最頻値 ― 「代表値」は一つではない ―
ニュースで「日本の平均年収は460万円」と聞いて、「そんなにもらっている実感はない」と違和感を覚える人は多いのではないでしょうか。実は、あなたの周りを見渡したときの感覚のほうが、ある意味では正しいのです。
その秘密は「代表値」の扱いにあります。私たちが普段使う「平均値」は、全員の値を合計して人数で割ったものですが、「一部の極端に大きな数値に引っ張られやすい」という弱点があります。
たとえば、年収300万円の人が9人、年収3000万円の人が1人、合わせて10人のグループを考えます。合計は5700万円なので、平均は570万円に跳ね上がります。平均だけを見れば「みんな高収入だ」と思えますが、実際には9割の人が300万円のままです。
こうしたズレを見抜く助けになるのが、あと2つの代表値です。データを小さい順に並べたときにちょうど真ん中にくる「中央値」と、最も人数が多い値である「最頻値」です。先ほどのグループでは、どちらも300万円になります。極端な数値に影響されないので、多くの人の実感に近い数字になります。
日本の所得分布も同じ構造で、ごく一部の高所得層が平均値を押し上げています。平均値と中央値を併記して示す資料もあります。同じデータでも、どの代表値を示すかで印象は大きく変わります。
チェックポイント:平均を見たら、中央値も探す。
標準偏差 ― 「どれくらい散らばっているか」 ―
目標の長さを10.0ミリメートルとしてボルトを作っている、2つの工場があるとします。どちらも平均は10.0ミリメートルです。しかし、工場Aの製品は大半が9.9〜10.1ミリメートルに収まるのに対し、工場Bの製品は9.0〜11.0ミリメートルまでばらつきます。精密機械の部品として使うなら、不良品が少なく信頼できるのは工場Aです。平均が同じでも、「ばらつき」が違えば品質はまったく違います。
このばらつきを数値にしたものが「標準偏差」です。ひとことで言えば、「データが平均からどれくらい離れているか、その平均的な大きさ」です。標準偏差が小さいほど、結果は安定しています。目安として、データがきれいな山形に分布する場合、平均から標準偏差2つ分の範囲に約95%のデータが入ります。工場Aは標準偏差が0.05ミリメートルなので、約95%の製品が9.9〜10.1ミリメートルに収まります。工場Bは標準偏差0.5ミリメートルなので、同じ95%が9.0〜11.0ミリメートルに広がります。
この視点は、ボルトに限らず幅広く使えます。「平均寿命10年」の製品でも、9〜11年で寿命を迎えるものと、3年で壊れたり17年もったりするものでは、買い替えの計画も、故障のリスクもまったく違います。投資商品の「期待リターン」にも、ばらつきの大きさ、つまりリスクがついて回ります。
チェックポイント:平均だけでなく、「ばらつき」の大きさを確かめる。
確率と期待値 ― 起こりやすさを「冷静に」測る ―
「発生確率1%の重大事故」と聞いて、「たった1%ならまず起きない」と思う人もいれば、「100回に1回も起きるのか」と身構える人もいます。確率の受け止め方は、主観で大きく揺れます。
低い確率を読むときの第一の注意点は、「分母」です。事故率1%の設備を、社会全体で100万人が使えば、計算上は1万人が事故に遭います。個人にとっての低確率も、大きな分母で見れば無視できない被害になります。
第二の注意点は、「そろそろ帳尻が合うはずだ」という錯覚です。コインを投げて表が5回続いたとき、次は裏が出やすい気がしませんか。しかしコインに記憶はなく、次に表が出る確率は常に50%です。過去の結果が次の結果に影響しない関係を「独立」といい、この錯覚を「ギャンブラーの誤謬」と呼びます。
また、「確率10%のリスクを10回繰り返せば、必ず1回は起きる」という理解も誤りです。10回とも無事で済む確率は約35%あり、「少なくとも1回は起きる」確率は約65%で、100%ではありません。確率は、何千回、何万回と繰り返したときの長期的な割合を示すもので、目の前の一回を保証するものではないのです。
こうした確率を使って損得を測る指標が「期待値」です。「結果(被害額や利益)」に「その起こる確率」を掛けて、すべて足し合わせたものです。たとえば「1%の確率で1000万円の損害が出る」リスクの期待損失は、1000万円×0.01で10万円です。
では、この損害に備える保険料が年15万円だったら、入るのは損でしょうか。計算上は、保険金の期待値より保険料のほうが高くなるのが普通です。そうでなければ保険会社は成り立ちません。それでも加入が不合理とは言えません。個人や一企業では抱えきれない巨大な損失は、確率が低くても避けたいからです。期待値がマイナスでも、破滅的な事態に備えて先に手を打つこと(ヘッジ)には、十分な合理性があります。
チェックポイント:確率は「分母」とセットで読み、期待値だけでなく「最悪の損失に耐えられるか」も考える。
相関と因果の区別 ― 一番多い誤解 ―
「アイスクリームの売上が増える月は、水難事故による溺死者数も増える」というデータがあります。では、溺死事故を減らすために、アイスクリームの販売を禁止すれば効果はあるでしょうか。
当然、効果はありません。この二つには「相関関係」はあっても、「因果関係」はないからです。「相関」は二つのデータが一緒に変化する関係、「因果」は一方が原因でもう一方が結果になる関係です。因果であれば原因を変えることで結果を変えられますが、相関だけでは変えられません。
アイスの例では、裏に「気温の上昇」という共通の原因があります。暑くなるからアイスが売れ、同時に、水辺に出かける人が増えて事故のリスクも高まるのです。
データが連動する背景には、一般に4つの可能性があります。「AがBの原因」という順方向、「BがAの原因」という逆方向、「共通の第三の原因がAとBを動かす」ケース、そして「単なる偶然」です。「この食品を食べる人は健康だ」というデータも、「健康な人だからその食品を選んでいる」のかもしれません。
因果関係を確かめる最も確実な方法は、対象者をランダムに2グループに分け、一方にだけ介入して結果を比べる実験(ランダム化比較試験)です。新薬の効果の検証などで使われます。逆に言えば、観察データの相関だけで「効く」「危ない」と断定する言説には、慎重になる必要があります。
チェックポイント:二つのデータが連動していても、「第三の原因はないか」と一度疑う。
グラフの読み方 ― 見せ方で印象は変わる ―
「売上が急増!」という言葉とともに、劇的な右肩上がりのグラフが示されることがあります。しかし、グラフは事実そのものではなく、作り手が選んだ「表現」です。
代表的なのが縦軸のマジックです。縦軸をよく見ると、本来の起点である「0」が省略され、「98万円から102万円」のような狭い範囲だけが拡大されていることがあります。実際の増加は4万円、わずか4%なのに、グラフ上では何倍にも急膨張したように見えます。同じデータを0から描き直せば、ほぼ横ばいです。
言葉の選び方でも印象は操作できます。たとえば、ある商品のシェアが1%から2%になったとき、「シェアが2倍に!」と言えば劇的に聞こえます。しかし「シェアは1ポイント増えた」と言えば、ごくわずかな変化に聞こえます。倍率で語るか、差(ポイント)で語るかで、同じ事実の印象は大きく変わります。
グラフを見るときは、線の勢いに目を奪われず、次の点を確認してください。縦軸の起点は0か。単位は何か。比較の基準は何か。都合よく省略されたデータはないか。
チェックポイント:グラフを見たら、まず縦軸の数字と起点を読む。
サンプリングと偏り ― どこから集めたかがすべて ―
「ネット調査によれば、90%の人が新しい政策に賛成」と聞くと、世論の大半が賛成しているように思えます。しかし、この数字をそのまま国民の総意と考えるのは危険です。
統計調査は、調べたい全体(母集団)から一部のデータ(サンプル)を抜き出し、全体を推測する技術です。抜き出した一部が全体の縮図になっていなければ、結論は歪みます。ネット調査では、ネットを使わない高齢層や、テーマに関心が薄く回答しない層の意見が抜け落ちます。反対に、強い意見を持つ人や、時間に余裕のある人の声ばかりが集まりがちです。つまり「ネットで90%が賛成」の正しい意味は、「ネットを使い、自発的に回答する人の中で9割が賛成」にすぎません。
ここで注意したいのは、サンプル数(N)さえ多ければ偏りが消える、という誤解です。偏ったやり方で集めたデータは、1万人でも100万人でも、同じ方向に偏ったままです。大きなサンプルは、偏った結論に「立派な根拠」の見た目を与えてしまうこともあります。大切なのは人数の多さよりも、「誰を、どうやって選んだか」です。
どれほど高度な分析をしても、最初のデータが偏っていれば結論も偏ります。
チェックポイント:「〇%が支持」を見たら、人数より先に「誰に、どう聞いたか」を確かめる。
誤差と有効数字 ― 数字の「幅」と「桁数」を疑う ―
朝に測ると67.8キログラム、昼は68.2キログラム、夜は68.5キログラム。どれが「本当の体重」なのでしょうか。実は、どれも正しく、どれも「本当の値」とは言い切れません。あらゆる測定には「誤差」と「変動」があるからです。
数値が変わる理由は、大きく3つあります。1つ目は、食事や発汗などで体重そのものが変わる「自然変動」。2つ目は、体重計の限界による「測定誤差」(家庭用で±0.1〜0.2キログラム程度)。3つ目は、設置場所の傾きや乗り方による「人為的誤差」です。毎回ぴったり同じ数値が出るなら、むしろ機械が数値を固定している可能性を疑うべきです。
だから科学の世界では、測定値を「67.8 ± 0.2 kg」のように、誤差の幅とセットで示します。天気予報で、「最高気温は25度」と断言されるより、「23〜27度の見込み」と言われるほうが、不確実性を正直に伝えているという意味で誠実です。なお、「±」が何を表すか(標準偏差など)は資料によって異なるので、出典で確認してください。
もう一つのポイントが「有効数字」です。体重計の画面に「67.834キログラム」と出ても、精度が±0.1キログラム程度なら、小数第2位以下は機械のノイズで、意味はありません。信頼できる桁だけを残して「67.8キログラム」と扱うのが正しい読み方です。測定器具の限界を超えた細かい桁は、精密そうに見せているだけの数字の羅列です。
チェックポイント:数字は「±の幅」とセットで見て、必要以上に細かい桁には精密さを信用しすぎない。
編集後記
感覚的な話になりますが、多くの人は「グラフ」や「大学教授による解説」が登場すると、内容を無条件に信じてしまう傾向があるようです。しかし、職業科学者の立場から言えば、テレビに出ている専門家のすべてが、その分野の最前線にいるわけではありません。ときには番組の構成上、専門外の領域について語っている場合もあります。「権威」という肩書きは、一度冷静に見直す必要があります。
グラフも同様です。「サンプル数(N)はいくつか」「縦軸は恣意的に切られていないか」といったツッコミどころの多いデータでも、テレビでグラフ化されると、なぜか信頼できるものに見えてしまいます。溢れる数字に惑わされず、情報の背後にある構造を見抜くこと。不確実な現代で最善の判断をするには、目の前のデータに問いを投げかける姿勢が欠かせません。
おわりに
最後までお読みいただき、ありがとうございました。本記事を通じて、暮らしの背後にある仕組みを読み解くヒントは得られましたでしょうか。もし「このテーマをもっと深く知りたい」と感じていただけましたら、ぜひ関連の解説記事もあわせてご覧ください。
本サイトではトピックをできるだけ「歴史・科学・フィールド」の3層構造で体系化しています(教育とキャリアを除く)。一つの事象を多角的に捉えることで、断片的な知識を「線や面」へとつなげることができます。多彩なテーマを用意していますので、ぜひサイト内の記事一覧から、あなたの知的好奇心を刺激するトピックを覗いてみてください。

