ワイン消費量世界一はどこの国?直感を裏切る2つのクイズ
サイエントークのこの回は、レンさんがエマさんに出した2つのクイズから始まります。1問目は「世界で最も1人当たりのワイン消費量が多い国はどこか」という問題です。
エマさんはデンマーク、イタリア、フランス、イギリス、ハンガリーと次々に答えますが、どれも外れます。レンさんは、統計のデータにもよるとしたうえで、その国は事情があって公式のランキングからは除外されていると明かしました。
世界で最も人口が少ない国です。
バ、バチカンだ。
レンさんによると、バチカン市国 ── ローマ市内にある世界最小の独立国。カトリック教会の総本山で、ローマ教皇が元首を務めますは人口が800人ほどしかいないのに、1人当たり年間約99本のワインを消費しているといわれています。
バチカンのワイン消費量が多い理由として、レンさんは宗教的な儀式でワインを使うことと、子どもがほとんどいず大人の割合が非常に高いことを挙げます。住民はほぼ100%が移民で、一時的な居住者で構成されているそうです。そもそも総消費量は少ないため、ランキングからは除外されることが多いといいます。
2問目は有名な誕生日の問題です。何人集めれば、誕生日が同じ人がいる確率が50%以上になるかという問いに、エマさんは直感で「90人ぐらい」と答えました。
正解は23人です。レンさんは、少なく感じてしまう原因を「1人対誰か」ではなく「誰か同士」の一致を数えている点にあると説明します。組み合わせの数が思ったより多いので、直感とずれるのです。
なぜ今、統計の話なのか
レンさんが2つのクイズを出したのは、人間の直感が確率や統計とずれることはよくあり、それを悪用することもできると考えているからです。現代社会では怪しいデータの出し方もできてしまうため、統計学は非常に重要だと話します。
現代社会で。AIも統計学ですしね、ベースは。
エマさんが「人の直感っぽい間違った値を、これが統計だと出すような悪用があるという意味か」と確かめると、レンさんはそれもあるとしたうえで、統計学は知っておいて損はないと答えます。こうして、この回は「統計リテラシーを上げよう会」として進むことになりました。
レンさんはもう1つの理由も明かします。このエピソードの公開日から、第7回ジャパンポッドキャストアワード ── 日本のポッドキャスト作品を表彰するアワード。リスナー投票の部門もあり、番組ごとに投票を募りますのリスナー投票が始まっているのです。
皆さんにお願いしたいんですよ、リスナー投票を。でもただお願いするのも面白くないので、
なぜ1票を投じて、自分がその統計に参加することが重要なのかということを、統計学を元におしゃべりしたいっていう。
エマさんも「あなたの1票が大切です」とはよく言われるが、実際どれくらいのインパクトがあるのかは数字的にはわかっていないかもしれない、と応じます。投票のお願いを、統計学の歴史から語り直すという構成です。
統計学の語源は「国家」だった
エマさんが「統計学はいつから現れたのか」と問うと、レンさんは統計学の歴史は意外と浅いと答えます。幾何学のように古くからある数学とは違い、データを集めてそこにルールがあると思えるようになるまで、人間は長い時間をかけてきたといいます。
レンさんによると、統計学を意味する英語のStatisticsの語源は、国家を意味するStateです。統計学は、人口の把握や税金の集め方といった国家運営に最初に使われました。それ以前は、政治も占いのようなものを信じて行うのがメジャーだったそうです。
統計学という言葉が初めて使われたのは1700年代で、最初は「国家の科学(Science of State)」と呼ばれていました。
で、それがないと国家はもう盲目だと。もう目が見えないと一緒だと。
統計がない国家が「盲目」なのは、食べ物の配り方も税金の取り方もわからないからです。レンさんは、そもそも国民の数すらよくわかっていなかったと話し、エマさんは「1700年代までそれすらできてなかったの?」と驚きます。
1600年代には、人口を計算しようと試みる人が何人か現れます。レンさんが面白い例として挙げたのが、イングランドの人口を暖炉から推計する方法でした。
暖炉税
暖炉にかかる税から、暖炉の数がわかる
平均人数をかける
暖炉の数に、世帯の平均人数をかける
全体の人口
国全体のおおよその人数が出る
暖炉による推計について、エマさんは、代表的な世帯をいくつかピックアップして平均を取り、国全体に当てはめたのではないかと推測し、レンさんも同意します。当時のイギリスには戸籍もなかったそうです。
出生数は毎年ほぼ同じ?ハレーが見た人間の法則
統計学の初期のもう1つの例として、レンさんは1662年ごろにイギリスで初めて行われた出生数と死亡数の調査を紹介します。調べてみると、出生数や死亡数は年によってほとんど変わらないことがわかりました。
実際調べてみたら何年もそんなに変わんないから、すっごい集団で見たら法則性見いだせるぞっていうのに気づいていく。
今の感覚では当たり前に思える出生数・死亡数の安定も、当時は「そんなの年によるでしょ」という感覚で、信じにくかったといいます。ここから人口や土地のデータを集めて、来年どうなるかを予測する動きが始まりました。
エマさんは、統計学は学者が自然に始めた学問というより、国家運営のために必要になって研究された分野なのではないかとまとめます。レンさんも、他の学問と比べて特殊な始まり方だと同意しました。
一方でレンさんは、科学者たちも人々の生活パターンに統計的な見方を当てはめられると気づいていたと話します。例に挙げたのは、ニュートンの友人だったハレー ── イギリスの天文学者エドモンド・ハレー。周期彗星の回帰を予言し、その彗星は彼の名からハレー彗星と呼ばれていますです。
天文学みたいなこういう綺麗な法則性が人間の生活パターンにも応用できるんじゃないかって思ってたらしくて。
ハレーは、星の動きのように出生数や死亡数も数学的なパターンに従うのではないかと考え、人口統計のデータ分析や数学的な推論の方法に取り組んでいたそうです。エマさんは、頭のいい人たちは考えていたが、実際に研究できたのは国家がデータを集め始めてからなのだろうと受け止めます。
確率の誕生と、データを「使う側」のリテラシー
レンさんによると、統計学が生まれたのと同じ1600年代に、もう1つ重要な概念が生まれています。それが確率です。
確率は、パスカル ── 17世紀フランスの数学者・哲学者。「パスカルの原理」や『パンセ』でも知られますとフェルマー ── 17世紀フランスの数学者。「フェルマーの最終定理」で知られますの手紙のやりとりから生まれました。サイコロのようなゲームを題材に、ギャンブルの計算ができるのではないかと考えたのが始まりだといいます。
ただし、統計の手法が生まれても、すぐに「統計で来年のことを予測できる」と国家運営に使われたわけではありません。レンさんは、データを使う意思決定者の側にも統計リテラシーが必要だったと話します。
うん、あるじゃん。ってかこれ(統計リテラシーの必要性)は現代も一緒じゃん。
レンさんは現代の例として会社の売上予測を挙げます。売上を信じるのか来客数を信じるのか、客単価はどうかなど、指標はいくつもあります。エマさんも、売上が大きくても利益は大きくないこともあると付け加えました。
ナイチンゲールは統計で命を救った
時代は飛んで1800年代。統計リテラシーの重要性を初めて強く認識した人物として、レンさんはナイチンゲール ── イギリスの看護師フローレンス・ナイチンゲール。クリミア戦争での看護活動で知られ、近代看護の基礎を築きましたを挙げます。エマさんの印象は「いろんな人を救った看護師さん」でしたが、その救い方に統計が絡んでいたといいます。
当時の軍は、病院の衛生環境をあまり重要視していませんでした。看護師として戦争に参加したナイチンゲールは、銃で撃たれて亡くなる兵士よりも、不衛生な病院で感染症にかかって亡くなる兵士のほうが多いことに気づきます。
気づく
戦傷より、病院での感染症による死者が多い
集計する
亡くなった人の死因を集めてデータにする
可視化する
グラフの面積で死因の違いを一目で示す
進言する
衛生環境を整えないと死者は減らないと訴える
改善される
軍や国が問題を認識し、衛生環境を整える
女性が軍の方針に口を出すのが難しい時代でしたが、ナイチンゲールはデータで示すことで軍を納得させました。レンさんは、統計データを使って上を説得したよい例だと話します。
ナイチンゲールは、わかりやすく示すための統計グラフも作っています。極座標グラフ ── 円を角度で区切り、扇形の面積で量を表すグラフ。ナイチンゲールのものは「鶏頭図」とも呼ばれますと呼ばれるもので、コレラやチフスなど予防できる病気による死と、戦争の傷による死を面積で表しました。見せる相手は、数学的な理解があまりない国会議員やヴィクトリア女王 ── 19世紀のイギリス女王。在位は60年以上におよび、その時代は「ヴィクトリア朝」と呼ばれますだったといいます。
レンさんによると、当時の病院での死亡率は42%ほどでした。病院は破損した下水道の上に建っていて、汚染された水が蔓延していたそうです。
死亡率は約42%。破損した下水道の上に病院が建ち、汚染された水が蔓延していた
国の資金で下水道や通気口を整え、1年で約2%まで低下した
高すぎる。もうそんな病院行った方が死ぬやんみたいな感じやな。
こうした改善で、ナイチンゲールは数千人の命を救ったのではないかとレンさんは話します。データをちゃんと使うことで統計学の大切さが認識されていった、象徴的な事例です。
帰ってきた飛行機だけ調べると何を見落とす?
統計学のもう1つの有名な事例も戦争に関わる話です。第二次世界大戦中、アメリカ軍は帰還した爆撃機のどこが破損しているかのデータを集め、よりよい機体を作ろうとしました。
調べると、ダメージは胴体や翼に集中していました。そこで、傷の多い部分を分厚くしようという結論になりかけます。レンさんは、データから判断する考え方はこの時代にはもう根付いていたが、この判断は実はミスだったとクイズを出しました。
エマさんは「重くなってバランスが崩れるから?」と考えますが、レンさんの答えはもっと根本的な勘違いでした。
こういうところ(コックピットやエンジン)は破損した飛行機は帰還してないの。
傷が多い胴体や翼を補強する
傷がないコックピットやエンジンこそ致命的なので補強する
この誤りを指摘したのは数学者のエイブラハム・ウォールド ── ハンガリー出身でアメリカで活躍した統計学者。戦時中、軍の研究に統計学で貢献しましたです。生きて帰った機体だけを見ているという生存バイアス ── 生き残ったものだけを観察して、脱落したものを見落とすことで生じる判断の偏りを指摘し、装甲の強化は傷のない部分に施されました。
レンさんは、データが大事だと思っているからこそ、見えないところも考えてデータを見る必要があると話します。エマさんも、データの見せ方やグラフ化の仕方で印象が大きく変わると付け加えました。
レンさんは、この生存バイアスの話はポッドキャストにも当てはまると考えています。目に見える反応も大事ですが、反応のないリスナーが大多数だったりします。
確かに。サイレントリスナーさんがマジョリティだったりするから。
僕らはそっち(反応のないリスナー)も大切にしなきゃいけないわけよ。
天文学の誤差から生まれた正規分布
エマさんは、データを集めて正しく解析する大切さとは別に、正規分布や有意差のような学問としての理論がどう発展したのかを尋ねます。レンさんは、国家単位の話と並行して学問としての発展もあったと答えました。
確率論の後、1700年代ごろに生まれたのが誤差という概念です。きれいなデータは基本的に集まらず、星の観測でも人間が測るたびに少しずつずれます。この誤差に最初に気づいたのは天文学者たちだったといいます。
何回も測った誤差をグラフにすると、釣り鐘型になります。真ん中の値が最も多く、そこから離れるほど数が減っていく正規分布 ── 平均を中心に左右対称の釣り鐘型になる分布。身長や測定誤差など多くのデータがこの形に近くなりますです。エマさんは、星があるべき位置からのずれの距離をプロットすると、離れるほど少なくなる形が描けると理解しました。
その後、正規分布は人間にも当てはまることがわかります。最初の例は兵士の身体測定で、スコットランドの兵士5700人ほどの胸囲を並べると、きれいな釣り鐘型になったそうです。ここから、いろいろなデータが正規分布になっているのではないかという考えが広がりました。
ピアソンの相関と「数至上主義」
近代的な統計学への転機として、レンさんはカール・ピアソン ── 19〜20世紀イギリスの数学者・統計学者。相関係数などを整理し、数理統計学の基礎を築きましたを紹介します。ピアソンは、ダーウィンの進化論や人の遺伝に数学的な裏付けを与えたかった人物だそうです。
ピアソンが作ったのが相関という概念です。レンさんは、親の身長と子どもの身長を例に挙げます。親の身長が高いほど子どもの身長も高い傾向があれば、それは正の相関があるといえます。
じゃあなんか横軸が親の身長で、縦軸が子供の身長みたいな感じにしたら、右上に伸びていくような、あの、線が平均したら描けるみたいな感じだよね。
データを数学で評価するという現代的なアプローチが、1800年代に出てきたことになります。ただしレンさんは、ここでもデータの数が重要になると話します。点が4つほどしかなければ、右肩上がりか右肩下がりかもわかりません。
こうして、とにかく大量のデータを集めて解釈するのが統計学だという「数至上主義」のような考えが広がります。しかしレンさんは、これはこれで問題があったと続けます。
ビール工場から生まれたt検定
舞台は1900年代初頭のビール工場に移ります。レンさんは単純化した例として、アルコール5%のビールを作ってきた工場が、6%の新製品を開発したい場面を説明しました。
5%のビールは製造実績が多く、どれくらいの誤差で作れるかがわかっていて、正規分布にも従っています。一方、6%の新しい作り方は、いきなり大量には作れません。
エマさんは、アルコールを人為的に足すのかと尋ねます。レンさんによると、アルコールは酵母が中で生み出すもので、温度などの条件を変えることで6%を目指すのだそうです。
(温度を上げて)一回やったら6パーセントになったんだけど、もしかしたらもうちょっと一杯やったら本当は5パーセントの方にもっと寄ってて。
少ない試行で6%が出ても、たまたま5%の製法の誤差範囲に入っただけかもしれません。そこで、少ないサンプルでも2つの平均値に差があるかを判断する方法として作られたのがt検定 ── 2つのグループの平均値に、偶然とはいえない差があるかを調べる統計手法。サンプルが少ない場合にも使えますです。
エマさんは、ビール会社が実用的に必要としたからこそ生まれた方法なのだと感心します。レンさんも、やっていることはかなり高度だと応じました。
紅茶を飲む婦人の実験と「有意差」
レンさんは、もっとシンプルな例として「紅茶を飲む婦人」の実験を紹介します。ある婦人が、紅茶を先に入れたミルクティーとミルクを先に入れたミルクティーの味の違いがわかると言っていた、という話です。
イギリスっぽい話だと感じたエマさんは、イギリス人の友人の話を思い出します。アフタヌーンティーのスコーンに、ジャムを先に乗せるかクリームを先に乗せるかで大激論が起きるのだそうです。
レンさんによると、この実験に関わったのはロナルド・フィッシャー ── 20世紀イギリスの統計学者・遺伝学者。実験計画法や有意性検定を整え、近代統計学の父とも呼ばれますです。混ざれば同じに思える2種類のミルクティーを、婦人は本当に見分けられるのかを確かめようとしました。
問題は、全問正解がまぐれなのか実力なのかをどう判断するかです。偶然で全問正解する確率は約1.4%しかありません。めったに起きないことができているなら、本当に違いがわかっていると考える。これが有意差の原点だといいます。
偶然起きる確率が何%以下なら意味のある差とみなすか、という基準がP値 ── 観察された結果が偶然だけで起きる確率を表す値。小さいほど偶然とは考えにくいと判断されますです。よく使われるのはP値が0.05より小さい、つまり偶然の確率が5%以下という基準で、生物系の実験などで使われるとレンさんは話します。
レンさんは、P値5%以下にどこまでこだわる必要があるのかという議論もあると付け加え、基準はメジャーな考え方としての慣習のようなものだと話します。正規分布、t検定、P値による検定がそろい、1900年代に統計学のベースができました。エマさんは、医学や生物の研究を支える学問が意外に新しいことに驚きます。
ベイズ統計はどうAIにつながった?
ここまでの統計学は、なるべく少ない数で判断したいという発想でした。もっと最近の時代になって使われるようになったのが、P値の考え方と対立していたベイズ統計 ── 事前の見込みを、新しいデータが得られるたびに更新していく統計の考え方。18世紀のトーマス・ベイズの定理に基づきますです。
レンさんによると、ベイズ統計は新しいデータが出るたびに確率をアップデートしていく考え方です。方法は1900年代初頭からあったものの、計算が複雑すぎてあまり使われていませんでした。
コンピューターの登場で膨大な計算ができるようになり、1980年代以降にベイズ統計が使われるようになります。膨大なデータから確率的なパターンを見つける方法は、今のAIにつながっています。
今までのそういう文章から--を統計して解析すると、次おじいさんって来る可能性高いなってなってるからおじいさんが出てくるんだよ。
レンさんは文章生成AIの例として、「昔々」の次に「おじいさん」が来る確率が高いことを挙げます。データの多い分野ではこうした手法が、論文のようにデータが少ない分野では今もP値による検定が使われ、量によって使い分けられているといいます。
| 考え方 | 向いている場面 | 本文での例 |
|---|---|---|
| t検定・P値 | データが少ない | ビールの新製法、紅茶の実験、論文 |
| ベイズ統計 | データが膨大 | AIの文章生成 |
統計学はもう完成したのか
エマさんは、物理のように未解決の問題が多い学問と比べて、統計学はもう行くところまで行ったのかと疑問を投げかけます。レンさんは、自分は統計学の専門家ではないのでわからないとしつつ、使う人が圧倒的に多い一方で、基礎を研究する人もいるのではないかと答えました。
レンさんが想像するのは、データは大量にあるのに複雑すぎてパターンを見いだせない、といった課題です。その課題を解く新しい方法を考える人はいそうだと話します。
そのうえでレンさんが強調したのは、どんな方法を使うにしても、ちゃんとしたデータが大事だということです。解析方法も大事、データも大事、そして扱い方を悪用する人に騙されないためのデータリテラシーも欠かせません。
レンさんはここまでの話を、国が始めたデータ集め、ナイチンゲールのようなデータの使い方、そして正規分布などの扱い方がAIや判断の土台になっている、と振り返りました。さらに「すごく有効な方法です」と言われても、本当に有効なのかを疑うフィルターを持てるようになると話します。
エマさんは「お客様満足度98%」のような表示を例に挙げ、レンさんはサクラ、母数の少なさ、偏った母集団など、データの取り方で結果が変わってしまうことを指摘します。
無駄なデータはない。1票もデータになる
レンさんは、統計学の話から「無意味なデータはない」とも言えると話します。誤差は誤差として大事なデータで、うまくいかなかった実験をなかったことにすると、ミスリードにつながってしまいます。
レンさんは、この考え方は投票も同じだと続けます。1票を投じれば、データとして残ります。
それ(自分の1票)が自分は誤差かなって思ってても、意外とそれがみんな思ってるかもしれないじゃん。
そして何もアクションをしなかったら存在しないみたいになっちゃうわけじゃん。
エマさんも、1人ひとりの力は1票にしかならなくても、積み上がってこその受賞があると応じます。そして、サイエントークは芸能人の番組などと比べてリスナー数が多くないからこそ、1人ひとりの投票が重要だと話しました。
2人は、去年のノミネートはギリギリだったのではないかと振り返ります。投票の統計データは開示されていないのでわかりませんが、他は大物番組ばかりだったといいます。
だから去年もさ、ある意味さ、こう直感を凌駕してる感じがするんよ。
レンさんの見立てでは、純粋なリスナー数では入っていなかったかもしれないものの、リスナー数に対する投票率が高かったおかげでノミネートされたのではないか、ということです。
票がほしいだけではない。受賞で広げたい科学の輪
レンさんは、ただ票がほしいわけではないことも伝えたいと話します。アワードに入ることで、ちゃんと意味を作りたいのだといいます。
レンさんによると、去年のノミネートをきっかけに、イベントの開催や東京書籍とのコラボなど活動が広がりました。エマさんは、ねるねるとの企画もノミネートされたからこそ応じてもらえたのかもしれないと話します。チカブレンドのチカモトさんとリュウさんとの対面や、言語学者の川原先生のようなアカデミアの研究者が出演する場も、その延長にあるといいます。
2人が目指すのは、ノーベル賞受賞者を呼べるくらいの番組になることです。去年はノミネートだけでしたが、受賞できれば活動の幅が広がり、その目標に近づけると考えています。
なんか科学面白いじゃんみたいなのがさ、広まって、なんかなんとなくどっかで頑張ってる研究者とか勉強してる人とか応援したいなとか、そういう人が集まったらいいじゃん。
エマさんは、番組が未来の科学者を生むきっかけになる可能性もあると付け加えます。レンさんは、たとえ受賞できなくてもその方向で頑張るつもりだと話しました。
投票は「ポッドキャストアワード」で検索して出てくる公式サイトのリスナー投票ページから参加できます。レンさんによると、投票期間は12月いっぱい、1月4日までになっているそうです。今年はアマチュアの受賞枠があることも決まっているといいます。
だからもう1人1人の投票というデータが大きい結果を生むっていう。
まとめ
統計学は、国家が人口や税を把握するために始まり、ナイチンゲールや生存バイアスの事例を経て、t検定やP値、ベイズ統計、そしてAIへとつながってきました。レンさんとエマさんは、直感とずれるデータを正しく読む力の大切さを語り、1票もまた大きな結果を生みうるデータだとして、ジャパンポッドキャストアワードへの投票を呼びかけています。
- 統計学の語源は国家(State)で、人口や税の把握という国家運営から始まった
- ナイチンゲールは死因データとグラフで軍や国を動かし、病院の死亡率を約42%から約2%に下げた
- 帰還した爆撃機の傷だけを見る生存バイアスのように、見えないデータを考えないと判断を誤る
- t検定やP値は少ないデータで差を判断する道具で、ベイズ統計は膨大なデータを扱うAIにつながっている
- 誤差もデータであり、1人ひとりの1票も積み上がれば大きな結果を生みうる


