0

3

2

文字

繁 | 简

0

3

2

數學妙用活得科學社會群體

p 值的陷阱（上）：p 值是什麼？又不是什麼？

林澤民・2017/01/07 ・9006字・閱讀時間約 18 分鐘・SR值 578

・九年級

相關標籤：

熱門標籤：

編按：本文係林澤民老師在2016年中進行的相關系列演講之一的逐字稿修訂版，本場次為2016/6/6在政大社科院的演講，題目為《看電影學統計：p 值的陷阱》。原文刊於《社會科學論叢》2016年10月第十卷第二期。

院長、陳老師，各位老師、各位同學，今天很榮幸能夠到政大來，和大家分享一個十分重要的課題。我今年回來，今天是第六個演講，六月中之前還有兩個，一共八個，其中四個是談賽局理論，四個是談 p 值的問題。

賽局理論的部分，題目都不一樣，譬如我在政大公行系講賽局理論在公行方面的應用，而我第一個演講在台大地理系，談賽局理論在電影裏的應用。我在台大總共講了三部電影，一部是《史密斯任務》，講男女關係、夫妻關係；第二部是《少年 pi 的奇幻漂流》，講少年和老虎對峙的重覆性賽局；第三部電影是最新的電影：《刺客聶隱娘》，講國際關係賽局。

今天談的當然是不一樣的題目，雖然它是一個很重要、很嚴肅的題目，但我希望大家可以輕鬆一點，所以也要放兩部電影片段給大家看，一部是《玉蘭花》，另一部則是《班傑明的奇幻旅程》，這兩部電影都有助於我們來瞭解今天要談論的主題：p 值的陷阱。

科學的統計學危機：p 值有什麼問題？

為什麼要談論 p 值的問題？因為在近十多年來，不只是政治學界，而是很多學門，特別是在科學領域，有很多文章討論傳統統計檢定方法、尤其是 p 值統計檢定的問題，甚至有位很有名的統計學者，Andrew Gelman 寫了篇文章，叫作〈科學的統計學危機〉（The Statistical Crisis in Science），說是危機一點都不言過其實。這就是為何我說：今天要討論的其實是很嚴肅的問題。

投影片上這些論點，大部分是說我們在傳統統計檢定的執行上，對 p 值有各種誤解跟誤用。現在很多人談到「p 值的危險」、「p 值的陷阱」、「p 值的誤用」、還有「p 值的誤解」。甚至有些學術期刊，也開始改變他們的編輯政策。像這本叫作 Basic and Applied Social Psychology 的心理學期刊，已經決定以後文章都不能使用 p 值，大家能夠想像嗎？我們作計量研究，都是用 p 值，各位一直用，在學界用了將近一百年，現在卻說不能用。甚至有些文章，說從前根據 p 值檢定做出來的研究成果都是錯的，有人更宣告 p 值已經死了。

所以這是一個很嚴重的問題。在這本期刊做出此決定後，美國統計學會（ASA）有一個回應，表示對於 p 值的問題，其實也沒這麼嚴重，大部分是誤解跟誤用所造成，只要避免誤解與誤用就好。可是在今年，ASA 真的就發表了正式聲明，聲明裡面提出幾點，也是我今天要討論的主要內容，包括 p 值的真正的意義，以及大家如何誤用，換句話說就是：p 值到底是什麼？它又不是什麼？（圖一）今天除了會深入探討這些議題之外，也請特別注意聲明的第三點提到：科學的結論，還有在商業上、政策上的決策，不應只靠 p 值來決定。大家就應該了解這問題影響有多大、多嚴重！

我舉個例子，在台灣大家都知道我們中研院翁院長涉入了浩鼎案，浩鼎案之所以出問題，就是因為解盲以後，發現實驗的結果不顯著。我今天不想評論浩鼎案，但就我的了解，食藥署、或者美國的 FDA，他們在批准一項新藥時，一定要看實驗的結果，而且實驗結果必須在統計上要顯著。可是 ASA 卻告訴我們說，決策不該只根據統計的顯著性，大家就可想像這影響會有多大。甚至有其他這裡沒有列出來的文章，提到為何我們使用的各種藥物，都是經過這麼嚴格的 p 值檢定出來、具有顯著性，可是在真正臨床上，卻不見得很有用。其實很多對 p 值的質疑，都是從這裡出來的。

-----廣告，請繼續往下閱讀-----

有關 p 值的討論，其實並非由政治學門，而是從生命科學、例如醫學等領域所產生的。ASA 聲明的第四點說：正確的統計推論，必須要「full reporting and transparency」，這是什麼意思呢？這是說：不但要報告 p 值顯著的研究結果，也要報告 p 值不顯著的研究結果。

但傳統方法最大的問題是：研究結果不顯著，通通都沒有報告。在英文有個詞叫，摘櫻桃。什麼叫摘櫻桃？摘水果，水果熟的才摘，把熟的水果送到水果攤上，大家在水果攤上看到的水果，都是漂亮的水果，其實有很多糟糕的水果都不見了。我們在統計上也是，大家看到的都是顯著的結果，不顯著的結果沒有人看到。

*摘櫻桃（cherry picking）：只有好的水果（顯著的統計結果）會挑選被大家看到，不好的／不顯著的則被忽略。圖／Oregon Department of Agriculture @ Flickr*

可是在過程中，研究者因為結果必須顯著，期刊才會刊登、新藥才會被批准，所以盡量想要擠出顯著的結果，這之中會出現一個很重大的問題：如果我們作了 20 個研究，這 20 個研究裡面，虛無假設都是對的，單獨的研究結果應該是不顯著。可是當我們作了 20 個統計檢定時，最少有一個結果顯著的或然率其實很高。雖然犯第一類型錯誤的或然率都控制在 0.05，可是 20 個裡面最少有一個顯著的，或然率就不是 0.05，大概是 0.64。如果就報告這個顯著結果，這就是 cherry-picking。

ASA 給的建議是：實驗者必須要 full reporting and transparency，就是一個研究假如作了 20 個模型的檢定，最好 20 個模型通通報告，不能只報告顯著的模型。ASA 這個聲明是今天要討論的主要內容。

-----廣告，請繼續往下閱讀-----

p 值是什麼?

p 值是什麼？我想在座有很多專家比我都懂，但是也有一些同學在場，所以還是稍微解釋一下。p 值是由 Ronald Fisher 在 1920 年代發展出來的，已將近一百年。p 值檢定最開始，是檢定在一個 model 之下，實驗出來的 data 跟 model 到底吻合不吻合。這個被檢定的 model，我們把它叫做虛無假設（null hypothesis），一般情況下，這個被檢定的 model，是假設實驗並無系統性效應的，即效應是零，或是隨機狀態。在這個虛無假設之下，得到一個統計值，然後要算獲得這麼大（或這麼小）的統計值的機率有多少，這個或機率就是 p 值。

舉一個例子，比如說研究 ESP （超感官知覺）時會用到比例（proportion）這個統計值。我們用大寫的 P 來代表比例，不要跟小寫的「p 值」的 p 混淆。在 p 值的爭論裡，有一篇研究 ESP 的心理學文章被批評得很厲害。文章中提到了一個實驗，讓各種圖片隨機出現在螢幕的左邊或者右邊，然後讓受測者來猜圖片會出現在哪邊。我們知道如果受測者的猜測也是隨機的，也就是沒有 ESP 的效應，則猜對的或然率應該是一半一半，算比例應該是差不多 P = 0.5，這裡比例 P = 0.5 就是我們的虛無假設。但這個實驗，實驗者是一位知名心理學教授，他讓受測者用各種意志集中、力量集中的辦法，仔細地猜會出現在左邊還是右邊。結果發現，對於某種類型的圖片——不是所有圖片，而是對於某些類型的圖片，特別是色情圖片——受測者猜對的比例，高達 53.1 %，而且在統計上是顯著的。所以結論就是：有 ESP，有超感官知覺。

這裡 p 值可以這樣算：就是先做一個比例 P 的 sampling distribution（抽樣分配）。如果虛無假設是對的，平均來講，P = 0.5。0.5 就是 P 的抽樣分配中間這一點，這個比例就是我們的虛無假設。在受測者隨機猜測的情況之下，P 應該大約是 0.5 的。可是假如真正得到的 P 是 0.531，抽樣分配告訴我們：如果虛無假設是對的，亦即如果沒有任何超自然的力量，沒有 ESP 存在，大家只是這樣隨機猜測的話，則猜對的比例大於或者等於 0.531 的機率，可以由抽樣分配右尾的這個面積來算。作單尾檢定，這面積就是所謂的 p 值。如果作雙尾檢定的話，這值還要乘以 2。以上就是我們傳統講的 p 值的概念。

我們得到 p 值以後，要作統計檢定。我們相約成俗地設定一個顯著水準，叫做 α，α 通常都是 0.05，有時候大家會嚴格一點用 0.01，比較不嚴格則用 0.10。如果我們的 α = 0.05，則若 p < 0.05，我們就可以拒絕虛無假設，並宣稱這個檢定在統計上是顯著的，否則檢定就不顯著，這是傳統的 p 值檢定方法。如果統計上顯著的話，我們就認為得到實驗結果的機會很小，所以就不接受虛無假設。

-----廣告，請繼續往下閱讀-----

為什麼說 p 值很小，就不接受虛無假設？我個人的猜想，這是依據命題邏輯中，以否定後件來否定前件的推論，拉丁文稱作 modus tollens，意思是以否定來否定的方法，也就是從「若 P 則 Q」和「非 Q」導出「非 P」的推論，這相信大家都知道。p 值檢定的邏輯是一種有或然性的 modus tollens，是 probabilistic modus tollens。「若 H₀ 為真，則 p 值檢定顯著的機率很小，只有 0.05」，現在 p 值檢定顯著了，所以我們否定 H₀。但是命題邏輯的 modus tollens，「若 P 則 Q」是沒有或然性、沒有任何誤差的餘地的。「若 H₀為真，則 p 值檢定不可能顯著」，這樣 p 值檢定顯著時，你可以否定 H₀，大家對此都不會有爭議。

問題是假如容許或然性，這樣的推論方法還是對的嗎？舉一個例子：「若大樂透的開獎機制是完全隨機的，則每注中頭獎的機率很小，只有 1 / 13,980,000」，現在你中獎了，你能推論說大樂透開獎的機制不是隨機的嗎？p 值的問題，便是在於我們能不能夠因為 p 值很小，小到可能性很低，我們就用否定後件的方法來否定前件。我們用命題邏輯來作統計推論，但其實我們的推論方法跟命題邏輯卻不完全一樣，因為我們的 α 絕對不可能是零，如果 α 是零的話，就不是統計了。

再來就是看電影時間，電影很有趣，可以幫助我們了解什麼是 p 值，也可以再接著討論為什麼用 p 值來作統計推論會有錯。這部電影叫做「玉蘭花」，是 1999 年的電影，已經很舊了，可能在座年輕的朋友就沒看過。網路上在 Youtube有這一段，請大家觀賞。

相信大家應該都看得懂這短片的用意。玉蘭花這部電影，雖然裡面有講一些髒話，但是其實是一部傳教的影片。它的推論方式，其實就是我剛剛講的 p 值的推論方式，它有一個虛無假設，就是說事情發生沒有什麼超自然的力量在作用，都是隨機發生的，是 by chance，不是 by design，可是它發生了，竟然有這麼巧合的事情。大家可以想一下，如果事情的發生都是 by chance，都是隨機的，那麼像這種事件發生的機率有多少？很小很小，0.0…01，幾乎不可能發生。所以假如是隨機發生的，就幾乎不可能發生，可是它發生了，我們就以否定後件來否定前件，推論虛無假設－by chance 的這個假設－是不對的。

-----廣告，請繼續往下閱讀-----

既然不是 by chance，它是什麼？就是 by design，是設計出來的。這是基督教的一種論證上帝創造世界的方法。在美國，有些學區還在爭論，生物是創造的還是進化的？創造論的主張者都會用這樣的論證，說你看我們人體，它是這麼複雜的一個系統，這種系統可能是隨機發生的嗎？若是隨機發生，機率有多少？是 0.0…01，所以它不可能是隨機發生，因此是創造的。這個理論叫做 intelligent design（智慧的設計）即我們這個世界都是上帝創造、是上帝很有智慧地依照藍圖設計出來的。我今天也不想爭辯這種推論對不對，我只是舉例來說明這種推論的邏輯。

p 值不是什麼？

我本來放這部電影都是為了在教學上解釋 p 值的概念，可是後來當我注意到對於 p 值的爭議之後，覺得其實這一部電影也可以用來幫我們了解為什麼用 p 值來做統計推論有可能是錯的。

下面這個表是大家都熟悉的。（圖二）我們可以用這個表來呈現有關虛無假設是對或者不對，是被拒絕或者被接受的四種可能性，其中兩種是作出錯誤統計推論的情況。第一個情況，虛無假設是對的，但統計檢定是顯著的，因此虛無假設被推翻了。這種情況叫做 Type I error，我們保留了 α = 0.05 的機率容許它存在。第二個情況，如果虛無假設是錯誤的，但統計檢定不顯著，所以它沒有被推翻，這個情況叫做 Type II error。Type II error 剛學統計的同學可能不太了解，因為我們通常都不會很清楚地去計算它的機率——所謂 β。這個 β 跟 α 不一樣，不是你可以用相約成俗的方法來訂定，而是會受到若干因素的影響。

我們可以開始討論：傳統用 p 值來作統計檢定方式，為什麼有問題？剛剛 ASA 的聲明說：p 值 do not measure the probability that the studied hypothesis is true。p 值告訴你：如果虛無假設是對的，你「觀察到資料」的機率有多少，但它並沒有告訴你「虛無假設是對的」的機率有多少，或「研究假設是對的」的機率有多少。這是很不一樣的：前者是 data 的機率，後者是 model 的機率。進一步說明，p 值是在虛無假設為真的條件之下，你觀察到和你所觀察到的統計值一般大小（或更大／更小）的機率。但我們作檢定的時候，我們是看 p 值是不是小於你的統計水準 α，如果 p < α，我們就說統計是顯著的。

-----廣告，請繼續往下閱讀-----

換句話說，如果虛無假設為真，那麼你的檢定是顯著的機率是 α = 0.05。但這其實不是我們作研究最想回答的問題；這個機率只告訴我們，如果你的虛無假設為真，有百分之五的機率，data 會跟它不合，但它沒有告訴我們虛無假設這個 model 為真的機率有多少，而這才是我們應該問的問題。所以我們應該反過來問，如果你統計檢定是顯著的，在此條件之下，「虛無假設是對的」的機率有多少？如果我們把關於 data 這個偽陽性的機率記作 α = Pr（Test=+|H₀），大家可以看出這個關於 model 的機率其實是它倒反過來的：Pr（H₀| Test=+），所以我把它稱作「偽陽性的反機率」。這兩個機率原則上不會相等；只有在 α = 0 的時候，兩者才都是零而相等。

譬如今天你去健康檢查，醫生給你做很多篩檢，如果篩檢結果是陽性，其實先不要怕，因為你應該要問，如果篩檢出來是陽性，那麼你真正並沒有病的機率是多少？也就是偽陽性的反機率有多少？大家可能會很驚訝，偽陽性的反機率通常都很高，但是這個機率，p 值並沒有告訴你。所以必須要去算在檢定是陽性的條件下，結果是一種偽陽性的反機率；這就必須要用「貝式定理」來算。

*當醫生替你診斷出陽性反應時先別緊張，也許偽陽性的反機率（也就是其實你沒病的機率）比你想像中的高。圖／wiki*

雖然在座有很多可能比我更高明的貝氏統計學家，但我還是要說明一下貝式定理。先舉一個我終身難忘的例子，剛剛陳老師說我是台大電機系畢業的，我在電機系的時候修過機率這一門課。我記得當時的期中考，老師出了一個題目，說我口袋裡面有三個銅板，其中有一個銅板是有偏差的銅板，偏差的銅板它得到正面的機率是 1/3 ——不是 1/2——而得到反面的機率是 2/3。考題問：現在我隨機從口袋裡面掏出一個銅板，這個銅板是那個偏差銅板的機率是多少？很簡單大家不要想太多，1/3 嘛。可是我現在拿銅板丟了一下，出現的是正面，我再問你這個銅板是那個偏差銅板的機率是多少？我不期望大家立刻回答，因為要用貝式定理來算，當你獲得新的資訊的時候，新的資訊會更新原來的機率。這裡我也沒有時間詳細告訴大家怎麼算，但是可以告訴大家，結果是 1/4。

如果我丟擲銅板，它得到了正面，它是偏差銅板的機率變成只有 1/4。這是因為偏差銅板出現正面的機率，比正常銅板要小，所以出現正面的話，它相對來講就比較不太可能是偏差的銅板，所以機率會比原來的 1/3 小些，只有 1/4。（大家可以想像如果偏差銅板出現正面的機率是 0，而丟擲得到正面，則此銅板是偏差銅板的機率當然是 0。）原來所知的「1/3 的機率是偏差銅板、2/3 的機率是正常銅板」這個機率分配在貝氏定理中叫做先驗機率（prior probability）。大家要建立這個概念，即是還沒觀察到數據之前，對於模型的機率有一些估計，這些估計就叫做先驗機率。至於觀察到數據之後所更新的模型機率，1/4 和 3/4，這個機率分配叫做後驗機率（posterior probability），也就是前面所說的反機率（inverse probability）。

-----廣告，請繼續往下閱讀-----

*從擲銅板的例子來看貝式定理，當你獲得新的資訊的時候，新的資訊會更新原來的機率。圖／Jimmie @ Flickr*

我們再來看另外一個跟統計檢定問題非常接近的例子。可以用剛剛身體檢查的例子，但我這裡用美國職棒大聯盟對球員的藥物檢查為例，也許比較有趣。這裡假設大約有 6 % 的美國 MLB 的球員使用 PED（performance enhancing drugs），這是一種可以增強體能表現的藥物，是類固醇之類的藥物。這個估計數字可能是真的，是我從網頁上抓下來的。這邊的 6 % 即為我前面說的先驗機率：隨機選出一個球員，則他有使用 PED 的機率是 0.06，沒有使用 PED 的機率是 0.94。現在大聯盟的球員都要經過藥檢；舉大家熟知的火箭人 Roger Clemens 為例。他也是我心目中的棒球英雄，他被檢定有陽性的反應。

為了方便起見，假設藥檢的準確度是 95 %。所謂準確度 95 %的定義是：如果一個球員有使用藥物，他被檢定出來呈陽性反應的機率是 0.95；如果一個球員沒有使用藥物，他被檢定出來呈陰性反應的機率也是 0.95。也就是我假設兩種誤差類型的機率 α 跟 β 都是 0.05。在這假設之下，使用貝式定理來計算，當球員被篩檢得到的結果是陽性，但他並不是 PED 使用者的後驗機率或反機率，其實高達 0.45。大家可以從圖三看到貝氏定理如何可以算出這個機率。（圖三）

使用貝式定理算出來的結果大家應該會覺得很詫異，因為我們藥物篩檢的工具應該是很準確的，0.95 在我們想像中應該是很準確的，我們認為說我們錯誤的可能性只有 5 %，其實不然。檢定是陽性，但其實偽陽性的反機率可以高達45 %！所以雖然我不是醫學專家，不過大家健康檢查，如果醫生說，你的檢查結果呈現陽性反應，大家先不要慌張，你要先問一下醫生檢驗的準確度大概有多少，如果一個真正有這種病的人來檢定，呈現偽陽性的機率有多少？如果一個沒有病的人來檢定，呈現偽陰性的機率有多少，然後再問他先驗機率大概有多少？然後自己用貝氏定理去算一下偽陽性的反機率。醫學上很多疾病，在所有人口裡面，得病的比例通常很小的。也就是說，得病的先驗機率通常都很小，所以偽陽性的反機率會很大。

現在換成了統計檢定，看下圖的表格。（圖四）這表格跟圖三的表格很像，只是把內容改成了圖二的內容：虛無假設是真的、或是假的，然後統計檢定是顯著、或是不顯著的。然後再加上一行先驗機率，就是「虛無假設是對的」的先驗機率有多少、「虛無假設是錯的」的先驗機率有多少，都用符號來代替數目。我們可以用貝式理得到一個公式，顯示偽陽性的反機率是統計水準 α、檢定強度（power = 1 – β）、和研究假設之先驗機率（P（H_A））的函數。α 跟檢定強度都沒問題，但公式裡頭用到先驗機率。你會問：在統計檢定裡面，先驗機率是什麼？

-----廣告，請繼續往下閱讀-----

在此我必須要稍微說明一下，先驗機率，以淺白的話來講，跟你的理論有關係，怎麼說呢？如同剛剛提到 ESP 的實驗，好像只要就這樣用力去猜，你猜對的可能性就會比較高。發表這樣子的實驗報告，我們有沒有辦法告訴讀者，當受測者這樣皺著眉頭去想的時候，到底是什麼樣的一個因果機制，能夠去猜到圖片是出現在左邊還是右邊。

一般來說這種 ESP 的實驗，是沒有這種理論的，是在完全沒有理論的條件之下來做實驗。在此情況之下，我們可以說，此研究假設的先驗機率很小很小。當然我們作政治學的研究就不一樣，我們可能引用很多前人的著作，都有一個文獻回顧，我們也引用很多理論，然後我們說：我們的研究假設是很有可能展的。假如你有很好的理論，你的研究假設的先驗機率就會比較高，在這種情況之下，問題會比較小。但是還有一個問題，就是如果從文獻裡面來建立理論，來判定你的研究假設的先驗機率有多少，問題出在於：通常文獻回顧是從學術期刊裡面得來，而現在所有的學術期刊，發表的都是顯著的結果，不顯著的結果通通都沒有發表，從學術期刊上來判斷研究假設的先驗機率有多少，這樣的判斷是有偏差的。這是我今天要講的第二個問題，現在先繼續討論偽陽性反機率的問題。

現在要詳細討論影響偽陽性反機率的因素，就是影響到「統計檢定是顯著的條件之下，虛無假設為真」這一個機率的因素。這裡再重覆一下，我們一般了解的統計推論，奠基於虛無假設為真時，p 值顯著的機率，也就是偽陽性的機率被控制在 α 之內：Pr（Test=+|H₀）= Pr（p<α|H₀） = α。但我們現在要反過來問的是：統計檢定是顯著的情況下，H₀為真的機率，也就是偽陽性的反機率：Pr（H₀| Test=+）= Pr（H₀| p<α），這好比篩檢結果為陽性、但其實球員並未使用 PED、患者其實無病的機率。如果 α 等於零，可以很清楚的發現，這兩個機率是一樣的，都是零；但 α 不等於零的時候，它們就不一樣。由下圖來看，偽陽性的反機率跟先驗機率－研究假設的先驗機率－以及檢驗的強度有關。（圖五、六）看圖可以得知，power 越大，還有先驗機率越大的話，偽陽性的反機率就越小。可是當 power 越小的時候，還有先驗機率越小的時候，偽陽性的反機率就越大。

我做了一個表，列出研究假設的先驗機率，從最小排列到最大，可以看到在不同檢定強度之下，偽陽性的反機率是多少。（圖七）它可以高到近乎 1.00。換句話說，研究假設的先驗機率如果很小很小，則即使 p 值檢定顯著，但虛無假設仍然為真的機率其實還是很大很大的。如果研究假設的先驗機率是 0.5 ——你事先也許不知道哪一個是對的，你假設是 0.5，就像丟銅板一樣，此時，偽陽性的反機率才是 0.05，才跟 α 一樣。也就是說，研究假設的先驗機率必須要高於 0.5，偽陽性的反機率才會小於 0.05。可是假如你的研究假設，譬如剛剛提到的 ESP 研究，這種實驗沒有什麼理論、沒有什麼因果關係，然後你就去做了一個統計分析。換句話說這個研究假設的先驗機率可能很低，此時偽陽性的反機率其實是很高的。圖七第一欄是假設 power 為 0.95，如果 power 低一點到 0.75 呢？如果是 0.50 呢？我們可以看到其實結果差不多。當然 power 越低，問題會越嚴重，但其實差不多，當你的先驗機率是 0.5 的時候，原來是 0.05，現在是 0.09，所以差別不是特別大。原則上，power 對於偽陽性反機率的作用不是那麼強，作用強的是 prior，即是研究假設的先驗機率。

小結：當檢定強度或研究假設的先驗機率甚低的時候，α = 0.05 可能嚴重低估了偽陽性之反機率，也就是在 p 值檢定顯著的情況下，虛無假設 H₀仍然極有可能為真，而其為真的條件機率可能甚大於 α。此時如果我們拒絕虛無假設，便作出了錯誤的統計推論。

請繼續閱讀下篇：《p 值的陷阱（下）：「摘櫻桃」問題》

本文《看電影學統計：p 值的陷阱》轉載自 Tse-min Lin 的部落格。

-----廣告，請繼續往下閱讀-----

發表意見

文章難易度

剛好

太難

所有討論 0

登入與大家一起討論

林澤民

37 篇文章・ 248 位粉絲

台大電機系畢業，美國明尼蘇達大學政治學博士，現任教於美國德州大學奧斯汀校區政府系。林教授每年均參與中央研究院政治學研究所及政大選研中心「政治學計量方法研習營」(Institute for Political Methodology)的教學工作，並每兩年5-6月在台大政治系開授「理性行為分析專論」密集課程。林教授的中文部落格多為文學、藝術、政治、社會、及文化評論。

TRENDING 熱門討論

即時熱門

1 2026/04/24

1 2026/04/04

2 2026/04/04

0

二尖瓣逆流微創治療進展，達文西機械手臂二尖瓣修補手術、不停跳二尖瓣腱索植入修補手術、經導管二尖瓣夾合術解析，心臟血管外科醫師圖文懶人包

0

文字

0

為什麼越累越難睡?當大腦想下班，「腸道」卻還在加班！

鳥苷三磷酸 (PanSci Promo) ・2026/04/30 ・2519字・閱讀時間約 5 分鐘

相關標籤：

熱門標籤：

本文與益福生醫合作，泛科學企劃執行

昨晚，你又在床上翻來覆去、無法入眠了嗎？這或許是現代社會最普遍的深夜共鳴。儘管換了昂貴的乳膠枕、拉上百分之百遮光的窗簾，甚至在腦海中數了幾百隻羊，大腦的那個「睡眠開關」卻彷彿生鏽般卡住。這種渴望休息卻睡不著的過程，讓失眠成了一場耗損身心的極限馬拉松。

皮質醇：你體內那位「永不熄滅」的深夜警報器

要理解失眠，我們得先認識身體的一套精密防衛系統：下視丘-垂體-腎上腺軸（HPA axis） 。這套系統原本是演化給我們的禮物，讓我們在面對劍齒虎或突如其來的危險時，能迅速進入「戰鬥或快逃」的備戰狀態。當這套系統啟動，腎上腺就會分泌皮質醇 (壓力荷爾蒙)，這種荷爾蒙能調動能量、提高警覺性，讓我們在危機中保持清醒。

然而，現代人的「劍齒虎」不再是野獸，而是無止盡的專案進度、電子郵件與職場競爭。對於長期處於高壓或高強度工作環境的人們來說，身體的警報系統可能處於一種「切換不掉」的狀態。

-----廣告，請繼續往下閱讀-----

在理想的狀態下，人類的生理時鐘像是一場精確的接力賽。入夜後，身體會進入「修復模式」，此時壓力荷爾蒙「皮質醇」的濃度應該降至最低點，讓「睡眠荷爾蒙」褪黑激素（Melatonin）接棒主導。褪黑激素不僅負責傳遞「天黑了」的訊號，它還能抑制腦中負責維持清醒的食慾素（Orexin）神經元，幫助大腦順利關閉覺醒開關。

對於長期處於高壓或高強度工作環境的人們來說，身體的警報系統可能處於一種「切換不掉」的狀態 / 圖片來源：envato

然而，當壓力介入時，這場接力賽就會變成跑不完的馬拉松賽。研究指出，長期的高壓環境會導致 HPA 軸過度活化，使得夜間皮質醇異常分泌。這不僅會抑制褪黑激素的分泌，更會讓食慾素在深夜裡持續活化，強迫大腦維持在「高覺醒狀態（Hyperarousal）」。這種令人崩潰的狀態就是，明明你已經累到不行，但大腦卻像停不下來的發電機！

長期的睡眠不足會導致體內促發炎細胞激素上升，而發炎反應又會進一步活化 HPA 軸，分泌更多皮質醇來試圖消炎，高濃度的皮質醇會進一步干擾深層睡眠與快速動眼期（REM），導致睡眠品質變得低弱又破碎，最終形成「壓力－發炎－失眠」的惡行循環。也就是說，你不是在跟睡眠上的意志力作對，而是在跟失控的生理長期鬥爭。

從腸道重啟好眠開關：PS150 菌株如何調校你的生理時鐘

面對這種煞車失靈的失眠困局，科學家們將目光投向了人體內另一個繁榮的生態系：腸道。腸道與大腦之間存在著一條雙向通訊的高速公路，這就是「菌-腸-腦軸 (Microbiome-Gut-Brain Axis, MGBA)」，而某些特殊菌株不僅能幫助消化、排便，更能透過神經與內分泌途徑與大腦對話，直接參與調節我們的壓力調節與睡眠節律。這種菌株被科學家稱為「精神益生菌」（Psychobiotics）。

-----廣告，請繼續往下閱讀-----

腸道與大腦之間存在著一條雙向通訊的高速公路，這就是「菌-腸-腦軸 (Microbiome-Gut-Brain Axis, MGBA)」/圖片來源：益福生醫

在眾多研究菌株中，發酵乳桿菌 Limosilactobacillus fermentum PS150 的表現格外引人注目。PS150菌株源於亞洲益生菌權威「蔡英傑教授」團隊的專業研發，累積多年功能性菌株研發經驗的科學成果。針對臨床常見的「初夜效應」（First Night Effect, FNE），也就是現代人因出差、換床或環境改變導致的入睡困難，俗稱認床。科學家在進行實驗時發現，補充 PS150 菌株能顯著恢復非快速動眼期（NREM）的睡眠長度，且入睡更快，起床後也更容易清醒。更重要的是，不同於常見的藥物助眠手段（如抗組織胺藥物 DIPH）容易造成快速動眼期（REM）剝奪或導致睡眠破碎化，PS150 菌株展現出一種更為「溫和且自然」的調節力，它能有效縮短入睡所需的時間，並恢復睡眠中代表深層修復的「Delta 波」能量。

科學家發現，即便將 PS150 菌株經過特殊的熱處理（Heat-treated），轉化為不具活性但保有關鍵成分的「後生元」（Postbiotics），其生物活性依然能與活菌媲美。HT-PS150 技術解決了益生菌在儲存與攝取過程中容易失去活性的痛點，讓這些腸道通訊員能更穩定地發揮作用。

在臨床實驗中，科學家觀察到一個耐人尋味的現象：當詢問受試者的主觀感受時，往往會遇到強大的「安慰劑效應」，無論是服用 HT-PS150 還是安慰劑的人，主觀上大多表示睡眠變好了。這種「體感上的進步」有時會掩蓋真相，讓人分不清是心理作用還是真實效益。

然而，客觀的生理數據（Biomarkers）卻揭開了關鍵的差異。在排除主觀偏誤後，實驗數據顯示 HT-PS150 組有更高比例的人（84.6%）出現了夜間褪黑激素分泌增加，且壓力荷爾蒙（皮質醇）顯著下降，這證明了菌株確實啟動了體內的睡眠調控系統，而不僅僅是心理安慰。

-----廣告，請繼續往下閱讀-----

最值得關注的是，對於那些失眠指數較高（ISI ≧ 8）的族群，這種「生理修復」與「主觀體感」終於達成了一致。這群人在補充 HT-PS150 後，不僅生理標記改善，連原本嚴重困擾的主觀睡眠效率、持續時間，以及焦慮感也出現了顯著的進步。

了解更多PS150助眠益生菌：https://lihi3.me/KQ4zi

重新定義深層睡眠：構建全方位的深夜修復計畫

睡眠從來就不只是單純的休息，而是一場生理功能的全面重整。想要重獲高品質的睡眠，關鍵在於為自己建立一個全方位的修復生態系。

這套系統的基石，始於良好的生活習慣。從減少睡前數位螢幕的干擾、優化室內環境，到作息調整。當我們透過規律作息來穩定神經系統，並輔以現代科學對於 PS150 菌株的調節力發現，身體便能更順暢地啟動睡眠開關，回歸自然的運作節律。

-----廣告，請繼續往下閱讀-----

與其將失眠視為意志力的抗爭，不如將其看作是生理機能與腸道微生態的深度溝通。透過生活作息的調整與科學實證的支持，每個人都能擁有掌控睡眠的主動權。現在就從優化生活型態開始，為自己按下那個久違的、如嬰兒般香甜的關機鍵吧。

與其將失眠視為意志力的抗爭，不如將其看作是生理機能與腸道微生態的深度溝通 / 圖片來源 : envato

-----廣告，請繼續往下閱讀-----

發表意見

文章難易度

剛好

太難

討論功能關閉中。

鳥苷三磷酸 (PanSci Promo)

248 篇文章・ 319 位粉絲

充滿能量的泛科學品牌合作帳號！相關行銷合作請洽：contact@pansci.asia

TRENDING 熱門討論

即時熱門

104

0

文字

0

104

0

肺部為何會「結疤」？揭開比癌症更致命的「菜瓜布肺」，科學家如何找到破解惡性循環的新契機

鳥苷三磷酸 (PanSci Promo) ・2026/05/08 ・2041字・閱讀時間約 4 分鐘

相關標籤：

熱門標籤：

本文由肺纖維化(菜瓜布肺)社團衛教合作，泛科學撰文

在現代醫學的警示清單裡，乳癌、大腸癌這些疾病大家都不陌生；但有一個「隱蔽且致命」的威脅卻常被忽視，那就是「肺纖維化」。其中最常見的類型「特發性肺纖維化」（IPF），其預後往往不太樂觀，確診後的五年存活率甚至比許多常見的癌症還低。

首先，我們得先破解一個迷思：肺纖維化並不是單一疾病，而是許多種間質性肺病的共同表現。當我們聽到「肺纖維化」，腦中常浮現「菜瓜布肺」的形象，患者的肺部外觀充滿一個個空洞與疤痕，像極了乾燥的絲瓜。這精準描繪了肺部組織逐漸硬化、失去彈性的過程。

更重要的是，IPF 這類肺纖維化的威脅在於「不可逆」的特性，一旦形成就很難逆轉。這跟部分 COVID-19 康復者身上、仍有機會復原的肺纖維化，是兩種完全不同的概念。

-----廣告，請繼續往下閱讀-----

IPF 這類肺纖維化的威脅在於「不可逆」的特性，一旦形成就很難逆轉 / 圖示來源：shutterstock

肺部為何會變成「菜瓜布」？

為什麼好端端的肺會變成菜瓜布？這其實是一場身體修復機制失控的結果。

「纖維化」的組織，就是肺部間質組織（interstitium）的疤痕化。間質是圍繞在肺泡周圍，包含血管與支持肺部結構的結締組織。在正常情況下，肺部損傷後會啟動修復機制，並再生健康組織。但在肺纖維化的患者體內，這套修復機制卻「當機」了。

身體會不斷地發出訊號，導致負責修復工作的「纖維母細胞」（fibroblasts）被過度活化，進而失控地沉積膠原蛋白疤痕組織，最終在肺部形成永久性的纖維化。

科學家發現，這個過程之所以棘手，在於它是一個「惡性循環」，肺部同時存在著「發炎反應」與「纖維化」這兩條路徑，它們相互加乘，演變成難以阻斷的強大破壞力。

-----廣告，請繼續往下閱讀-----

雖然特發性肺纖維化 (IPF) 的具體成因不明，但已知某些特定族群的風險更高。例如抽菸，特定年齡與性別(50歲以上男性)、長期暴露於粉塵環境的工作者(農業、畜牧業、採礦業…)、胃食道逆流者。此外，患有自體免疫疾病（如類風濕性關節炎、乾燥症、硬皮症、皮肌炎/多發性肌炎，）的患者，他們併發肺纖維化的機率遠高於一般人，必須特別警覺。

雖然特發性肺纖維化 (IPF) 的具體成因不明，但已知某些特定族群的風險更高。/ 圖示來源：shutterstock

打斷惡性循環的挑戰，為何只對抗「纖維化」還不夠？

面對這個不可逆的疾病，醫學界長年束手無策，直到 2014 年才迎來一道曙光。美國 FDA 批准了兩種機制不同的新藥：Nintedanib 和 Pirfenidone。這兩種藥物的出現是治療史上的分水嶺，首度被證實能夠「延緩」IPF 患者肺功能的惡化速度。

然而，這場戰役尚未結束。現有的治療雖然帶來了希望，卻也凸顯了「未被滿足的醫療需求」。從機制上來看，這些藥物主要抑制的是「纖維化路徑」。

這讓科學界開始思考這個未被滿足的棘手問題：既然疾病的本質是「發炎」與「纖維化」的雙重打擊，那麼，我們是否能找到「同時抑制」這兩條路徑的全新策略，從而更有效地打斷這個惡性循環？

-----廣告，請繼續往下閱讀-----

找到同時調控「發炎」與「纖維化」的新靶點

為了解決難題，科學家將目光鎖定在一個細胞內的酵素：磷酸二酯酶 4B（PDE4B）。

為什麼鎖定它？讓我們看看它的「雙重作用」機制：

關鍵位置： PDE4B 同時存在於免疫細胞（與發炎有關）與纖維母細胞（與纖維化有關）當中。
作用機制： PDE4B 的主要工作是降解細胞內一種叫 cAMP（環磷酸腺苷） 的訊號分子。cAMP 可以被視為細胞內的「穩定信號」。
雙重抑制： 當我們使用藥物抑制了 PDE4B 的活性，細胞內的 cAMP 就不會被分解，濃度會隨之升高。高濃度的 cAMP 能穩定免疫細胞和纖維母細胞，同時產生抗發炎與抗纖維化的雙重效應。

簡單來說，鎖定並抑制 PDE4B，就像是同時抑制了免疫風暴與纖維化的工程，有望從雙從抑制打擊這個惡性循環。

全球臨床試驗帶來的新希望

近十年來，全球在肺纖維化領域投入了大量的臨床試驗，我們相信，在科學家逐步破解肺纖維化惡性循環的複雜難題後，期盼未來能為無數患者爭取到更安全、健康的生活與未來。

-----廣告，請繼續往下閱讀-----

最後，我們必須再次提醒，特發性肺纖維化（IPF）與漸進性肺纖維化（PPF）是極具破壞性、且不可逆的疾病。面對這個比癌症更致命的對手，雖然現有的治療手段能延緩惡化，但無法逆轉已經形成的肺部疤痕組織，因此「早期診斷、早期治療」仍是對抗肺纖維化最重要的黃金時刻。

必須再次提醒，特發性肺纖維化（IPF）與漸進性肺纖維化（PPF）是極具破壞性、且不可逆的疾病。/ 圖示來源：

-----廣告，請繼續往下閱讀-----

發表意見

文章難易度

剛好

太難

討論功能關閉中。

鳥苷三磷酸 (PanSci Promo)

248 篇文章・ 319 位粉絲

充滿能量的泛科學品牌合作帳號！相關行銷合作請洽：contact@pansci.asia

TRENDING 熱門討論

即時熱門

4

3

文字

0

4

3

看電影學統計：「多重宇宙」與統計學「隨機變異」的概念

林澤民・2023/03/15 ・2854字・閱讀時間約 5 分鐘

相關標籤：

熱門標籤：

-----廣告，請繼續往下閱讀-----

本文轉載自林澤民的部落格

「多重宇宙」是我教統計時常用到的名詞，我用它來解釋隨機變異（stochastic variation）的概念：

例如民調抽得一個樣本，此樣本的受訪者固然是一群特定人士，但理論上我們可以抽出許多許多樣本，這些樣本之間雖然會有隨機變異，但樣本彼此的宏觀性質仍會相近。這些不同的隨機樣本，可以以「多重宇宙」一詞來形容。即使事實上只有一個樣本（一個宇宙），我們可以想像在多重宇宙的每個宇宙裡，都有一個微觀上隨機變異的樣本存在。

一個樣本（一個宇宙），在多重宇宙裡，每個宇宙都有一個微觀上隨機變異的樣本存在。圖／IMDb

什麼是隨機樣本？

其實，數理統計學中「隨機樣本」（random sample）的概念指的是「一組獨立且同一分布的隨機變數」（a set of independently and identically distributed random variables）。

在這個定義之下，樣本的每一個單位（資料點）都不是固定不變的數值，而是一個依循某機率分布的隨機變數。「隨機樣本」的要求是樣本所有的Ｎ個單位不但要互相獨立，而且要依循同一的機率分布。

我們可以想像我們平常所謂「一個樣本」的Ｎ個觀察值，每一個觀察值背後都有一個產生這個數值的隨機變數，也可以說所謂「一個樣本」其實只是這「一組獨立且同一分布的隨機變數」的一個「實現」（realization）。那麼，不同的樣本就是這「一組獨立且同一分布的隨機變數」的不同「實現」。這樣了解之下的不同樣本、不同「實現」，我喜歡把它們稱為「多重宇宙」。

-----廣告，請繼續往下閱讀-----

多重宇宙中的隨機變異，是我們在分析一個樣本的資料時必須作統計推論的原因。

比如我們分析本屆所有 113 位立委的議事行為，既然立委一共只有 113 人，我們分析的對象不就是立委的母體嗎？那是不是就不必做統計推論？

不是！原因是我們仍然可以想像有多重宇宙存在，每個宇宙都有 113 位立委，而同一位立委在不同的宇宙裡其議事行為會有隨機變異。正是因為這隨機變異的緣故，我們即使分析的是所謂「母體」，我們仍然要做統計推論。

「多重宇宙」的概念可以說就是「假如我們可以重來」的反事實思想實驗。被分析的單位不是在時間中重來一次，而是在多重宇宙的空間中展現「假如我們可以重來」的隨機變異的可能性。

名為 Monday 的這集 X 檔案電視劇中，主角的夢境不斷重複，每次夢境的結構大致類似，但細節卻有所不同，這正是「多重宇宙—隨機變異」概念的戲劇化。

-----廣告，請繼續往下閱讀-----

【媽的多重宇宙】（Everything Everywhere All at Once）也是。

「看，這是你的宇宙，一個漂浮在存在宇宙泡沫中的泡泡。周圍的每個氣泡都有細微的變化。但你離你的宇宙越遠，差異就越大。」——【媽的多重宇宙】對白

這是說：變異程度越小的是離你越近的宇宙，程度越大的是離你越遠的宇宙。這裡所謂變異的程度，在統計學裡可以用誤差機率分布的標準差來衡量。

什麼是隨機變異？

關於「隨機變異」這個概念，我最喜歡的例子是研究所入學申請的評審。

例如有 120 人申請入學，我詳細閱讀每人投遞的申請資料（包括性別、年齡等個人特質還有 SOP、大學成績單、GRE 分數、推薦信等），然後打一個 Y=0～100 的分數。全部評閱完畢，我便得到一份 N=120 的資料。這個資料包括了所有的申請者，那麼它是樣本呢？還是母體？

-----廣告，請繼續往下閱讀-----

如果我要分析我自己評分的決定因素，我會把分數 Y 回歸到性別、年齡等個人特質以及資料中可以量化的變數，例如大學成績平均分數（GPA）和 GRE 分數。跑這個迴歸時，需不需要做統計推論，看迴歸係數是不是有統計的顯著性？

我的看法是這份 N=120 的資料是樣本而不是母體，做迴歸分析當然要做統計推論。

那麼我資料的母體是什麼？

迴歸分析資料的母體其實是所謂「母體迴歸函數」（population regression function），也就是通常所說的「資料產生過程」（data generating process, DGP）。

這個 DGP 就是我在評閱每份資料時腦海中的思考機制，它考量了許多量化和質化的變數，賦予不同的權重，然後加總起來產生 Y。

分析資料的母體，也就是常說的「資料產生過程」。圖／envato.elements

量化變數的權重就是母體迴歸函數的係數，質化變數則是母體迴歸函數的係數的誤差項。如果有很多質化變數攏總納入誤差項，我們通常可以根據中央極限定理，假設誤差項是呈現常態分布的隨機變數。這個誤差項就是「隨機變異」的來源。

評審入學申請，我通常只把所有資料評閱一次。這一次評審結果，會有幾家歡樂幾家愁，這便構成了一個「宇宙」。如果我第二天又把所有 120 份資料重新評分一遍，得到第二個樣本。因為我腦中的「資料產生過程」包括隨機變數，這個新樣本保證跟第一個樣本會有差異。用白話說：我的評分機制不精確，我自己甚至不知道我給每個量化變數多少權重，而且第二次評閱所用的權重也會跟第一次不盡相同，更不用說質化變數如何影響我的評分了。

-----廣告，請繼續往下閱讀-----

這第二個樣本，申請者的排比不會跟第一個樣本一樣，雖然也是幾家歡樂幾家愁，歡樂與愁悶的人也可能不一樣。這是第二個宇宙。依此類推，我們可以想像同樣的120位申請者，因為我「資料產生過程」的隨機變異，活在多重宇宙裡。

這些宇宙有的差異不大，根據【媽的多重宇宙】的說法，它們的泡泡互相之間的距離就較近，差異較大的宇宙，距離就較遠。如果申請者可以像電影所述那樣做宇宙跳躍，他們會看到自己在不同宇宙裡的命運。

我擔任德州大學政府系的研究部主任時，常耽心有申請者拿我們入學評審委員的評分資料去做迴歸分析。如果分析結果顯示種族、性別等變數有統計顯著性，說不定會被拿去控告我違反所謂「平權行動」（affirmative action）的相關法律。如果沒有顯著性，我就不耽心了。

多重宇宙之間會不會有「蝴蝶效應」？也就是宇宙跳躍時，隨機變異產生的微小差異，會不會造成新舊宇宙生命路徑的決然不同？

-----廣告，請繼續往下閱讀-----

在【媽的多重宇宙】中，伊芙琳只要當初做了一個不同的決定，以後的生命便可能跟現世（home universe）有很不一樣的命運。這在統計學也不是不可能。時間序列分析中，有些非線性模式只要初始值稍微改變，其後在時間中的路徑便會與原來的路徑發散開來。

你做時間序列分析時，會不會想想：時間序列資料究竟是樣本還是母體？如果你的研究興趣就只限於資料期間，那要不要做統計推論？當然要的，因為隨機變異的緣故。

如果你今年申請外國研究所不順利，也許在另一個宇宙裡，你不但獲名校錄取，得到鉅額獎學金，而且你的人生旅途將自此一路順遂，事業婚姻兩得意呢。

-----廣告，請繼續往下閱讀-----

發表意見

所有討論 0

登入與大家一起討論

林澤民

37 篇文章・ 248 位粉絲

台大電機系畢業，美國明尼蘇達大學政治學博士，現任教於美國德州大學奧斯汀校區政府系。林教授每年均參與中央研究院政治學研究所及政大選研中心「政治學計量方法研習營」(Institute for Political Methodology)的教學工作，並每兩年5-6月在台大政治系開授「理性行為分析專論」密集課程。林教授的中文部落格多為文學、藝術、政治、社會、及文化評論。

TRENDING 熱門討論

即時熱門