Re: [問卦] 戴立安民調這麼浮誇 怎被吹那麼高

作者: daye2012 (大爺)   2026-09-23 14:44:35
台灣民調算是垃圾電話。正常人 90% 以上都是直接掛斷。願意耐著性子、花了5到10分鐘把
整份冗長問卷聽完並答完的,絕大多數都是政治狂熱。加成公式直接崩盤。
隱性選民不表態,再怎麼加成也是圾進,垃圾出。這種民調是業配宣傳功能。
要如果用 Nate Silver 的四大模組,台式在地化改造,
一:逼問題(Leaner Question)
在美國的做法:不知道投誰,溫和地逼問「那你稍微偏向誰?」
在台灣要改用「仇恨值與刪除法問句」
台灣選民的特質是「我很難承認我支持誰(怕被貼標籤),但我很清楚我討厭誰」。當受訪
者回答「不知道/沒決定」時,訪員要立刻問:「如果明天投票,你絕對『不會』投給哪一
位候選人?」
如果他絕對不投民進黨,那他的不表態份額,在模型裡就要被自動歸類到藍或白。
二:大數據背景推估 Fundamentals,這部分放在最後解釋
三:40,000次蒙地卡羅隨機模擬
美國假設各種不表態選民的流向,跑四萬次模擬得出勝率。
在台灣要加入「投票率震盪係數 The Weather & Sentiment Factor
台灣的隱性選民很容易受到選前最後 48 小時的事件爆發(王立強、周子瑜事件)影響而集
體轉向,或者因為下大雨就懶得出門。
跑四萬次模擬時,必須加入台灣特有的「狂熱者出門率 vs 中間選民投票率變數」。
如果投票日下大雨,中間選民投票率降到 60%,狂熱者 90% 出門,模擬結果會大幅倒向哪
一方?
用「投票率震盪」去跑四萬次,算出來的 50/50,才會是真正考慮到台灣「西瓜效應」和「
最後關頭逆轉」的真實勝率。
四:機構效應修正(House Effects)
美國把偏民主黨或偏共和黨的民調,在模型裡自動扣分或加分。
在台灣,如果一家民調的拒訪率高達 85%,代表這份民調抓到的全部都是狂熱者。這時候
,領先者的數據按比例「打折」(例如乘上 0.85),把被低估的對手數據回補修正。
這樣弄出來的民調,不會是「蔣萬安 41.7% vs 沈伯洋 40.5%」這種死板的數字。
而是「在投票率 70%下,蔣萬安的勝率是 52%,沈伯洋的勝率是 48%。但如果投票日下大雨
,蔣萬安的勝率會飆升到 65%。」
第二點的加權解釋
台灣民調大師們最喜歡用的「多變項反覆加權法(Raking)」,其加權重到多少就算「不正
確」?政大選舉研究中心曾發表過論文指出:台灣民調在經過人口結構加權後,算出來的投
票率和得票率,反而常常跟現實母體拉得更遠。
只要人為去調高或調低某個數字,就永遠沒有正確的答案。
要最逼近真實的正確調整模型,不能用「猜想」去調,而是要用「歷史投票率矩陣」做動態
扣除。
第一步:把「人口結構加權」設下死限(天花板與地板)
台灣民調最常犯的錯,是年輕人樣本不夠(例如只收到50個20歲的樣本),就強行乘以 3倍
、4倍 的權重,讓這50個人的意見代表200人。這在統計上叫「極端值放大」,把狂熱者的
意見乘了四倍。
正確做法:必須設定「加權係數上限不能超過 1.5 倍,下限不能低於 0.6 倍」。一旦發現
某個年齡層的原始電話樣本少到必須乘以 1.5 倍以上才能符合內政部人口結構時,這份民
調就應該直接作廢、重新抽樣,而不是硬著頭皮加權。這就叫做「垃圾樣本加權後還是垃圾
」。
第二步:導入「投票率權重(Likely Voter Index)」,直接對年輕人打折
年輕人不表態、投票率又低。
不能只用「內政部人口結構」來加權,必須在模型裡乘上第二個矩陣——「近三屆該類型選
舉的年齡投票率」。
以地方九合一選舉為例:20-29歲出門投票率歷史平均是 55%,60-69歲長輩是 75%。
那麼在模型中,當年輕人表態支持 A 候選人時,他的這一票在模型裡只能算 0.55 票;而
長輩表態支持 B 候選人時,長輩的這一票算 0.75 票。
只有把「支持度」跟「出門率」乘在一起,算出來的總數才是正確的。
第三步:全台最準的民調是怎麼調的?(以 2024 封關民調對答案為例)
2024 年中華民國總統大選的封關民調,最後開票出來,全台灣預測最準的機構是 聯合報(
總誤差僅 0.52%)、TVBS 民調中心(總誤差 3.61%)。
他們為什麼這麼準?因為他們在最後關頭的調整模型做了一件非常關鍵的事:「直接把未表
態率等比例剔除,重新換算 100%」。
當時很多民調(像是民眾黨內參求真民調)在加權模型上動了太多手腳,把年輕人、手機族
的權重調得太高,結果算出來柯文哲第二名,跟實際開票落差高達 16.15%,徹底翻車。
反觀聯合報與 TVBS,他們不玩花俏的「大師推估」,在完成基本的人口性別市話手機比例
微調後,直接承認那 15%~20% 的不表態者就是「未知的雜訊」,直接不予以分配,直接用
剩下有表態的 80% 選民來等比例換算。這種「少做少錯」的客觀模型,反而完美命中了最
後由長輩和狂熱者出門投出來的真實開票結果。
台灣民調的加權模型早就「走火入魔」了。 真正正確的調整,不是去通靈猜測年輕人會不
會去投票,而是「嚴格限制原始樣本的加權倍數(不超過 1.5 倍)」,並且「老老實實地
把歷史投票率當作扣分係數算進去」。只要能做到這兩點,民調就不會再出現那種贏 40%
最後只贏 5% 的戰略性笑話了。
以上用gemini 整理的資訊
※ 引述《omanorboyo (omanorboyo)》之銘言
: 四年前
: 台中 60.8% vs 18.2% -42.6%
: 實際 59.4% vs 38.9% -20.5%
: 台南 61.1% vs 15.7% -45.4%
: 實際 48.8% vs 43.6% -5.2%
: 高雄 59.1% vs 13.3% -45.8%
: 實際 58.1% vs 40.1% -18.0%
: 當時應該沒有一家像他差距這麼大
: 戴立安老師民調怎麼會被吹這麼高?

Links booklink

Contact Us: admin [ a t ] ucptt.com