先說一個反常識的事實:拖垮 A/B 測試的,幾乎不是測錯了按鈕顏色,而是流程本身。我們在 ECPRO 電商博士編輯部覆盤過大量測試紀錄,最常見的死法有三種——假設寫得像許願、樣本量沒算就開跑、看到 B 版領先就手癢喊停。這三刀下去,你得到的不是洞察,是一場包裝成數據的自我安慰。
A/B 測試的產出不是「哪個版本贏」,而是「你學到了什麼可以複製的東西」。如果測完你說不出為什麼贏、也不敢保證下次還會贏,那這場測試等於沒做。站上另一篇談的是 A/B 測試的整體觀念,這篇我們只鑽一件事:把「假設設計→執行→判讀」這條實作流程,一步一步走給你看。
用「假設卡」框架,把想法逼成可驗證假設
我們內部要求每個測試開跑前都要填一張「假設卡(Hypothesis Card)」。這名字聽起來很儀式,但它的作用很實際:逼你在動手前把邏輯講清楚,事後才知道自己到底驗證了什麼。一張合格的假設卡有五格。
- 觀察(Observation):你在數據裡看到什麼異常?用數字說話,不是憑感覺。
- 洞察(Insight):你推測為什麼會這樣?這是你的因果假設。
- 行動(Action):你打算改什麼?只能改一件事。
- 預期(Expectation):你賭哪個主指標往哪個方向動、動多少?
- 判準(Metric):用哪個指標判輸贏,多少幅度才算贏?
對照一下就懂差距。壞假設:「把結帳按鈕改成綠色應該比較好。」——沒觀察、沒洞察、沒說要看哪個指標,測完不管輸贏你都學不到東西。好假設:「漏斗顯示 62% 的訪客在結帳頁跳出(觀察),問卷回饋集中在『不知道運費多少』(洞察),所以我要在結帳頁頂端加一條『滿 990 免運,你還差 XX 元』的動態提示(行動),預期 begin_checkout→purchase 轉換率相對提升 8% 以上(預期+判準)。」
假設綁在數據觀察上,測試才有方向;綁在個人喜好上,你只是在用流量幫老闆的審美背書。要找出最值得測的環節,先用漏斗營收試算工具算出「流失率高×金額大」的交叉點,火力集中在那裡,投報率最高。指標名詞不確定就查電商數據名詞表對齊定義。
破迷思:不是每個想法都值得變成測試
很多人以為 A/B 測試越多越好。錯。測試有機會成本——每一格流量同時只能跑一場乾淨的測試。與其把二十個小想法排隊硬測,不如先用「潛在影響 × 實作成本 × 信心度」幫想法排序(業界常稱 ICE 或 PIE 評分),把流量留給真正可能撼動營收的假設。會排優先序的團隊,一年測的次數更少,累積的有效洞察反而更多。
一次只改一個變因,測試才有歸因力
A/B 測試值錢的地方,在於「能歸因」。如果你在 B 版同時改了按鈕文案、頁面排版、又動了運費規則,就算 B 贏了,你也說不出是哪一刀奏效——下次想複製,無從下手。想同時測多個元素,那是多變量測試(MVT)的活,它需要成倍的流量把每種組合都餵飽。
對台灣多數中小型電商,我的建議很直接:先把乾淨的單變因 A/B 做熟,MVT 等你流量真的餵得起再說。歸因不清的勝利,是最貴的勝利,因為你會拿著錯誤的結論到處複製。
先估樣本量,再回推要跑多久
這是最多人跳過、也最致命的一步。絕大多數的假贏家,都誕生在「樣本還沒夠就下結論」的那一刻。樣本量由三個變數決定,缺一不可。
| 參數 | 意義 | 對樣本量的影響 |
|---|---|---|
| 基準轉換率 | 你目前這個指標的水準 | 基準越低,需要的樣本越多 |
| 最小可偵測效果(MDE) | 你希望能抓出的最小提升幅度 | 想抓越小的提升,樣本需求越大 |
| 顯著水準與檢定力 | 可接受的誤判風險(常設 95% / 80%) | 要求越嚴,樣本量越大 |
用一組估算數字讓你有體感(以下為示意估算,非特定產品實測):假設你的結帳轉換率基準是 3%,想偵測「相對提升 10%」(即拉到 3.3%),在 95% 信心、80% 檢定力下,每組大約需要數千到上萬名訪客量級的樣本。如果你把目標縮小到「相對提升 3%」,所需樣本會膨脹到十倍以上。你想抓的差距越小,付出的流量代價越是指數級上升。
實務做法:拿線上樣本量計算機,輸入基準轉換率與目標 MDE,先算出每組所需樣本,再用你的每日流量回推大約要跑幾週。這個「幾週」就是你的預定週期,是後面要死守的停止條件。
流量不夠,就別硬測小改動
如果你的站每週訂單只有兩、三位數,還硬去測「按鈕文案」這種微幅改動,可能要跑好幾個月才有結論,期間市場、季節、廣告策略早就變了三輪,結果根本不可信。小流量的店,該把賭注押在「會大幅改變行為」的方案上:整頁改版、運費策略、主打商品換位。這類改動的效果量夠大,較小的樣本就測得出來,也才對得起你有限的流量。要評估某個轉換率提升值不值得為它跑一輪,可先用轉換率提升試算把它換算成一年多賺多少。
別忘了區隔切分與外部干擾
估樣本量時要先想清楚你打算怎麼拆解結果。如果你預期這個改動只對「新客」有效,那真正進入分析的其實只有新客那一段流量,所需週期會比你直覺想的更長,要先把這段算進去。
同時要避開外部干擾期。大型促銷檔期、網站改版上線、廣告預算大幅加碼或突然停投——這些都會讓 A、B 兩組的基準同時偏移,這種期間跑出來的數字,可信度先打對折。能歸因的前提,是兩組之間除了你要測的那一項,其他條件都盡量相同。把這些前置條件想清楚,測試才不會白跑一輪。
執行期的三條紀律,比創意更重要
測試一旦開跑,最大的敵人是你自己的手癢。以下三條紀律,請當成不可談判的底線。
- 跑滿預定樣本與完整週期:至少涵蓋一到兩個完整星期,把平日與週末、發薪日前後的行為差異都包進去,別讓某天的活動或波動綁架整場結論。
- 不要「偷看就停」:每天盯著看、一看到顯著就喊停,會把你的誤判率從名目上的 5% 一路推高到二、三成。真正的停止條件只有一個——事先算好的樣本量。
- 分流要隨機且穩定:中途不要調整分流比例,也要留意別讓新舊客、行動與桌機的比例在兩組間失衡,否則你測的就不是版本差異,而是族群差異。
如果你真的很想在中途看進度、又不想拉高誤判率,正解是採用「序貫檢定」或事先規劃好的期中分析方法,而不是天天用固定門檻偷瞄。對多數團隊來說,最省事又最安全的做法還是:算好樣本、設好日期、跑滿再看。
判讀結果:統計顯著與商業意義,雙關卡缺一不可
看結果不是比誰的數字大,而是要同時通過兩道關卡。兩關都過,才算真的贏。
- 統計顯著這一關:常用 p 值與信賴區間表示。一般以 95% 信心水準為門檻,意思是「這差異純屬運氣」的機率夠低。特別看信賴區間——如果它橫跨 0(代表可能變好、也可能變壞),無論點估計看起來多漂亮,都還不能下結論。
- 商業意義這一關:就算統計上顯著,也要把提升幅度乘上你的實際流量與客單價,算出「一年真的多賺多少」。0.2% 的提升在量體夠大的站可能很可觀;量體小的話,可能還不夠補回你為此增加的維護成本。
- 區隔切分這一關(加分題):贏家常常只對某一群人有效。把結果依新客/舊客、行動/桌機、流量來源拆開看,你常能挖出「整體打平、但對新客大勝」這種被平均值蓋掉的真相。
用一張對照表把常見情境的判讀講清楚,避免你把雜訊當成勝利:
| 情境 | 統計顯著? | 該怎麼判讀 |
|---|---|---|
| B 版領先,信賴區間不含 0,樣本跑滿 | 是 | 可採用,但仍要換算商業影響再決定 |
| B 版領先,但樣本沒跑滿就急著看 | 不確定 | 不能下結論,繼續跑到預定樣本 |
| B 版領先,信賴區間橫跨 0 | 否 | 視為打平,可能只是雜訊 |
| 整體打平,但新客區隔明顯勝出 | 分群後是 | 考慮對新客上線,或再驗證一次 |
| 顯著但提升幅度極小、量體也小 | 是(但無意義) | 不值得為此增加維護成本 |
統計顯著回答「這是不是真的差異」,商業意義回答「這個差異值不值得你動手」,兩個問題要分開問。
輸的測試也要歸檔,它幫你排除了一條錯路
測完無論輸贏,都要把假設卡補完:假設是什麼、結果如何、你學到什麼、下一步怎麼接。輸的測試一樣有價值——它幫你關掉了一條看似有理、其實走不通的路,讓你把資源省給更值得的假設。把每一次測試都存進團隊的知識庫,你累積的就不只是幾個贏家版本,而是一套越來越準的商業直覺。更多測試案例與數據方法可看ECPRO 電商博士部落格。
劃重點
- 用「假設卡」五格(觀察/洞察/行動/預期/判準)把想法逼成可驗證假設,綁數據不綁喜好。
- 一次只改一個變因,測試才有歸因力;MVT 等流量餵得起再上。
- 開跑前一定要用基準轉換率、MDE、顯著水準三參數估樣本量,回推預定週期。
- 流量小就別硬測微幅改動,把賭注押在會大幅改變行為的大方案。
- 執行三紀律:跑滿週期、不偷看就停、分流隨機且穩定。
- 判讀要過雙關卡——統計顯著(看信賴區間是否含 0)+商業意義(換算年度營收),並拆區隔看。
常見問題
測試要跑多久才能停?
停止條件是「跑到事先算好的樣本量」,不是固定天數,也不是「看起來顯著了」。但實務上請至少跑滿一到兩個完整星期,把平日與週末的行為差異包進去。若你的流量回推出來要跑好幾個月,代表這個改動太小、不適合你目前的流量,該換更大的方案來測。
看到 B 版一直領先,可以提早喊停嗎?
不建議。天天用固定門檻偷看、一顯著就停,會把誤判率從 5% 推高到二、三成,你很可能採用了一個其實不存在的勝利。如果非要在中途看進度,請採用序貫檢定或事先規劃好的期中分析方法,而不是每天用同一個門檻偷瞄。
統計顯著了,是不是就一定要上線?
不一定。統計顯著只回答「這是不是真的差異」,還要過商業意義這一關:把提升幅度乘上你的實際流量與客單價,算出一年多賺多少,再對比維護成本。顯著但幅度極小、量體又小的勝利,往往不值得動手。
流量很小的電商還適合做 A/B 測試嗎?
適合,但要換打法。小流量別去測按鈕文案這種微幅改動,那要跑到天荒地老。改測整頁改版、運費策略、主打商品換位這類「效果量大」的方案,較小的樣本就能測出顯著差異,也才對得起你有限的流量。
整體結果打平,但某個族群明顯勝出,該怎麼辦?
這是很有價值的訊號,代表這個改動對特定族群(例如新客)有效、卻被其他族群的無感稀釋了。做法是:考慮只對該族群上線,或針對這個族群再獨立驗證一次。但要提醒,事後才切出來的區隔屬於探索性發現,最好用一次新測試來確認,別直接當定論。