查網站電商媒體電商數據榜單中心數據速報 工具箱商品比價小教室電商健檢比較清單對手對戰API關於
轉換與優化

電商 A/B 測試實作流程:從假設設計、執行紀律到統計判讀的完整方法

電商 A/B 測試實作流程:從假設設計、執行紀律到統計判讀的完整方法|ECPRO 電商博士
字級
ChatGPT 摘要 Claude 摘要 Perplexity 摘要
林克威導讀

同樣一場 A/B 測試,有人拿它換掉幾個沒把握的猜想,有人拿它反覆製造假贏家、白燒幾個月流量。差別從來不在工具,而在流程。這篇聚焦「假設設計→執行→判讀」三段實作,把每個容易翻車的環節攤開講清楚。

本文重點
  • 用「假設卡」框架,把想法逼成可驗證假設
  • 一次只改一個變因,測試才有歸因力
  • 先估樣本量,再回推要跑多久
  • 執行期的三條紀律,比創意更重要
  • 判讀結果:統計顯著與商業意義,雙關卡缺一不可
  • 輸的測試也要歸檔,它幫你排除了一條錯路

先說一個反常識的事實:拖垮 A/B 測試的,幾乎不是測錯了按鈕顏色,而是流程本身。我們在 ECPRO 電商博士編輯部覆盤過大量測試紀錄,最常見的死法有三種——假設寫得像許願、樣本量沒算就開跑、看到 B 版領先就手癢喊停。這三刀下去,你得到的不是洞察,是一場包裝成數據的自我安慰。

A/B 測試的產出不是「哪個版本贏」,而是「你學到了什麼可以複製的東西」。如果測完你說不出為什麼贏、也不敢保證下次還會贏,那這場測試等於沒做。站上另一篇談的是 A/B 測試的整體觀念,這篇我們只鑽一件事:把「假設設計→執行→判讀」這條實作流程,一步一步走給你看。

用「假設卡」框架,把想法逼成可驗證假設

我們內部要求每個測試開跑前都要填一張「假設卡(Hypothesis Card)」。這名字聽起來很儀式,但它的作用很實際:逼你在動手前把邏輯講清楚,事後才知道自己到底驗證了什麼。一張合格的假設卡有五格。

  • 觀察(Observation):你在數據裡看到什麼異常?用數字說話,不是憑感覺。
  • 洞察(Insight):你推測為什麼會這樣?這是你的因果假設。
  • 行動(Action):你打算改什麼?只能改一件事。
  • 預期(Expectation):你賭哪個主指標往哪個方向動、動多少?
  • 判準(Metric):用哪個指標判輸贏,多少幅度才算贏?

對照一下就懂差距。壞假設:「把結帳按鈕改成綠色應該比較好。」——沒觀察、沒洞察、沒說要看哪個指標,測完不管輸贏你都學不到東西。好假設:「漏斗顯示 62% 的訪客在結帳頁跳出(觀察),問卷回饋集中在『不知道運費多少』(洞察),所以我要在結帳頁頂端加一條『滿 990 免運,你還差 XX 元』的動態提示(行動),預期 begin_checkout→purchase 轉換率相對提升 8% 以上(預期+判準)。」

假設綁在數據觀察上,測試才有方向;綁在個人喜好上,你只是在用流量幫老闆的審美背書。要找出最值得測的環節,先用漏斗營收試算工具算出「流失率高×金額大」的交叉點,火力集中在那裡,投報率最高。指標名詞不確定就查電商數據名詞表對齊定義。

破迷思:不是每個想法都值得變成測試

很多人以為 A/B 測試越多越好。錯。測試有機會成本——每一格流量同時只能跑一場乾淨的測試。與其把二十個小想法排隊硬測,不如先用「潛在影響 × 實作成本 × 信心度」幫想法排序(業界常稱 ICE 或 PIE 評分),把流量留給真正可能撼動營收的假設。會排優先序的團隊,一年測的次數更少,累積的有效洞察反而更多。

一次只改一個變因,測試才有歸因力

A/B 測試值錢的地方,在於「能歸因」。如果你在 B 版同時改了按鈕文案、頁面排版、又動了運費規則,就算 B 贏了,你也說不出是哪一刀奏效——下次想複製,無從下手。想同時測多個元素,那是多變量測試(MVT)的活,它需要成倍的流量把每種組合都餵飽。

對台灣多數中小型電商,我的建議很直接:先把乾淨的單變因 A/B 做熟,MVT 等你流量真的餵得起再說。歸因不清的勝利,是最貴的勝利,因為你會拿著錯誤的結論到處複製。

先估樣本量,再回推要跑多久

這是最多人跳過、也最致命的一步。絕大多數的假贏家,都誕生在「樣本還沒夠就下結論」的那一刻。樣本量由三個變數決定,缺一不可。

參數意義對樣本量的影響
基準轉換率你目前這個指標的水準基準越低,需要的樣本越多
最小可偵測效果(MDE)你希望能抓出的最小提升幅度想抓越小的提升,樣本需求越大
顯著水準與檢定力可接受的誤判風險(常設 95% / 80%)要求越嚴,樣本量越大

用一組估算數字讓你有體感(以下為示意估算,非特定產品實測):假設你的結帳轉換率基準是 3%,想偵測「相對提升 10%」(即拉到 3.3%),在 95% 信心、80% 檢定力下,每組大約需要數千到上萬名訪客量級的樣本。如果你把目標縮小到「相對提升 3%」,所需樣本會膨脹到十倍以上。你想抓的差距越小,付出的流量代價越是指數級上升。

實務做法:拿線上樣本量計算機,輸入基準轉換率與目標 MDE,先算出每組所需樣本,再用你的每日流量回推大約要跑幾週。這個「幾週」就是你的預定週期,是後面要死守的停止條件。

流量不夠,就別硬測小改動

如果你的站每週訂單只有兩、三位數,還硬去測「按鈕文案」這種微幅改動,可能要跑好幾個月才有結論,期間市場、季節、廣告策略早就變了三輪,結果根本不可信。小流量的店,該把賭注押在「會大幅改變行為」的方案上:整頁改版、運費策略、主打商品換位。這類改動的效果量夠大,較小的樣本就測得出來,也才對得起你有限的流量。要評估某個轉換率提升值不值得為它跑一輪,可先用轉換率提升試算把它換算成一年多賺多少。

別忘了區隔切分與外部干擾

估樣本量時要先想清楚你打算怎麼拆解結果。如果你預期這個改動只對「新客」有效,那真正進入分析的其實只有新客那一段流量,所需週期會比你直覺想的更長,要先把這段算進去。

同時要避開外部干擾期。大型促銷檔期、網站改版上線、廣告預算大幅加碼或突然停投——這些都會讓 A、B 兩組的基準同時偏移,這種期間跑出來的數字,可信度先打對折。能歸因的前提,是兩組之間除了你要測的那一項,其他條件都盡量相同。把這些前置條件想清楚,測試才不會白跑一輪。

執行期的三條紀律,比創意更重要

測試一旦開跑,最大的敵人是你自己的手癢。以下三條紀律,請當成不可談判的底線。

  1. 跑滿預定樣本與完整週期:至少涵蓋一到兩個完整星期,把平日與週末、發薪日前後的行為差異都包進去,別讓某天的活動或波動綁架整場結論。
  2. 不要「偷看就停」:每天盯著看、一看到顯著就喊停,會把你的誤判率從名目上的 5% 一路推高到二、三成。真正的停止條件只有一個——事先算好的樣本量。
  3. 分流要隨機且穩定:中途不要調整分流比例,也要留意別讓新舊客、行動與桌機的比例在兩組間失衡,否則你測的就不是版本差異,而是族群差異。

如果你真的很想在中途看進度、又不想拉高誤判率,正解是採用「序貫檢定」或事先規劃好的期中分析方法,而不是天天用固定門檻偷瞄。對多數團隊來說,最省事又最安全的做法還是:算好樣本、設好日期、跑滿再看。

判讀結果:統計顯著與商業意義,雙關卡缺一不可

看結果不是比誰的數字大,而是要同時通過兩道關卡。兩關都過,才算真的贏。

  • 統計顯著這一關:常用 p 值與信賴區間表示。一般以 95% 信心水準為門檻,意思是「這差異純屬運氣」的機率夠低。特別看信賴區間——如果它橫跨 0(代表可能變好、也可能變壞),無論點估計看起來多漂亮,都還不能下結論。
  • 商業意義這一關:就算統計上顯著,也要把提升幅度乘上你的實際流量與客單價,算出「一年真的多賺多少」。0.2% 的提升在量體夠大的站可能很可觀;量體小的話,可能還不夠補回你為此增加的維護成本。
  • 區隔切分這一關(加分題):贏家常常只對某一群人有效。把結果依新客/舊客、行動/桌機、流量來源拆開看,你常能挖出「整體打平、但對新客大勝」這種被平均值蓋掉的真相。

用一張對照表把常見情境的判讀講清楚,避免你把雜訊當成勝利:

情境統計顯著?該怎麼判讀
B 版領先,信賴區間不含 0,樣本跑滿可採用,但仍要換算商業影響再決定
B 版領先,但樣本沒跑滿就急著看不確定不能下結論,繼續跑到預定樣本
B 版領先,信賴區間橫跨 0視為打平,可能只是雜訊
整體打平,但新客區隔明顯勝出分群後是考慮對新客上線,或再驗證一次
顯著但提升幅度極小、量體也小是(但無意義)不值得為此增加維護成本

統計顯著回答「這是不是真的差異」,商業意義回答「這個差異值不值得你動手」,兩個問題要分開問。

輸的測試也要歸檔,它幫你排除了一條錯路

測完無論輸贏,都要把假設卡補完:假設是什麼、結果如何、你學到什麼、下一步怎麼接。輸的測試一樣有價值——它幫你關掉了一條看似有理、其實走不通的路,讓你把資源省給更值得的假設。把每一次測試都存進團隊的知識庫,你累積的就不只是幾個贏家版本,而是一套越來越準的商業直覺。更多測試案例與數據方法可看ECPRO 電商博士部落格

劃重點

  • 用「假設卡」五格(觀察/洞察/行動/預期/判準)把想法逼成可驗證假設,綁數據不綁喜好。
  • 一次只改一個變因,測試才有歸因力;MVT 等流量餵得起再上。
  • 開跑前一定要用基準轉換率、MDE、顯著水準三參數估樣本量,回推預定週期。
  • 流量小就別硬測微幅改動,把賭注押在會大幅改變行為的大方案。
  • 執行三紀律:跑滿週期、不偷看就停、分流隨機且穩定。
  • 判讀要過雙關卡——統計顯著(看信賴區間是否含 0)+商業意義(換算年度營收),並拆區隔看。

常見問題

測試要跑多久才能停?

停止條件是「跑到事先算好的樣本量」,不是固定天數,也不是「看起來顯著了」。但實務上請至少跑滿一到兩個完整星期,把平日與週末的行為差異包進去。若你的流量回推出來要跑好幾個月,代表這個改動太小、不適合你目前的流量,該換更大的方案來測。

看到 B 版一直領先,可以提早喊停嗎?

不建議。天天用固定門檻偷看、一顯著就停,會把誤判率從 5% 推高到二、三成,你很可能採用了一個其實不存在的勝利。如果非要在中途看進度,請採用序貫檢定或事先規劃好的期中分析方法,而不是每天用同一個門檻偷瞄。

統計顯著了,是不是就一定要上線?

不一定。統計顯著只回答「這是不是真的差異」,還要過商業意義這一關:把提升幅度乘上你的實際流量與客單價,算出一年多賺多少,再對比維護成本。顯著但幅度極小、量體又小的勝利,往往不值得動手。

流量很小的電商還適合做 A/B 測試嗎?

適合,但要換打法。小流量別去測按鈕文案這種微幅改動,那要跑到天荒地老。改測整頁改版、運費策略、主打商品換位這類「效果量大」的方案,較小的樣本就能測出顯著差異,也才對得起你有限的流量。

整體結果打平,但某個族群明顯勝出,該怎麼辦?

這是很有價值的訊號,代表這個改動對特定族群(例如新客)有效、卻被其他族群的無感稀釋了。做法是:考慮只對該族群上線,或針對這個族群再獨立驗證一次。但要提醒,事後才切出來的區隔屬於探索性發現,最好用一次新測試來確認,別直接當定論。

電商博士小教室

本文相關的 KPI 公式

轉換率CVR
轉換率 = 下單人數 ÷ 總訪客數 × 100%

每 100 個進站的人,最後有幾個真的下單。衡量網站「把流量變訂單」的能力。

平均客單價AOV
客單價 = 總營收 ÷ 總訂單數

平均每一筆訂單貢獻多少營收。提高客單價是不靠加流量就增加營收的捷徑。

看完整電商 KPI 公式庫 →
ECPRO 數據觀察

用真實數據延伸這個主題

ECPRO 電商博士實測逾 10 萬個台灣電商網站。想用數據驗證本文觀點,延伸閱讀這幾份實測報告:

覺得有用?分享出去
LINE Facebook X Threads

常見問題

測試要跑多久才能停?

停止條件是「跑到事先算好的樣本量」,不是固定天數,也不是「看起來顯著了」。實務上至少跑滿一到兩個完整星期,把平日與週末差異包進去。若回推要跑好幾個月,代表這個改動太小、不適合你目前的流量,該換更大的方案來測。

看到 B 版一直領先,可以提早喊停嗎?

不建議。天天用固定門檻偷看、一顯著就停,會把誤判率從 5% 推高到二、三成,你很可能採用了一個不存在的勝利。若非要看中途進度,請用序貫檢定或事先規劃的期中分析方法,而不是每天用同一門檻偷瞄。

統計顯著了,是不是就一定要上線?

不一定。統計顯著只回答「這是不是真的差異」,還要過商業意義這關:把提升幅度乘上實際流量與客單價,算出一年多賺多少,再對比維護成本。顯著但幅度極小、量體又小的勝利,往往不值得動手。

流量很小的電商還適合做 A/B 測試嗎?

適合,但要換打法。小流量別測按鈕文案這種微幅改動,改測整頁改版、運費策略、主打商品換位這類效果量大的方案,較小的樣本就能測出顯著差異,也才對得起有限的流量。

整體結果打平,但某個族群明顯勝出,該怎麼辦?

這是有價值的訊號,代表改動對特定族群(例如新客)有效、卻被其他族群稀釋。做法是只對該族群上線,或針對這個族群再獨立驗證一次。但事後切出來的區隔屬探索性發現,最好用一次新測試確認,別直接當定論。

訂閱電商情報每週一封,台灣電商數據與經營洞察。
相關文章
相關電商內容