Statistisk signifikans i A/B-tester: p-värde och urval

Laptop som visar diagram och statistik
Foto: Pixabay via Pexels

Statistisk signifikans är det som skiljer ett verkligt resultat från en tillfällighet i ett A/B-test. Utan att förstå begreppet är det lätt att fira en vinst som egentligen bara var slump, eller att förkasta en förändring som faktiskt fungerade. Den här guiden förklarar signifikans, p-värde och urvalsstorlek utan onödig matematik.

Vad statistisk signifikans betyder

När du jämför två versioner i ett A/B-test kommer deras konverteringsgrader nästan alltid att skilja sig något, även om versionerna är likvärdiga. Slumpen gör att den ena råkar få lite fler köpare. Statistisk signifikans är ett sätt att avgöra om skillnaden är så stor att den sannolikt beror på din förändring och inte på slumpen.

Ett resultat kallas statistiskt säkerställt när risken att skillnaden är en tillfällighet är tillräckligt liten. Den vanligaste tröskeln är 95 procents signifikansnivå, vilket motsvarar högst fem procents risk att du ser en skillnad som egentligen inte finns.

P-värdet, enkelt förklarat

P-värdet sätter en siffra på hur överraskande ditt resultat vore om versionerna i själva verket var likvärdiga. Ett lågt p-värde betyder att en så stor skillnad vore osannolik av ren slump, och alltså att förändringen troligen har en verklig effekt. Vid 95 procents signifikansnivå kräver du ett p-värde under 0,05. Notera att p-värdet inte säger hur stor effekten är, bara hur troligt det är att den är verklig. En liten men säkerställd förbättring kan vara mindre värd än en stor men osäker.

Varför urvalsstorlek avgör

Ju färre besökare testet bygger på, desto mer väger slumpen. Med hundra besökare per version kan konverteringsgraderna se väldigt olika ut utan att skillnaden betyder något, medan samma skillnad med tiotusen besökare per version kan vara solid. Därför bör du bestämma i förväg hur mycket trafik testet behöver, utifrån din baskonvertering och hur liten effekt du vill kunna upptäcka, och låta det köra klart.

Faran med att tjuvkika

En vanlig fälla är att titta på resultatet varje dag och stoppa testet så snart det ser signifikant ut. Problemet är att om du kikar tillräckligt ofta kommer slumpen förr eller senare att visa en tillfällig signifikans som sedan försvinner. Ju oftare du kikar och avbryter tidigt, desto större är risken för falska vinster. Bestäm testlängden i förväg och håll dig till den, eller använd en metod som är byggd för löpande avläsning.

Typ 1-fel och typ 2-fel: de två sätten ett test kan lura dig

Bakom den enkla tumregeln ”under 0,05 är det säkerställt” ligger en mer formell uppdelning som är värd att känna till, eftersom den förklarar vilken sorts misstag du faktiskt riskerar. Ett typ 1-fel innebär att du drar slutsatsen att det finns en skillnad mellan version A och B, fast de i verkligheten är likvärdiga och skillnaden bara var slump. Signifikansnivån, oftast 95 procent, är själva regeln för hur ofta du accepterar den risken: vid 95 procents nivå tillåter du högst fem procents sannolikhet för ett typ 1-fel.

Ett typ 2-fel är motsatsen. Då finns det en verklig skillnad mellan versionerna, men testet lyckas inte visa att den är säkerställd, oftast för att för få besökare deltog. Sannolikheten att undvika den här sortens missade upptäckt kallas testets styrka, och en vanlig standard är 80 procents styrka, det vill säga högst tjugo procents risk att missa en effekt som faktiskt finns. De två felen drar åt olika håll: ett test byggt för att nästan aldrig ge falska larm om en skillnad (lågt typ 1-fel) kräver i regel fler besökare för att samtidigt hålla nere risken att missa en verklig skillnad (lågt typ 2-fel).

Räkneexempel: hur många besökare behöver du per variant

Så här ser resonemanget ut i praktiken. Säg att din nuvarande konverteringsgrad är två procent, och att du vill kunna upptäcka en relativ förbättring på tjugo procent, alltså en höjning till 2,4 procent. Med den vanliga kombinationen 95 procents signifikansnivå och 80 procents styrka ger den etablerade formeln för två andelar ett urvalskrav på ungefär 21 100 besökare per variant, alltså drygt 42 000 totalt för hela testet.

Formeln bygger på samma grundmatematik som vår A/B-testkalkylator använder för att avgöra signifikans i efterhand: ett tvåsidigt z-test för två andelar med en poolerad varians under nollhypotesen. Skillnaden är bara riktningen. Kalkylatorn tar besökare och konverteringar du redan har och räknar ut om skillnaden är säkerställd. Räkneexemplet ovan gör det omvända: det utgår från hur stor skillnad du vill kunna upptäcka och räknar baklänges till hur många besökare testet behöver innan du ens startar det. Källan till metoden är Kohavi, Tang och Xu, Trustworthy Online Controlled Experiments (Cambridge University Press), den akademiska standardreferensen för hur kontrollerade experiment på webben bör dimensioneras.

Poängen med att räkna ut urvalsstorleken i förväg, snarare än att bara köra testet tills det ”känns klart”, är att den håller dig borta från just den tjuvkiksfälla som beskrevs ovan. Bestämmer du besökarantalet innan start och håller dig till det, vet du att både typ 1- och typ 2-risken ligger på de nivåer du valt, i stället för att glida i väg ju oftare du tittar på resultatet under testets gång. Samma förhandsräkning avgör dessutom hur många varianter och celler ett test rimligen klarar när du prövar flera element samtidigt, vilket vi går igenom i jämförelsen mellan A/B-test och multivariattest.

Räkna ut det själv

Du behöver inte räkna för hand. Mata in antal besökare och konverteringar för dina två versioner i vår A/B-testkalkylator, så får du konverteringsgrad, uplift, p-värde och besked om skillnaden är säkerställd på 95 procents nivå. Kalkylatorn använder ett tvåsidigt z-test för två andelar, och allt räknas ut i din webbläsare utan att något sparas. Kommersiella testverktyg räknar ofta på ett annat sätt, vilket vi jämför i genomgången av VWO och AB Tasty. Signifikans är dock bara halva bilden: väg den alltid mot hur stor effekten är och mot hur din konverteringsgrad utvecklas över tid.

Senast faktagranskad: 6 augusti 2026