
Statistisk signifikans är det som skiljer ett verkligt resultat från en tillfällighet i ett A/B-test. Utan att förstå begreppet är det lätt att fira en vinst som egentligen bara var slump, eller att förkasta en förändring som faktiskt fungerade. Den här guiden förklarar signifikans, p-värde och urvalsstorlek, går igenom de två sätten ett test kan lura dig på och räknar ut hur många besökare du behöver, utan onödig matematik.
Vad statistisk signifikans betyder
När du jämför två versioner i ett A/B-test kommer deras konverteringsgrader nästan alltid att skilja sig något, även om versionerna är likvärdiga. Slumpen gör att den ena råkar få lite fler köpare. Statistisk signifikans är ett sätt att avgöra om skillnaden är så stor att den sannolikt beror på din förändring och inte på slumpen.
Ett resultat kallas statistiskt säkerställt när skillnaden är så stor att den vore osannolik om versionerna i själva verket var likvärdiga. Tröskeln heter signifikansnivå och sätts vanligen till 5 procent: du accepterar högst 5 procents risk att se en skillnad som egentligen inte finns. Siffran verktygen visar är oftast den omvända, konfidensgraden 95 procent. De två hör ihop, men det är konfidensgraden som är 95 procent och signifikansnivån som är 5 procent.
P-värdet, enkelt förklarat
P-värdet sätter en siffra på hur överraskande ditt resultat vore om versionerna i själva verket var likvärdiga. Ett lågt p-värde betyder att en så stor skillnad vore osannolik under det antagandet, och det är därför ett lågt p-värde tas som stöd för att förändringen har en verklig effekt. Med signifikansnivån 5 procent kräver du ett p-värde under 0,05. Notera att p-värdet varken säger hur stor effekten är, hur troligt det är att den är verklig eller hur sannolikt det är att skillnaden bara var slump. Det räknar åt andra hållet: från antagandet att versionerna är likvärdiga till hur illa data stämmer med det antagandet. Amerikanska statistikerförbundets uttalande om p-värden är uttryckligt på just den punkten. En liten men säkerställd förbättring kan vara mindre värd än en stor men osäker.
Varför urvalsstorleken är avgörande
Ju färre besökare testet bygger på, desto mer väger slumpen. Med 100 besökare per version kan konverteringsgraderna se väldigt olika ut utan att skillnaden betyder något, medan samma skillnad med 10 000 besökare per version kan vara solid. Därför bör du bestämma i förväg hur mycket trafik testet behöver, utifrån din baskonvertering och hur liten effekt du vill kunna upptäcka, och låta det köra klart.
Faran med att tjuvkika
En vanlig fälla är att titta på resultatet varje dag och stoppa testet så snart det ser signifikant ut. Kikar du tillräckligt ofta kommer slumpen förr eller senare att visa en tillfällig signifikans som sedan försvinner. Ju oftare du kikar, och ju tidigare du avbryter, desto större är risken för falska vinster. Bestäm testlängden i förväg och håll dig till den, eller använd en metod som är byggd för löpande avläsning.
Typ 1-fel och typ 2-fel: de två sätten ett test kan lura dig på
Bakom den enkla tumregeln ”under 0,05 är det säkerställt” ligger en mer formell uppdelning som är värd att känna till, eftersom den förklarar vilken sorts misstag du faktiskt riskerar. Ett typ 1-fel innebär att du drar slutsatsen att det finns en skillnad mellan version A och B, fast de i verkligheten är likvärdiga och skillnaden bara var slump. Signifikansnivån, oftast 5 procent, är själva regeln för hur ofta du accepterar den risken: på den nivån tillåter du högst 5 procents sannolikhet för ett typ 1-fel.
Ett typ 2-fel är motsatsen. Då finns det en verklig skillnad mellan versionerna, men testet lyckas inte visa att den är säkerställd, oftast för att för få besökare deltog. Sannolikheten att undvika den här sortens missade upptäckt kallas testets styrka, och en vanlig standard är 80 procents styrka, det vill säga högst 20 procents risk att missa en effekt som faktiskt finns. De två felen drar åt olika håll: ett test byggt för att nästan aldrig ge falska larm om en skillnad (låg risk för typ 1-fel) kräver i regel fler besökare för att samtidigt hålla nere risken att missa en verklig skillnad (låg risk för typ 2-fel).
Räkneexempel: hur många besökare du behöver per variant
Så här ser resonemanget ut i praktiken. Säg att din nuvarande konverteringsgrad är 2 procent, och att du vill kunna upptäcka en relativ förbättring på 20 procent, alltså en höjning till 2,4 procent. Med den vanliga kombinationen 5 procents signifikansnivå och 80 procents styrka ger den etablerade formeln för två andelar ett urvalskrav på ungefär 21 100 besökare per variant, alltså drygt 42 000 totalt för hela testet.
Formeln bygger på samma grundmatematik som vår A/B-testkalkylator använder för att avgöra signifikans i efterhand: ett tvåsidigt z-test för två andelar med en poolerad varians under nollhypotesen. Det enda som skiljer är riktningen. Kalkylatorn tar besökare och konverteringar du redan har och räknar ut om skillnaden är säkerställd. Räkneexemplet ovan gör det omvända: det utgår från hur stor skillnad du vill kunna upptäcka och räknar baklänges till hur många besökare testet behöver innan du ens startar det. Källan till metoden är Kohavi, Tang och Xu, Trustworthy Online Controlled Experiments (Cambridge University Press), den akademiska standardreferensen för hur kontrollerade experiment på webben bör dimensioneras.
Poängen med att räkna ut urvalsstorleken i förväg, snarare än att bara köra testet tills det ”känns klart”, är att förhandsräkningen håller dig borta från just den tjuvkiksfälla som beskrevs ovan. Bestämmer du besökarantalet innan start och håller dig till det, vet du att både typ 1- och typ 2-risken ligger på de nivåer du valt, i stället för att glida i väg ju oftare du tittar på resultatet under testets gång. Samma förhandsräkning avgör dessutom hur många varianter och celler ett test rimligen klarar när du prövar flera element samtidigt, vilket vi går igenom i jämförelsen mellan A/B-test och multivariattest.
Räkna ut det själv
Du behöver inte räkna för hand. Mata in antal besökare och konverteringar för dina två versioner i vår A/B-testkalkylator, så får du konverteringsgrad, uplift, p-värde och besked om skillnaden är säkerställd på 95 procents nivå. Kalkylatorn använder ett tvåsidigt z-test för två andelar, och allt räknas ut i din webbläsare utan att något sparas. Kommersiella testverktyg räknar ofta på ett annat sätt, vilket vi jämför i genomgången av VWO och AB Tasty. Signifikans är dock bara halva bilden: väg den alltid mot hur stor effekten är och mot hur din konverteringsgrad utvecklas över tid.
Senast faktagranskad: 14 augusti 2026. Senast uppdaterad: 25 augusti 2026