maskinintelligens.se

Tjänster / Experiment

Experiment och kausalitet

Ett experiment är det enda sättet att veta vad en åtgärd faktiskt orsakade. Jag hjälper till med design och styrkeberäkning innan testet körs, med utvärdering som klarar flera samtidiga mätningar, och med kvasiexperiment när slumpmässig tilldelning inte är möjlig.

Vanliga utgångslägen

  • Testet kördes tills resultatet blev signifikant, och stoppades då.
  • Ingen räknade i förväg på hur stort underlag som skulle behövas.
  • Kampanjen utvärderas mot samma period förra året, som om inget annat förändrats.

Så gör jag

Det vanligaste felet i utvärdering av marknadsföring och produktändringar är inte statistiskt. Det är att jämförelsen saknas.

En kampanj körs, försäljningen stiger, kampanjen bedöms som lyckad. Men vad hade sålts ändå? Utan en kontrollgrupp är den frågan obesvarbar, och varje slutsats vilar på antagandet att inget annat rörde sig samtidigt. Det gör det alltid.

Den här tjänsten hör tätt ihop med attribution och MMM, där geoexperiment är det som kalibrerar modellen mot verkligheten, och med prisoptimering, där historiken sällan kan skilja orsak från samvariation eftersom priser aldrig ändrats slumpmässigt.

Styrkeberäkning före start

Hur stor effekt behöver ni kunna upptäcka, och hur mycket underlag krävs för det? Räknas det inte i förväg blir resultatet oftast varken en bekräftelse eller ett avfärdande, och tiden är förbrukad.

Geoexperiment

När tilldelning per individ inte går — media, prissättning, utomhusreklam — kan regioner delas i behandling och kontroll. Det ger kausala svar för kanaler som annars bara kan utvärderas med antaganden.

Kvasiexperiment

Difference-in-differences och syntetisk kontroll när ett verkligt experiment inte är möjligt. Svagare slutsatser, men avsevärt mycket bättre än att jämföra före och efter.

Uplift i stället för respons

Vem stannar tack vare insatsen, till skillnad från vem som stannar? Det är en mindre grupp än man tror, och för vissa kunder är en påminnelse aktivt skadlig.

Vad du får

  • Testdesign med styrkeberäkning och förutbestämd utvärderingsplan
  • Randomisering eller regionindelning som håller för granskning
  • Utvärdering som hanterar flera samtidiga mätningar korrekt
  • Slutsats med effektstorlek och osäkerhet, inte bara ett p-värde

Förstudie · 1–2 veckor

55 000 95 000 kr

Spannet styrs av om experimentet kan randomiseras per individ eller kräver regionindelning.

Hör av dig

Vanliga frågor

Kan vi inte bara titta på om siffrorna gick upp?

Ni kan, men ni vet då inte om de gått upp ändå. Säsong, kampanjer, konkurrenters agerande och prisändringar rör sig samtidigt. Det är just den frågan ett experiment är byggt för att besvara.

Vi har för lite trafik för A/B-tester.

Då är styrkeberäkningen extra viktig, eftersom den visar vilka effekter som över huvud taget är möjliga att upptäcka. Ofta är svaret att testa färre och större förändringar i stället för många små.

Vad är fel med att stoppa testet när det blir signifikant?

Att titta upprepade gånger och stoppa vid första signifikanta utfallet ger falska positiva resultat i en betydande andel av fallen. Antingen bestäms längden i förväg, eller används en metod byggd för löpande avstämning.

Hur lång tid tar ett experiment?

Det avgörs av styrkeberäkningen, inte av tålamodet. För många bolag handlar det om två till sex veckor. Är svaret betydligt längre är det i sig information om hur stor effekt som är realistisk.