maskinintelligens.se

Metod / Betafördelningen

Betafördelningen

Betafördelningen beskriver storheter som ligger mellan noll och ett: konverteringsgrader, andelar, sannolikheter. Dess främsta praktiska nytta är att den gör osäkerheten explicit, så att en konvertering på 3 av 10 inte jämförs rakt av med 300 av 1000.

Används för: konverteringsgrader, klickfrekvenser, andel återkommande

Varje rapport som listar konverteringsgrad per kanal har samma problem. Kanalen högst upp är oftast den med minst trafik.

Med tio besök och tre köp blir konverteringsgraden 30 procent. Med tusen besök och 250 köp blir den 25 procent. Rangordnat efter procent vinner den första, men ingen som tänkt efter tror att den faktiskt är bättre.

Vad betafördelningen tillför

I stället för ett tal ger den en fördelning över vad den sanna konverteringsgraden kan vara.

För 3 av 10 blir fördelningen bred: rimliga värden sträcker sig ungefär från tio till sextio procent. För 250 av 1000 blir den smal, ungefär mellan 22 och 28 procent. Nu går de att jämföra, och slutsatsen blir den rimliga: vi vet för lite om den första kanalen för att säga något.

Uppdatering med ny data

Betafördelningen har en egenskap som gör den ovanligt praktisk: den uppdateras genom att räkna.

Börja med en prior som säger vad ni tror innan ni sett data, ofta kundbasens genomsnittliga konverteringsgrad. Lägg sedan till antalet lyckade och misslyckade utfall. Resultatet är den uppdaterade fördelningen. Ingen optimering, ingen simulering, bara addition.

Det gör den utmärkt för system som ska uppdateras löpande, och det är grunden i de flesta enkla implementationer av flerarmade banditer, där en algoritm fördelar trafik mellan alternativ och lär sig medan den gör det.

Var den används

Rangordning av kanaler och segment där underlagen är olika stora.

A/B-tester där man vill ha sannolikheten att B är bättre än A, i stället för ett p-värde som inte besvarar den frågan.

Prior för churnsannolikhet per segment, ihop med partiell pooling när segmenten är små.

Ett vanligt fel

Betafördelningen beskriver andelen, inte antalet försök. Vill ni modellera “hur många av tusen besökare konverterar” är det binomialfördelningen som beskriver utfallet, med en betafördelning över sannolikheten. Kombinationen kallas beta-binomial och är det som faktiskt behövs oftast.