4.6 Kontinuerlige sannsynlighetsfordelinger
Tetthetsfunksjoner, kumulativ fordeling, uniform og eksponentialfordeling.
Når verdiene ikke kan telles
På et kundesenter ringer telefonen — men nøyaktig når neste anrop kommer, kan ingen si. Ventetiden kan bli 3 minutter, 3,7 minutter eller 3,7124 minutter; den kan ta alle verdier i et intervall. Det samme gjelder høyden til en tilfeldig person, temperaturen i morgen og feilen i en produksjonsprosess. Slike størrelser er kontinuerlige, i motsetning til de diskrete variablene vi har telt oss gjennom så langt.
Og her skjer noe som først virker paradoksalt: for en kontinuerlig variabel er for hver enkelt verdi. Sannsynligheten for at ventetiden blir nøyaktig 3,7124000... minutter er null — det finnes uendelig mange kandidater. Det som har mening, er sannsynligheter for intervaller, og de beregnes med integrasjon: der er tetthetsfunksjonen (pdf) til .
En funksjon kan være tetthetsfunksjon hvis den oppfyller to krav: overalt, og — den totale sannsynligheten er 1. Geometrisk er sannsynlighet areal under kurven. Merk en vanlig misforståelse: er ikke selv en sannsynlighet og kan godt være større enn 1 — det er arealet som teller.
Forventning og varians defineres med integraler i stedet for summer: og der . Alt vi kunne om diskrete fordelinger, har altså en kontinuerlig tvilling — med der det før sto .
Å regne med tettheter
Vi prøver maskineriet på en konkret tetthet. La for og ellers. Tre spørsmål: Hva må være? Hva er ? Og hva er ?
Konstanten bestemmes av kravet om totalareal 1: , så . Sannsynligheten: . Forventningen: .
Ved siden av tetthetsfunksjonen finnes en annen funksjon som ofte er enda mer praktisk: den kumulative fordelingsfunksjonen (cdf), Den samler opp all sannsynlighet til venstre for . Egenskapene følger av definisjonen: er ikke-avtagende, , , og — vakkert nok — : tettheten er den deriverte av den kumulative fordelingen. Analysens fundamentalteorem binder altså sannsynlighetsteorien sammen.
Nytten er umiddelbar: og . Har du først funnet , slipper du å integrere på nytt for hvert spørsmål — det er derfor tabeller (som for normalfordelingen) alltid er tabeller over cdf-en. Du kan alltid utlede cdf ved å integrere pdf, og alltid kontrollere en tetthet ved å sjekke at integralet er 1.
Den flate og den glemsomme
To kontinuerlige fordelinger går igjen i modellering, og de har helt ulik personlighet.
Den første er uniform fordeling, : fullstendig tilfeldighet der alle verdier i intervallet er like «tette». Tetthetsfunksjonen er flat, på intervallet og null utenfor, og cdf-en vokser lineært: for . Forventningen ligger naturlig nok i midten, , og variansen er . En buss som kommer «en eller annen gang» i et kvarters vindu, et tilfeldig tall fra random.random() — uniforme fordelinger begge to.
Den andre er eksponentialfordelingen, med : modellen for ventetider mellom hendelser — tid til neste telefonsamtale, levetiden til en komponent. Tettheten er for , cdf-en er , og dermed er «overlevelsessannsynligheten» . Forventningen er og variansen .
Tilbake til kundesenteret: anrop kommer i snitt 4 per time, så ventetiden mellom anrop er (målt i timer). Sannsynligheten for at det går mer enn 30 minutter ( timer) til neste anrop: . Innen 10 minutter ( time): . Og forventet ventetid: time, altså 15 minutter.
Eksponentialfordelingens signatur er hukommelsesløsheten: . Har du alt ventet en halvtime, er sannsynligheten for å vente ti minutter til nøyaktig den samme som da du begynte. Fordelingen «husker ikke» fortiden — akkurat som mynten i forrige kapittel.
Oppsummering: sannsynlighet som areal
Kundesenterets ventetider førte oss fra det tellbare til det kontinuerlige. For kontinuerlige stokastiske variabler er punktsannsynligheter null; alt uttrykkes gjennom tetthetsfunksjonen , som må være ikke-negativ og ha totalareal 1, og sannsynligheter er arealer: . Husk at selv ikke er en sannsynlighet og godt kan overstige 1. Forventning og varians beregnes med integraler: og .
Den kumulative fordelingsfunksjonen er det praktiske oppslagsverktøyet: , , og knytter de to funksjonene sammen via fundamentalteoremet. Du kan alltid utlede cdf fra pdf ved integrasjon — og alltid kontrollere en tetthet ved å sjekke at integralet blir 1.
To standardmodeller bør du kjenne igjen på avstand. Den uniforme fordelingen — flat tetthet , , — beskriver ren tilfeldighet i et intervall. Eksponentialfordelingen — tetthet , , overlevelse — beskriver ventetider, og dens hukommelsesløshet betyr at fortiden aldri endrer utsiktene. Sammen med normalfordelingen utgjør disse verktøykassen for kontinuerlig sannsynlighet — og broen over til neste tema: å bruke fordelingene til å trekke konklusjoner fra data.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.