Tilbake
1.3

1.3 Betinget sannsynlighet, total sannsynlighet og Bayes

Fra betinget sannsynlighet til Bayes' formel — med det diagnostiske testoppsettet som eksamen elsker.

55 min
9 oppgaver
Betinget sannsynlighettotal sannsynlighetBayes
Din fremgang i kapitlet
0 / 9 oppgaver
Forkunnskaper: Bygger på hendelser, snitt, komplement og uavhengighet fra kap. 1.1 — betinget sannsynlighet er definert ved snittet ABA \cap B, og total sannsynlighet bruker at en partisjon deler utfallsrommet i disjunkte biter. Har du kap. 1.1 inne, er du klar.

Kombinatorikk (kap. 1.2) er ikke nødvendig her, men dukker av og til opp for å telle sannsynlighetene som mates inn.

Ofte får vi ny informasjon underveis: testen slo ut, komponenten kom fra en bestemt leverandør, det første kortet var et ess. Da vil vi oppdatere sannsynlighetene i lys av det vi nå vet. Det er hele poenget med betinget sannsynlighet — og maskineriet som snur en betinging «den andre veien», er Bayes' formel.

Vi bygger opp i tre løkker. Først definisjonen av betinget sannsynlighet og multiplikasjonsregelen (løkke 1). Så loven om total sannsynlighet, som setter sammen sannsynligheter over flere scenarioer (løkke 2). Til slutt Bayes' formel og det diagnostiske testoppsettet eksamen elsker — der lav prevalens gir overraskende resultater (løkke 3).

⏱️ Løkke 1 (~15 min): betinget sannsynlighet. Løkke 2 (~15 min): total sannsynlighet. Løkke 3 (~25 min): Bayes og diagnostikk.

Løkke 1 — Betinget sannsynlighet (~15 min)

Betinget sannsynlighet
Sannsynligheten for AA gitt at BB har inntruffet, skrives P(AB)P(A \mid B) og defineres som

P(AB)=P(AB)P(B),P(B)>0.P(A \mid B) = \frac{P(A \cap B)}{P(B)}, \qquad P(B) > 0.

Intuisjon: vi krymper utfallsrommet til bare det som er forenlig med BB. Da spør vi hvor stor andel av BB som også er AA. Nevneren P(B)P(B) er den nye «helheten», telleren P(AB)P(A \cap B) den delen som også er AA.

Multiplikasjonsregelen
Ganger vi over kryss i definisjonen av betinget sannsynlighet, får vi en formel for snittet:

P(AB)=P(AB)P(B)=P(BA)P(A).P(A \cap B) = P(A \mid B)\,P(B) = P(B \mid A)\,P(A).

Nyttig når oppgaven gir deg betingede sannsynligheter og du skal finne sannsynligheten for at begge hendelsene inntreffer — for eksempel to trekk fra en urne uten tilbakelegging.

Uavhengighet via betinging
AA og BB er uavhengige nettopp når betingingen ikke endrer noe:

P(AB)=P(A).P(A \mid B) = P(A).

Dette er ekvivalent med produktregelen P(AB)=P(A)P(B)P(A \cap B) = P(A)P(B) fra kap. 1.1. At BB skjedde gir da ingen informasjon om AA. Er P(AB)P(A)P(A \mid B) \ne P(A), er hendelsene avhengige.

Betinget komplementregel
Betinger vi på en fast hendelse BB, oppfører sannsynlighetene seg som vanlig — de summerer til 1 over komplementet:

P(AB)+P(AcB)=1.P(A \mid B) + P(A^c \mid B) = 1.

Advarsel: dette gjelder når vi varierer den første hendelsen. Det gjelder ikke å bytte hva vi betinger på: P(AB)+P(ABc)P(A \mid B) + P(A \mid B^c) er som regel ikke 1. Å blande disse er en vanlig felle.

✏️Eksempel 1: Betinget sannsynlighet med definerte hendelser

I en bedrift har 40 % av de ansatte fagbrev (FF), 30 % har lederansvar (LL), og 12 % har begge deler. En ansatt med lederansvar trekkes tilfeldig. Hva er sannsynligheten for at vedkommende har fagbrev?

Definer hendelsene (sensorkrav): La FF = «har fagbrev» og LL = «har lederansvar». Oppgitt: P(F)=0,40P(F) = 0{,}40, P(L)=0,30P(L) = 0{,}30, P(FL)=0,12P(F \cap L) = 0{,}12.

Vi skal finne P(FL)P(F \mid L) — betinger på LL:

P(FL)=P(FL)P(L)=0,120,30=0,40.P(F \mid L) = \frac{P(F \cap L)}{P(L)} = \frac{0{,}12}{0{,}30} = 0{,}40.

Legg merke til at P(FL)=0,40=P(F)P(F \mid L) = 0{,}40 = P(F): blant lederne er andelen med fagbrev den samme som i hele bedriften. Her er FF og LL altså uavhengige — lederansvar gir ingen informasjon om fagbrev.

📝Oppgave 1

(Innstegsoppgave.) Det er gitt at P(AB)=0,15P(A \cap B) = 0{,}15 og P(B)=0,5P(B) = 0{,}5.

a) Finn P(AB)P(A \mid B).

b) Skriv med ord hva P(AB)P(A \mid B) betyr.

📝Oppgave 2

To kort trekkes uten tilbakelegging fra en vanlig kortstokk (52 kort, 4 ess).

Finn sannsynligheten for at begge er ess. Definer hendelsene og bruk multiplikasjonsregelen.

Løkke 2 — Loven om total sannsynlighet (~15 min)

Partisjon

En partisjon av utfallsrommet er en oppdeling i hendelser B1,B2,,BkB_1, B_2, \ldots, B_k som er disjunkte (utelukker hverandre) og dekker alt (B1Bk=SB_1 \cup \cdots \cup B_k = S). Nøyaktig én av dem inntreffer alltid.

Eksempel: «komponenten kom fra leverandør 1», «... fra leverandør 2», «... fra leverandør 3». En partisjon er scenarioene vi summerer over i loven om total sannsynlighet.

Loven om total sannsynlighet
Har vi en partisjon B1,,BkB_1, \ldots, B_k, kan vi finne P(A)P(A) ved å veie de betingede sannsynlighetene med hvor sannsynlig hvert scenario er:

P(A)=i=1kP(ABi)P(Bi).P(A) = \sum_{i=1}^{k} P(A \mid B_i)\,P(B_i).

Intuisjon: AA kan skje via scenario B1B_1, eller B2B_2, ..., og disse veiene utelukker hverandre. For hver vei ganger vi «sannsynligheten for veien» (P(Bi)P(B_i)) med «sannsynligheten for AA langs den veien» (P(ABi)P(A \mid B_i)), og summerer. Dette er nevneren i Bayes' formel.

Sannsynlighetstre

Et tre der første forgrening er partisjonen (BiB_i, med grenene merket P(Bi)P(B_i)) og andre forgrening er AA / AcA^c (grenene merket P(ABi)P(A \mid B_i)). Sannsynligheten for en hel gren er produktet langs den; total sannsynlighet er summen av alle grener som ender i AA. Et oversiktlig regnehjelpemiddel som hindrer at du glemmer et scenario.

Tabelloppsett (krysstabell)

Alternativ til treet: en tabell med partisjonen (BiB_i) langs én akse og AA / AcA^c langs den andre. Fyll cellene med P(ABi)=P(ABi)P(Bi)P(A \cap B_i) = P(A \mid B_i)P(B_i). Radsum og kolonnesum gir marginalene, og betingede sannsynligheter leses av som celle delt på passende sum. Særlig ryddig for diagnostiske testoppgaver med to scenarioer.

✏️Eksempel 2: Total sannsynlighet (tre leverandører)

En fabrikk får samme komponent fra tre leverandører: 50 % fra A, 30 % fra B og 20 % fra C. Andelen defekte er 1 % hos A, 2 % hos B og 3 % hos C. En tilfeldig komponent plukkes fra lageret. Hva er sannsynligheten for at den er defekt?

Definer hendelsene: La A,B,CA, B, C = «komponenten kom fra leverandør A/B/C» (en partisjon), og DD = «komponenten er defekt». Oppgitt:

P(A)=0,50, P(B)=0,30, P(C)=0,20;P(DA)=0,01, P(DB)=0,02, P(DC)=0,03.P(A) = 0{,}50,\ P(B) = 0{,}30,\ P(C) = 0{,}20; \quad P(D\mid A) = 0{,}01,\ P(D\mid B) = 0{,}02,\ P(D\mid C) = 0{,}03.

Loven om total sannsynlighet:

P(D)=P(DA)P(A)+P(DB)P(B)+P(DC)P(C)P(D) = P(D\mid A)P(A) + P(D\mid B)P(B) + P(D\mid C)P(C)
=0,010,50+0,020,30+0,030,20=0,005+0,006+0,006=0,017.= 0{,}01 \cdot 0{,}50 + 0{,}02 \cdot 0{,}30 + 0{,}03 \cdot 0{,}20 = 0{,}005 + 0{,}006 + 0{,}006 = 0{,}017.

Altså er 1,7 % av komponentene defekte. Dette tallet blir nevneren når vi i løkke 3 spør hvilken leverandør en defekt komponent mest sannsynlig kom fra.

📝Oppgave 3

To produksjonslinjer lager samme vare: linje 1 står for 60 % av produksjonen med 2 % feilrate, linje 2 for 40 % med 5 % feilrate.

Finn sannsynligheten for at en tilfeldig vare er defekt. Definer hendelsene.

Løkke 3 — Bayes' formel og diagnostikk (~25 min)

Bayes' formel
Bayes' formel snur en betinging: fra P(ABj)P(A \mid B_j) til P(BjA)P(B_j \mid A). Med en partisjon B1,,BkB_1, \ldots, B_k:

P(BjA)=P(ABj)P(Bj)i=1kP(ABi)P(Bi).P(B_j \mid A) = \frac{P(A \mid B_j)\,P(B_j)}{\sum_{i=1}^{k} P(A \mid B_i)\,P(B_i)}.

Intuisjon: telleren er «veien gjennom BjB_j som ender i AA»; nevneren er alle veier som ender i AA (loven om total sannsynlighet). Vi spør: av all sannsynlighetsmasse for AA, hvor stor andel gikk gjennom BjB_j? Dette er verktøyet for å oppdatere tro etter en observasjon.

Sensitivitet
Sannsynligheten for at en test slår ut gitt at tilstanden faktisk er til stede — testens evne til å fange opp de syke:

sensitivitet=P(TS),\text{sensitivitet} = P(T \mid S),

der TT = «positiv test» og SS = «tilstanden til stede». En sensitivitet på 0,82 betyr at testen fanger 82 % av de syke; de resterende 18 % er falske negative.

Spesifisitet
Sannsynligheten for at testen gir negativt utslag gitt at tilstanden ikke er til stede — evnen til å frikjenne de friske:

spesifisitet=P(TcSc).\text{spesifisitet} = P(T^c \mid S^c).

En spesifisitet på 0,96 betyr at 96 % av de friske får korrekt negativ test; de resterende 4 % er falske positive, altså P(TSc)=1spesifisitetP(T \mid S^c) = 1 - \text{spesifisitet}.

Falsk positiv

En positiv test hos noen som ikke har tilstanden: hendelsen TScT \cap S^c. Den falske positive raten er P(TSc)=1spesifisitetP(T \mid S^c) = 1 - \text{spesifisitet}. Falske positive er hovedgrunnen til at en positiv test kan bety lite når tilstanden er sjelden — de mange friske gir mange falske alarmer.

Falsk negativ

En negativ test hos noen som faktisk har tilstanden: hendelsen TcST^c \cap S. Den falske negative raten er P(TcS)=1sensitivitetP(T^c \mid S) = 1 - \text{sensitivitet}. Falske negative er farlige i screening fordi syke feilaktig får beskjed om at alt er bra.

Prevalens

Andelen i populasjonen som faktisk har tilstanden før testing — sannsynligheten P(S)P(S), også kalt basisraten. Prevalensen er den avgjørende, ofte oversette, størrelsen i Bayes-regnestykket: er den lav, blir den positive prediktive verdien lav selv med en god test.

Positiv prediktiv verdi (PPV)
Det oppgaven som regel spør om: sannsynligheten for at tilstanden faktisk er til stede gitt en positiv test,

PPV=P(ST)=P(TS)P(S)P(TS)P(S)+P(TSc)P(Sc).\text{PPV} = P(S \mid T) = \frac{P(T \mid S)\,P(S)}{P(T \mid S)P(S) + P(T \mid S^c)P(S^c)}.

Dette er Bayes' formel anvendt på diagnostikk. Merk at PPV ikke er det samme som sensitiviteten P(TS)P(T \mid S) — å forveksle dem er prosecutor's fallacy.

Negativ prediktiv verdi (NPV)
Sannsynligheten for at tilstanden ikke er til stede gitt en negativ test:

NPV=P(ScTc)=P(TcSc)P(Sc)P(TcSc)P(Sc)+P(TcS)P(S).\text{NPV} = P(S^c \mid T^c) = \frac{P(T^c \mid S^c)P(S^c)}{P(T^c \mid S^c)P(S^c) + P(T^c \mid S)P(S)}.

Ved lav prevalens er NPV typisk svært høy (en negativ test er nesten alltid korrekt), mens PPV kan være overraskende lav.

Prosecutor's fallacy (aktoratets feilslutning)

Å forveksle P(AB)P(A \mid B) med P(BA)P(B \mid A) — å tro at «sannsynligheten for testutslag gitt sykdom» er det samme som «sannsynligheten for sykdom gitt testutslag». De to er koblet av Bayes, men er som regel svært forskjellige. Navnet kommer fra rettssaker: «sannsynligheten for dette DNA-treffet hos en uskyldig er 1 av en million» betyr ikke at det er 1 av en million sjanse for at den tiltalte er uskyldig.

✏️Eksempel 3: Diagnostisk test — den store Bayes-oppgaven

En hurtigtest for en infeksjon fanger opp 82 % av de smittede og gir 4 % falske positive. I populasjonen er 2 % smittet. En tilfeldig person tester positivt. Hva er sannsynligheten for at personen faktisk er smittet? Kommenter tallet.

Definer hendelsene (sensorkrav): La SS = «personen er smittet» og TT = «testen slår ut (positiv)». Oppgitt:

P(TS)=0,82 (sensitivitet),P(TSc)=0,04 (falsk positiv),P(S)=0,02 (prevalens).P(T \mid S) = 0{,}82 \ (\text{sensitivitet}), \quad P(T \mid S^c) = 0{,}04 \ (\text{falsk positiv}), \quad P(S) = 0{,}02 \ (\text{prevalens}).

Da er P(Sc)=0,98P(S^c) = 0{,}98. Vi skal finne P(ST)P(S \mid T) (PPV) med Bayes' formel.

Nevner (total sannsynlighet for positiv test):
P(T)=P(TS)P(S)+P(TSc)P(Sc)=0,820,02+0,040,98=0,0164+0,0392=0,0556.P(T) = P(T\mid S)P(S) + P(T\mid S^c)P(S^c) = 0{,}82 \cdot 0{,}02 + 0{,}04 \cdot 0{,}98 = 0{,}0164 + 0{,}0392 = 0{,}0556.

Bayes:
P(ST)=0,820,020,0556=0,01640,05560,295.P(S \mid T) = \frac{0{,}82 \cdot 0{,}02}{0{,}0556} = \frac{0{,}0164}{0{,}0556} \approx 0{,}295.

Kommentar: Selv om testen er ganske god, er sannsynligheten for at en positiv person faktisk er smittet bare ≈ 30 %. Grunnen er den lave prevalensen: de mange friske (98 %) gir så mange falske positive (0,03920{,}0392) at de nesten drukner de ekte positive (0,01640{,}0164). Dette er kjernepoenget i diagnostikk-oppgavene — en positiv test betyr lite når tilstanden er sjelden.

📝Oppgave 4

På et lager kommer 60 % av varene fra linje 1 (2 % feil) og 40 % fra linje 2 (5 % feil), som i oppgave 3. En vare viser seg å være defekt.

Hva er sannsynligheten for at den kom fra linje 2? Bruk Bayes.

📝Oppgave 5

En screeningtest for en sjelden sykdom har sensitivitet 95 % og spesifisitet 90 %. Sykdommen har prevalens 1 %.

a) Definer hendelsene og finn sannsynligheten for at en person med positiv test faktisk er syk (PPV).

b) Forklar hvorfor PPV blir så lav til tross for at både sensitivitet og spesifisitet er høye.

c) En medstudent sier: «Testen tar 95 % av de syke, så en positiv test betyr 95 % sjanse for å være syk.» Hvilken feilslutning er dette?

Begrepsbank til eksamen

Kjernebegrepene i kortform — repertoaret for sjanger E.

Begrepsbanken er flashcard-/repetisjonsstoff — den gjentar det du nettopp har lest. Hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet.

A priori- og a posteriori-sannsynlighet
A priori (på forhånd) er sannsynligheten før observasjonen — for eksempel prevalensen P(S)P(S). A posteriori (i etterkant) er den oppdaterte sannsynligheten etter observasjonen — for eksempel P(ST)P(S \mid T). Bayes' formel er nettopp maskineriet som går fra det ene til det andre når data kommer inn.
Odds-formen av Bayes
Bayes kan skrives som en oppdatering av odds: posteriors odds = priors odds ganger likelihood-forholdet,

P(ST)P(ScT)=P(S)P(Sc)P(TS)P(TSc).\frac{P(S \mid T)}{P(S^c \mid T)} = \frac{P(S)}{P(S^c)} \cdot \frac{P(T \mid S)}{P(T \mid S^c)}.

Praktisk fordi nevneren (total sannsynlighet) faller bort. Likelihood-forholdet P(TS)/P(TSc)P(T\mid S)/P(T\mid S^c) måler hvor mye et positivt utslag «trekker» i retning sykdom.

Basisrate-neglisjering (base rate neglect)

Den kognitive fellen der man ignorerer prevalensen (basisraten) og bare ser på hvor treffsikker testen er. Det er derfor mange feilaktig tror en positiv test på en sjelden sykdom nesten sikkert betyr sykdom. Botemiddelet er å alltid ta P(S)P(S) med i Bayes-regnestykket — basisraten styrer resultatet når tilstanden er sjelden.

Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver
Symbol- og formelliste

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Norges teknisk-naturvitenskapelige universitet. Dette er ikke offisielt studiemateriell. Les mer.