Tilbake
3.6

3.6 Logistisk regresjon (kjenne, to-gruppe-sammenligning)

Den logistiske modellen for en binær respons, og hvordan en to-gruppe-sammenligning uttrykkes med en dummy slik at β₁=0 svarer til lik sannsynlighet i de to gruppene.

35 min
10 oppgaver
Logistisk regresjon (kjenneto-gruppe-sammenligning)
Din fremgang i kapitlet
0 / 10 oppgaver
Forkunnskaper: Regresjonstankegangen (modell, koeffisienter, «effekten av xx») fra kap. 3.1, og utskriftslesing (Estimate, Std. Error, P-verdi-kolonnen) fra kap. 3.2. To-gruppe-sammenligningen av andeler kjenner du fra kap. 2.3 — her ser du den samme sammenligningen i regresjonsspråk.

Det eneste nye verktøyet er logaritme- og eksponentialregning på formen logp1p\displaystyle \log\frac{p}{1-p}, som du kan fra R1 3.2 Logaritmer.

Når responsen er ja/nei

Til nå har responsen YY vært et kontinuerlig tall (avling, forbruk, pris). Men mange spørsmål har en binær respons: består/stryker, kjøper/kjøper ikke, frisk/syk. Da gir det ikke mening å modellere «forventet YY» med en rett linje — det vi vil modellere, er sannsynligheten p(x)=P(Y=1x)p(x)=P(Y=1\mid x).

Logistisk regresjon løser dette med ett grep: i stedet for å legge en rett linje på pp selv, legges den på logit-skalaen logp1p\displaystyle \log\frac{p}{1-p}. Da kan høyresiden β0+β1x\beta_0+\beta_1x løpe fritt over hele tallinja, mens pp automatisk holder seg mellom 0 og 1.

Binær respons

En respons som bare tar to verdier, kodet Y=1Y=1 («suksess») og Y=0Y=0 («ikke suksess»). For gitt xx er YY Bernoulli-fordelt med suksess-sannsynlighet p(x)=P(Y=1x)p(x)=P(Y=1\mid x), og E(Yx)=p(x)E(Y\mid x)=p(x). Det er denne sannsynligheten logistisk regresjon modellerer.

Problemet med lineær modell for 0/1-respons

Grunnen til at vanlig lineær regresjon ikke passer for en binær respons: modellen p(x)=β0+β1xp(x)=\beta_0+\beta_1x er en rett linje, som før eller senere går under 0 eller over 1 — umulige sannsynligheter. I tillegg er variansen p(x)(1p(x))p(x)(1-p(x)) ikke konstant, så antakelsen om lik feilvarians brytes. Logit-lenken reparerer begge deler.

Den logistiske regresjonsmodellen
Modellen for en binær respons: sannsynligheten for suksess gitt xx er
P(Y=1x)=p(x)=eβ0+β1x1+eβ0+β1x.P(Y=1\mid x)=p(x)=\frac{e^{\beta_0+\beta_1x}}{1+e^{\beta_0+\beta_1x}}.
Som funksjon av xx er dette en S-kurve: den ligger alltid strengt mellom 0 og 1, stiger (når β1>0\beta_1>0) eller synker (når β1<0\beta_1<0) monotont, og passerer p=0,5p=0{,}5 nøyaktig der β0+β1x=0\beta_0+\beta_1x=0.
Logit-lenken (log-odds)
Broen mellom sannsynlighet og rett linje: logiten er logaritmen til oddsen,
logit(p)=logp1p,\operatorname{logit}(p)=\log\frac{p}{1-p},
og modellen sier at nettopp denne størrelsen er lineær i xx:
logp(x)1p(x)=β0+β1x.\log\frac{p(x)}{1-p(x)}=\beta_0+\beta_1x.
De to skrivemåtene (S-kurven og logit-linja) er samme modell — løs den ene ligningen for pp, og du får den andre.
Slik regner du fram og tilbake. Fra logit til sannsynlighet: sett η=β0+β1x\eta=\beta_0+\beta_1x (den lineære prediktoren), og regn p=eη/(1+eη)p=e^{\eta}/(1+e^{\eta}). Fra sannsynlighet til logit: regn logp1p\displaystyle \log\frac{p}{1-p}. Legg merke til fortegnsspeilingen: η=0\eta=0 gir p=0,5p=0{,}5, positiv η\eta gir p>0,5p>0{,}5, negativ gir p<0,5p<0{,}5.
✏️Eksempel 1: Regne sannsynligheter i modellen

For sannsynligheten for å bestå en eksamen (Y=1Y=1) som funksjon av antall studietimer per uke xx er det tilpasset en logistisk modell med β^0=2,2\hat\beta_0=-2{,}2 og β^1=0,4\hat\beta_1=0{,}4.

a) Finn den estimerte sannsynligheten for å bestå ved x=2x=2 og ved x=8x=8 timer.
b) For hvilken xx er den estimerte sannsynligheten nøyaktig 0,50{,}5?

a) Lineær prediktor η^=2,2+0,4x\hat\eta=-2{,}2+0{,}4x.

Ved x=2x=2: η^=1,4\hat\eta=-1{,}4, så p^=e1,41+e1,4=0,24661,2466=0,198\hat p=\dfrac{e^{-1{,}4}}{1+e^{-1{,}4}}=\dfrac{0{,}2466}{1{,}2466}=0{,}198.

Ved x=8x=8: η^=1,0\hat\eta=1{,}0, så p^=e1,01+e1,0=2,7183,718=0,731\hat p=\dfrac{e^{1{,}0}}{1+e^{1{,}0}}=\dfrac{2{,}718}{3{,}718}=0{,}731.

b) p^=0,5\hat p=0{,}5 hviss η^=0\hat\eta=0: 2,2+0,4x=0-2{,}2+0{,}4x=0 gir x=5,5x=5{,}5 timer. Mer enn 5,5 timer per uke gir estimert sannsynlighet over 50 %.

📝Oppgave 1

En logistisk modell for om en kunde fornyer et abonnement (Y=1Y=1) som funksjon av antall år som kunde xx har β^0=1,5\hat\beta_0=-1{,}5 og β^1=0,3\hat\beta_1=0{,}3.

a) Finn den estimerte sannsynligheten for fornyelse ved x=5x=5 og x=10x=10 år.
b) Verifiser at logiten ved x=10x=10 er 1,51{,}5.

Hva betyr β1\beta_1?

I lineær regresjon er tolkningen av β1\beta_1 enkel: forventet yy endres med β1\beta_1 per enhet xx. I logistisk regresjon gjelder det samme — men på logit-skalaen, ikke på sannsynlighetsskalaen. Det er her nesten alle feiltolkningene skjer, så vi tar begrepene i tur og orden.

Odds
Et alternativt mål på hvor sannsynlig en hendelse er: forholdet mellom sannsynligheten for og mot,
odds=p1p.\text{odds}=\frac{p}{1-p}.
p=0,5p=0{,}5 gir odds 1; p=0,8p=0{,}8 gir odds 4 («fire mot én»). Logiten er logaritmen til oddsen, så den logistiske modellen er lineær i log-odds.
Tolkning av β1\beta_1 (logit-skala)

Den korrekte tolkningen av helningen i logistisk regresjon: når xx øker med én enhet, øker logiten (log-oddsen) med β1\beta_1 — tilsvarende ganges oddsen med eβ1e^{\beta_1}. β1\beta_1 er altså en logit-/oddsforskjell, IKKE en sannsynlighetsforskjell: hvor mye pp selv endres, avhenger av hvor på S-kurven du står.

Oddsforholdet eβ1e^{\beta_1}
Den mest brukte rapporteringen av effekten i logistisk regresjon: tallet oddsen ganges med når xx øker med én enhet,
OR=eβ1=odds(x+1)odds(x).\text{OR}=e^{\beta_1}=\frac{\text{odds}(x+1)}{\text{odds}(x)}.
β1>0\beta_1>0 gir OR >1>1 (oddsen øker), β1<0\beta_1<0 gir OR <1<1, og β1=0\beta_1=0 gir OR =1=1 (ingen effekt).
✏️Eksempel 2: Tolke en koeffisient riktig

I modellen fra eksempel 1 er β^1=0,4\hat\beta_1=0{,}4. En medstudent skriver: «én studietime til øker sannsynligheten for å bestå med 0,4».

a) Forklar hvorfor dette er galt, og gi den korrekte tolkningen.
b) Vis med tallene fra eksempel 1 at sannsynlighetsendringen per time ikke er konstant.

a) β^1=0,4\hat\beta_1=0{,}4 er endringen i logiten per time: log-oddsen øker med 0,4, dvs. oddsen ganges med e0,4=1,49e^{0{,}4}=1{,}49 — en økning i oddsen på ca. 49 % per time. Sannsynligheten kan umulig øke med 0,4 per time hele veien (etter tre timer ville den passert 1).

b) Fra eksempel 1: p^(2)=0,198\hat p(2)=0{,}198 og p^(8)=0,731\hat p(8)=0{,}731. Gjennomsnittlig endring over disse seks timene er (0,7310,198)/6=0,089(0{,}731-0{,}198)/6=0{,}089 per time — langt fra 0,4, og endringen er størst nær midten av S-kurven (p0,5p\approx 0{,}5) og minst ute i halene.

📝Oppgave 2

En logistisk modell for frafall (Y=1Y=1 betyr at studenten slutter) har β^1=0,7\hat\beta_1=-0{,}7 for variabelen «antall veiledningsmøter».

a) Tolk β^1\hat\beta_1 korrekt via oddsen.
b) En rapport skriver «hvert møte senker frafallssannsynligheten med 0,7». Hva er galt?

To-gruppe-sammenligningen som regresjon

Eksamensvarianten av logistisk regresjon (H2015-mønsteret) er å sammenligne suksessandelen i to grupper — nøyaktig samme spørsmål som andelstesten i kap. 2.3, men skrevet som regresjon. Grepet er en dummyvariabel.

Dummyvariabel (indikator)

En forklaringsvariabel som koder gruppetilhørighet med 0 og 1: x=0x=0 for referansegruppen (f.eks. kontroll) og x=1x=1 for den andre gruppen (f.eks. tiltak). Dummyer lar kategoriske sammenligninger uttrykkes i regresjonsspråk — også i lineær regresjon (kap. 3.3).

To-gruppe-modellen med dummy
Logistisk regresjon med én dummy x{0,1}x\in\{0,1\} gir én sannsynlighet per gruppe:
logit(p0)=β0  (x=0),logit(p1)=β0+β1  (x=1).\operatorname{logit}(p_0)=\beta_0\ \ (x=0),\qquad \operatorname{logit}(p_1)=\beta_0+\beta_1\ \ (x=1).
β0\beta_0 er logiten i referansegruppen, og β1\beta_1 er forskjellen i logit mellom gruppene — dvs. logaritmen til oddsforholdet mellom gruppe 1 og gruppe 0.
β1=0\beta_1=0 svarer til lik sannsynlighet
Nøkkelen til to-gruppe-testen: siden logit-funksjonen er strengt voksende, er
p0=p1    logit(p0)=logit(p1)    β1=0.p_0=p_1\iff \operatorname{logit}(p_0)=\operatorname{logit}(p_1)\iff \beta_1=0.
Hypotesen «lik suksessandel i de to gruppene» er derfor nøyaktig H0:β1=0H_0:\beta_1=0 i dummymodellen — en gruppeforskjell i andel kan testes som en koeffisienttest.
Wald-testen for β1\beta_1 (z value)
Testen av H0:β1=0H_0:\beta_1=0 i logistisk regresjon: observatoren er estimatet delt på standardfeilen,
Z=β^1se(β^1),Z=\frac{\hat\beta_1}{se(\hat\beta_1)},
som under H0H_0 er tilnærmet N(0,1)N(0,1) i store utvalg (ML-asymptotikk, som Wald-oppsettet i kap. 1.3). Forkast på 5 %-nivå når Z>1,96|Z|>1{,}96, eller les P-verdien rett av utskriften.
Utskriften i logistisk regresjon (z i stedet for t)

Sammendraget av en tilpasset logistisk regresjon leses som lm-sammendraget i kap. 3.2, med én forskjell: kolonnene heter z value og Pr(>

z), ikke t value og Pr(>t

✏️Eksempel 3: To-gruppe-sammenligning fra utskrift (sjanger P)

I et forsøk får 100 kunder standard nettside (gruppe 0) og 100 kunder ny nettside (gruppe 1). Andelen som gjennomfører kjøp: 40 av 100 i gruppe 0 og 55 av 100 i gruppe 1. En logistisk regresjon av kjøp (Y=1Y=1) på dummyen «ny» gir:

Coefficients:
            Estimate  Std. Error  z value  Pr(>|z|)
(Intercept)  -0.4055      0.2041   -1.986    0.0470
ny            0.6061      0.2865    2.116    0.0344

a) Verifiser at β^0\hat\beta_0 er logiten til andelen i gruppe 0, og at β^0+β^1\hat\beta_0+\hat\beta_1 er logiten i gruppe 1.
b) Formuler hypotesen «lik kjøpsandel» i modellens språk, og konkluder på 5 %-nivå.
c) Tolk eβ^1e^{\hat\beta_1}.

a) p^0=0,40\hat p_0=0{,}40 gir logit(0,40)=log0,400,60=log(0,667)=0,4055=β^0\operatorname{logit}(0{,}40)=\log\dfrac{0{,}40}{0{,}60}=\log(0{,}667)=-0{,}4055=\hat\beta_0. p^1=0,55\hat p_1=0{,}55 gir logit(0,55)=log0,550,45=0,2007\operatorname{logit}(0{,}55)=\log\dfrac{0{,}55}{0{,}45}=0{,}2007, og β^0+β^1=0,4055+0,6061=0,2006\hat\beta_0+\hat\beta_1=-0{,}4055+0{,}6061=0{,}2006 — stemmer (avrunding).

b) Lik kjøpsandel p0=p1p_0=p_1 svarer til H0:β1=0H_0:\beta_1=0 (mot Ha:β10H_a:\beta_1\ne 0). Fra utskriften: Z=0,6061/0,2865=2,116Z=0{,}6061/0{,}2865=2{,}116 og Pr(>|z|) =0,0344<0,05=0{,}0344<0{,}05 — forkast. På 5 %-nivå er det belegg for at den nye nettsiden gir en annen kjøpsandel enn standard.

c) e0,6061=1,83e^{0{,}6061}=1{,}83: oddsen for kjøp er estimert 83 % høyere med ny nettside enn med standard (oddsforholdet mellom gruppene).

📝Oppgave 3

To undervisningsopplegg sammenlignes: med standardopplegget består 30 av 120, med det nye 45 av 130. En logistisk regresjon av bestått på dummyen «ny» gir:

Coefficients:
            Estimate  Std. Error  z value  Pr(>|z|)
(Intercept)  -1.0986      0.2108   -5.211  1.88e-07
ny            0.4626      0.2801    1.652    0.0986

a) Verifiser Estimate-kolonnen fra andelene 30/12030/120 og 45/13045/130.
b) Test på 5 %-nivå om beståttandelen er forskjellig i de to oppleggene, og konkluder i kontekst.
c) Hva sier (Intercept)-raden — og hvorfor er dens P-verdi uinteressant her?

📝Oppgave 4

En logistisk modell for om en kunde takker ja til et tilbud (Y=1Y=1) som funksjon av alder xx (år) gir:

Coefficients:
            Estimate  Std. Error  z value  Pr(>|z|)
(Intercept)  -4.2000      1.1000   -3.818  0.000134
alder         0.0850      0.0320    2.656  0.007900

a) Er alderseffekten signifikant på 5 %-nivå?
b) Tolk β^1=0,085\hat\beta_1=0{,}085 via oddsen.
c) Estimer sannsynligheten for ja hos en 60-åring.

📝Oppgave 5

La p0p_0 og p1p_1 være suksess-sannsynlighetene i gruppe 0 og gruppe 1, og sett opp den logistiske dummymodellen logit(p)=β0+β1x\operatorname{logit}(p)=\beta_0+\beta_1x med x{0,1}x\in\{0,1\}.

a) Uttrykk β0\beta_0 og β1\beta_1 ved p0p_0 og p1p_1.
b) Vis at nullhypotesen om lik andel, p0=p1p_0=p_1, er ekvivalent med β1=0\beta_1=0.

📝Oppgave 6
(Krevende.) I en kampanjemodell er β^1=1,2\hat\beta_1=1{,}2 for dummyen «fikk rabattkupong».

a) I segment A er basissannsynligheten (uten kupong) p0=0,2p_0=0{,}2. Estimer sannsynligheten med kupong.
b) I segment B er p0=0,5p_0=0{,}5. Estimer sannsynligheten med kupong.
c) Bruk (a) og (b) til å forklare hvorfor «kupongen øker kjøpssannsynligheten med et fast antall prosentpoeng» er en umulig tolkning av β^1\hat\beta_1.

Begrepsbank

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet. Korte definisjoner til eksamensrepetisjon av kjenne-temaet.
Fra logit til sannsynlighet
Omregningen du alltid trenger: med lineær prediktor η=β0+β1x\eta=\beta_0+\beta_1x er
p=eη1+eη,η=logp1p.p=\frac{e^{\eta}}{1+e^{\eta}},\qquad \eta=\log\frac{p}{1-p}.
Huskeregel: η=0p=0,5\eta=0\Leftrightarrow p=0{,}5; store positive η\eta gir pp nær 1, store negative gir pp nær 0.
Estimering i logistisk regresjon (kjenne)

Koeffisientene estimeres med maximum likelihood, men score-ligningene har ingen lukket løsning — de løses numerisk av programvaren. På eksamen leser du derfor β^\hat\beta-ene fra utskriften; selve ML-utledningen kreves ikke (kjenne-tema).

Kobling til andelstesten (kap. 2.3)

To-gruppe-sammenligningen med dummy tester samme spørsmål som to-utvalgs andelstesten i kap. 2.3: «er suksessandelen lik i de to gruppene?» Andelstesten jobber på differansen p^1p^2\hat p_1-\hat p_2, logistisk regresjon på logit-differansen β^1\hat\beta_1 — i store utvalg gir de i praksis samme konklusjon.

Symbol- og formelliste
Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.