Tilbake
6.5
Multippel regresjon

6.5 Multippel regresjon

Regresjonsanalyse med flere forklaringsvariabler.

55 min
13 oppgaver
Multippel regresjonFlere forklaringsvariablerJustert R²Multikollinearitet
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 13 oppgaver

Detektivarbeidet etter regresjonen

Du har laget en regresjonsmodell for et skoleprosjekt, og R2R^2 er imponerende høy. Fristelsen er stor til å erklære seier og levere. Men en erfaren statistiker ville stilt et ubehagelig spørsmål: Er modellen god, eller ser den bare god ut? Høy R2R^2 betyr nemlig ikke nødvendigvis god modell — en modell kan forklare mye av variasjonen og likevel systematisk bryte sine egne forutsetninger.

Svaret finner vi gjennom residualanalyse — modellbyggingens detektivarbeid. Residualet ei=yiy^ie_i = y_i - \hat{y}_i er det modellen ikke fanger opp, og nettopp derfor er residualene så verdifulle: hvis modellen har fanget hele mønsteret, skal det som er igjen være ren, strukturløs støy. Finner vi struktur i restene, har modellen oversett noe.

I denne fortellingen lærer du å lese residualplott som en detektiv leser åsteder: hvilke mønstre som avslører en feilspesifisert modell, hvordan du identifiserer mistenkelige enkeltobservasjoner — uteliggere og innflytelsesrike punkter — og hvorfor justert R2R^2 er et ærligere mål enn vanlig R2R^2 når modellen har flere forklaringsvariabler.

Å lese residualplottet

Et residualplott viser residualene eie_i mot de predikerte verdiene y^i\hat{y}_i (eller mot xix_i). For en god modell skal residualene oppføre seg som tilfeldig støy: de skal spre seg tilfeldig rundt null, ha konstant spredning over hele området — det kalles homoskedastisitet — og være tilnærmet normalfordelte.

Se på et konkret eksempel. Modellen y^=2+3x\hat{y} = 2 + 3x gir for fem datapunkter residualene 0,5-0{,}5; 0,20{,}2; 0,2-0{,}2; 0,50{,}5 og 0,2-0{,}2. De veksler i fortegn uten trend, spredningen er jevn (mellom 0,5-0{,}5 og 0,50{,}5), og summen er omtrent null. Konklusjon: modellen er passende.

Men residualplott kan også rope varsku, og tre mønstre går igjen. Et buet mønster — for eksempel en U-form — betyr at sammenhengen er ikke-lineær og at modellen systematisk bommer; da bør du vurdere en annen funksjonsform. En traktform, der spredningen øker med y^\hat{y}, kalles heteroskedastisitet: variansen er ikke konstant, og en log-transformasjon av yy kan ofte hjelpe. Og gruppering — klynger av residualer — antyder at det finnes forklaringsvariabler du ikke har tatt med, for eksempel at dataene kommer fra to ulike populasjoner.

Idealet er altså et plott som er, ærlig talt, kjedelig: jevn, tilfeldig spredning rundt null uten noe som helst mønster. I residualanalysens verden er kjedelig det beste komplimentet en modell kan få.

📝Oppgave Quiz 1

Uteliggere, innflytelsesrike punkter og justert R2R^2

Noen ganger er problemet ikke modellen, men enkeltobservasjoner. En uteligger er et punkt med uvanlig stort residual — som tommelfingerregel ei>2se|e_i| > 2s_e, der ses_e er residualenes standardavvik. For å vurdere dette systematisk bruker vi standardiserte residualer zi=ei/sez_i = e_i / s_e, og undersøker alle punkter med zi>2|z_i| > 2.

Et eksempel: et datasett har se=3,2s_e = 3{,}2 og residualene 1,5-1{,}5; 2,12{,}1; 0,80{,}8; 9,4-9{,}4; 0,3-0{,}3; 1,71{,}7; 2,4-2{,}4; 0,90{,}9. Standardisering gir zz-verdiene 0,47-0{,}47; 0,660{,}66; 0,250{,}25; 2,94-2{,}94; 0,09-0{,}09; 0,530{,}53; 0,75-0{,}75 og 0,280{,}28. Observasjon 4 stikker seg ut med z=2,94>2|z| = 2{,}94 > 2 — en uteligger. Men husk detektivens etikk: uteliggere skal undersøkes, ikke automatisk fjernes. Kanskje er det en målefeil — eller kanskje den mest interessante observasjonen i hele datasettet.

Beslektet, men ikke det samme, er et innflytelsesrikt punkt: en observasjon med ekstrem xx-verdi som trekker hele regresjonslinjen mot seg. Et slikt punkt kan ha lite residual nettopp fordi det har bøyd linjen — derfor må det vurderes separat.

Til slutt et ord om R2R^2 når modellen vokser. Vanlig R2=1SSESST\displaystyle R^2 = 1 - \frac{SS_E}{SS_T} har en svakhet: den øker alltid når du legger til flere forklaringsvariabler, selv om de er meningsløse. Justert R2R^2,

Radj2=1SSE/(nk1)SST/(n1)R^2_{adj} = 1 - \frac{SS_E/(n-k-1)}{SS_T/(n-1)}

straffer modellen for hver ekstra variabel (kk er antall variabler, nn antall observasjoner) og kan faktisk synke hvis en ny variabel ikke bidrar. Ved sammenligning av modeller med ulikt antall variabler er justert R2R^2 derfor det ærlige målet.

📝Oppgave Quiz 2

Oppsummering: ikke stol blindt på R2R^2

Fortellingen startet med en fristende høy R2R^2 og endte med en grundig kvalitetskontroll. Residualene ei=yiy^ie_i = y_i - \hat{y}_i er det modellen ikke fanger opp, og residualplottet er detektivens viktigste verktøy: en god modell etterlater tilfeldig spredning rundt null med konstant varians. Et buet mønster avslører ikke-linearitet, en traktform avslører heteroskedastisitet (prøv log-transformasjon), og klynger antyder manglende forklaringsvariabler.

Enkeltobservasjoner gransker vi med standardiserte residualer zi=ei/sez_i = e_i/s_e: punkter med zi>2|z_i| > 2 er uteliggere som skal undersøkes — aldri slettes på autopilot. Innflytelsesrike punkter med ekstreme xx-verdier kan bøye hele linjen og krever egen vurdering.

Og når modellen har flere forklaringsvariabler, husker du at vanlig R2R^2 alltid stiger når du legger til mer — bruk justert R2R^2, som straffer kompleksitet og bare belønner variabler som faktisk bidrar. Den store lærdommen: en modell skal ikke bare passe dataene, den skal bestå avhørene. Høy R2R^2 åpner saken — residualanalysen avgjør den.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.