Tilbake
7.4
Residualanalyse

7.4 Residualanalyse

Bruk residualer og residualplott til å vurdere modellkvalitet og avgjøre når en annen modelltype bør prøves.

50 min
17 oppgaver
ResidualResidualplottModellvurderingUteliggere
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 17 oppgaver

Når et fint tall lyver

To analytikere presenterer hver sin regresjonsmodell, begge med R2R^2 rundt 0,9. Sjefen nikker fornøyd — til den ene modellen viser seg å bomme grovt på alle nye observasjoner. Hvordan kunne to like R2R^2-verdier skjule så ulik kvalitet? Svaret er at R2R^2 er et sammendrag — ett tall — og sammendrag kan skjule synder. Skal du se hva modellen gjør med dataene, må du studere residualene.

For en regresjonsmodell y^=ax+b\hat{y} = ax + b er residualet for observasjon ii

ei=yiy^ie_i = y_i - \hat{y}_i

Er ei>0e_i > 0, ligger punktet over modellen (modellen undervurderer); er ei<0e_i < 0, ligger det under (modellen overvurderer); og for regresjonslinjen er alltid ei=0\sum e_i = 0.

En god modell har residualer som ligger tilfeldig spredt rundt null, med omtrent samme spredning for små og store xx-verdier, og uten noe systematisk mønster — ingen kurvatur, ingen trakt, ingen bølge. Viser residualene et mønster, betyr det at modellen ikke har fanget opp alt som ligger i dataene, og da bør en annen modelltype prøves.

Verktøyet er residualplottet: et diagram med residualet eie_i på den vertikale aksen og xix_i (eller y^i\hat{y}_i) på den horisontale, med en referanselinje gjennom e=0e = 0. Det er her modellenes sannhet kommer for en dag — punkt for punkt, uten mulighet til å gjemme seg bak et pent sammendrag.

📝Oppgave Quiz 1

Å lese mønstrene — og avsløre feil modell

Residualplott leses som røntgenbilder, og fire diagnoser går igjen. (1) Tilfeldig sky rundt null — modellen passer; ingen handling nødvendig. (2) U-form eller bue — den lineære modellen mangler kurvatur; prøv andregrads-, eksponentiell eller potensmodell. (3) Trakt (vifteform) — spredningen vokser med xx; vurder å transformere yy (for eksempel lny\ln y) eller bytte modelltype. (4) Enkeltpunkter med svært store residualer — uteliggere; sjekk om det er målefeil eller reelle avvik.

Se diagnosen i praksis. Et datasett med modellen y^=3x+5,5\hat{y} = 3x + 5{,}5 gir residualene 0,5; 0,5; 0,5; 1,5; 0,5; 0,50{,}5;\ -0{,}5;\ -0{,}5;\ -1{,}5;\ 0{,}5;\ 0{,}5 — små, med skiftende fortegn og sum null. Tilfeldig spredning: lineær modell passer godt.

Sammenlign med et annet datasett der linjen y^=4x+2\hat{y} = 4x + 2 gir residualene 1; 3; 2; 0; 5; 12-1;\ -3;\ -2;\ 0;\ 5;\ 12. Her er mønsteret iøynefallende: store negative avvik for små xx, kraftig voksende positive for store xx — en tydelig U-/bueform. Og det avslørende: R2R^2 kan likevel være rundt 0,9, fordi den lineære trenden fanger mye av variasjonen. Men residualene røper at en andregrads- eller eksponentiell modell ville passet bedre. Konklusjon: den lineære modellen forkastes — til tross for sin pene R2R^2.

Derfor brukes alltid begge verktøyene sammen, og kombinasjonene gir hver sin beskjed: Høy R2R^2 + tilfeldig residualplott = god modell. Høy R2R^2 + systematisk mønster = misvisende; feil modelltype. Lav R2R^2 + tilfeldig plott = riktig modelltype, men støyete data. Lav R2R^2 + mønster = feil type og mye støy; start på nytt.

📝Oppgave Quiz 2

Uteliggere — og verktøyene som tegner plottet

Hva med observasjonen som stikker seg ut? Et punkt med et residual som er mange ganger større enn de andre, er en uteligger, og den skal håndteres med ryddighet, ikke refleks. Fremgangsmåten: (1) Sjekk dataene — er det en målefeil eller skrivefeil? Var det en spesiell hendelse (ferie, strømstans, ny måler)? (2) Er det målefeil: rett opp eller fjern observasjonen, og kjør regresjonen på nytt. (3) Er det en reell, men spesiell hendelse: dokumenter den, vurder å holde den utenfor modellen — og forklar valget i rapporten. (4) Vet du ikke: rapporter resultater både med og uten uteliggeren, så leseren ser effekten selv.

Én regel er ufravikelig: uteliggere fjernes aldri bare fordi de er ubehagelige. Hver fjerning skal begrunnes — alt annet er cherry-picking.

Residualplott lager du raskt i verktøyene dine. I GeoGebra: skriv punktene som en liste, data = {(1,9),(2,11),...}, lag linjen med f = FitLine(data), og bygg residualene med Sequence-kommandoer som trekker modellverdien fra hver observasjon; tegn til slutt linjen e=0e = 0 som referanse. I Excel: legg til en kolonne med formelen =B2-(SLOPE*A2+INTERCEPT) og lag et spredningsplott av residualene mot xx. I Python: residuals = y - (a*x + b) etterfulgt av plt.scatter(x, residuals).

Dermed er kvalitetskontrollen komplett: R2R^2 gir sammendraget, residualplottet gir bildet, og uteliggerrutinen sikrer ærligheten. De tre sammen er forskjellen på en analyse som tåler ettersyn, og en som rakner ved første spørsmål fra sensor — eller fra sjefen i historien vi startet med.

📝Oppgave Quiz 3

Oppsummering: bildet bak tallet

Historien om de to modellene med samme R2R^2 har nå sin forklaring. Residualet ei=yiy^ie_i = y_i - \hat{y}_i måler hvert punkts avvik fra modellen — positivt over, negativt under, alltid med sum null for regresjonslinjen. Residualplottet, med residualene mot xx og referanselinjen e=0e = 0, er røntgenbildet som viser det sammendraget skjuler: en god modell gir tilfeldig spredning rundt null med jevn varians, mens U-form avslører manglende kurvatur, trakt avslører ujevn spredning, og enkeltstående kjemper avslører uteliggere.

Kombinasjonsregelen er verdt å pugge: høy R2R^2 med rent residualplott er en god modell; høy R2R^2 med mønster er en misvisende modell av feil type; lav R2R^2 med rent plott er riktig form i støyete data; lav R2R^2 med mønster betyr omstart. R2R^2 alene er aldri nok.

Uteliggere håndteres med ryddig rutine: undersøk årsaken, fjern bare dokumenterte målefeil, rapporter tvilstilfeller både med og uten — og begrunn alltid. Verktøyene (GeoGebra, Excel, Python) tegner plottene på sekunder; dømmekraften må du stille med selv.

Med regresjon (7.1), korrelasjonskritikk (7.2), ikke-lineære modeller (7.3) og residualanalyse i verktøykassen er du nå fullt utrustet for kapittel 8 — der modellene møter virkelige samfunnsøkonomiske datasett.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.