3.1 Enkel lineær regresjon: minste kvadrater og inferens for stigningstallet
Minste kvadraters estimator (= ML under normalfeil), E og V av stigningstallestimatoren, t-test og KI for β₁, tolkning av koeffisientene i kontekst, og R² som kvadrert korrelasjon.
- Utledning av minste kvadraters formler (normalligningene) kommer i ~36 % av settene.
- Utledning av og i ~27 %.
- t-test og konfidensintervall for stigningstallet i ~91 % — dette må sitte som en refleks.
Sensorkrav (§4.8): tolk koeffisientene i kontekst, bruk riktige frihetsgrader (, ikke ), og advar mot å bruke modellen langt utenfor dataområdet. Prioritet: må sitte perfekt.
Tidsbruk: ~65 min i fire løkker (minste kvadrater / av inferens for tolkning og ). Legg inn en pause etter løkke 2.
Regresjon behandles elementært i STK1100 kap. 8.3 Enkel lineær regresjon (→ stk1100-8-3) (klartekst — STK1100 er ikke bygget ennå); her tar vi den fulle inferensen. For derivasjon av en kvadratisk sum: R1 4.1 Derivasjonsregler.
Hele regresjonsinferensen er dette mønsteret. Det eneste nye er at estimatoren er stigningstallet , standardfeilen er , og frihetsgraden er (ikke — vi estimerer nå to ting, og ).
Ofte vil vi forklare én størrelse (, responsen) ut fra en annen (, forklaringsvariabelen): salg ut fra reklame, avling ut fra gjødsel, eksamenspoeng ut fra studietimer. Punktene i et spredningsdiagram ligger sjelden på én rett linje — men om de klumper seg rundt en linje, vil vi finne den beste linja og si noe presist om hvor bratt den er.
Regresjon svarer på tre spørsmål eksamen stiller igjen og igjen: (1) Hvilken rett linje passer dataene best? (2) Hvor mye endrer seg per enhet — og hvor sikre er vi på det tallet? (3) Hvor mye av variasjonen i forklarer ?
Vi går i fire løkker: minste kvadrater (finn linja), og av stigningstallet (hvor presis er den), inferens (t-test og KI for ), og tolkning + .
Løkke 1 — Modellen og minste kvadrater (~18 min)
Her er faste (kjente) tall, konstantleddet (skjæringen med -aksen), stigningstallet (endring i forventet per enhet ), og feilleddet. Merk: annet argument i er variansen. Fordi er stokastisk, er stokastisk (stor bokstav) med og .
Vi kvadrerer så positive og negative avvik ikke skal nulle hverandre ut, og fordi kvadratet gjør deriverbar. Løsningen kalles minste kvadraters estimatorer .
Steg 1 — deriver med hensyn på :
Intuisjon: den beste linja går gjennom «tyngdepunktet» — deler vi denne ligningen på , får vi nettopp .
Steg 2 — deriver med hensyn på :
Intuisjon: residualene skal være ukorrelert med — ingen lineær trend igjen å hente ut.
Disse to kalles normalligningene. Løser vi dem (sett inn fra steg 1 i steg 2), får vi
Intuisjon: telleren måler hvordan og samvarierer, nevneren hvor spredt -ene er — stigningstallet er «samvariasjon per spredning i ».
Den første sier at linja går gjennom . Løsningen er og .
er spredningen i -verdiene; er samvariasjonen mellom og . Da er . Regnevennlige varianter: og .
er en estimator (stor bokstav , stokastisk); et konkret tall fra data er et estimat. En nyttig omskriving er med vektene — den brukes til å utlede og .
Den følger av at linja går gjennom tyngdepunktet . er forventet respons ved — men denne tolkningen er bare meningsfull hvis ligger innenfor (eller nær) dataområdet.
Residualene er det empiriske motstykket til de ukjente feilleddene . Minste kvadrater gjør nettopp minst, og gir alltid og (fra normalligningene).
Fire målinger gir og . Finn minste kvadraters linje.
Linja er . Sjekk: ved gir den — linja går gjennom tyngdepunktet, som den skal.
Fem observasjoner: , . Det er oppgitt at , , og .
a) Finn og .
b) Hva er den tilpassede verdien ved , og hva er residualen der?
Løkke 2 — Forventning, varians og LS = ML (~18 min)
Log-likelihooden inneholder . Å maksimere over er derfor det samme som å minimere — altså minste kvadrater. Dette rettferdiggjør LS og kobler regresjonen til hele ML-kjeden fra Del 1.
Estimatoren er altså forventningsrett — uten normalitetsantakelse, kun .
Utledning: med uavhengige , så . Konsekvens: jo mer spredte -verdiene er (stor ), jo mer presist estimeres stigningstallet.
Steg 1: Skriv med .
Intuisjon: er en lineærkombinasjon av uavhengige — da kan vi bruke .
Steg 2: Fordi er uavhengige med :
Intuisjon: i telleren forkortes mot ett i nevneren.
I praksis er ukjent og erstattes av estimatoren nedenfor — da får vi standardfeilen .
SSE måler spredningen rundt linja. Den inngår i variansestimatoren og i . Regnevennlig: , der .
Deleren er , ikke : vi har brukt data til å estimere to parametere ( og ), så to frihetsgrader er bundet. Med denne deleren er forventningsrett for . er «Residual standard error» i R-utskriften.
For datasettet i oppgave 1 (, , ) er .
a) Finn SSE ved (husk ).
b) Finn variansestimatet og standardfeilen .
Løkke 3 — Inferens for stigningstallet (~17 min)
Den er kvadratroten av med erstattet av . Standardfeilen er «Std. Error»-kolonnen for stigningstallet i R-utskriften og går rett inn i t-observatoren og konfidensintervallet.
Fordelingen er fordi telleren er (tilnærmet) normal, , og de to er uavhengige — normal delt på uavhengig gir en t-fordeling. Den vanligste testen er («har noen effekt?»), som gir — nettopp «t value»-kolonnen i R-utskriften.
Samme mønster som t-intervallet for en forventning, med frihetsgrader. Via dualiteten (kap. 2.2): ligger utenfor intervallet hviss den tosidige testen forkaster . Ligger utenfor, er stigningstallet signifikant forskjellig fra null.
En lærer registrerer antall timer studert og oppnådde eksamenspoeng for studenter. Oppsummert: , , , , . Bruk .
a) Finn og , og tolk dem i kontekst.
b) Finn og .
c) Test mot på 5 %-nivå, og gi et 95 %-KI for .
d) Kan vi forkaste at hver ekstra time gir 2 poeng ()?
Tolkning: Én ekstra studietime svarer til poeng høyere forventet eksamensresultat. er forventet poengsum ved timer — men ligger utenfor dataområdet (2–20 timer), så dette er en ekstrapolering man skal være varsom med.
b) . , . .
c) . Kritisk verdi ; siden , forkaster vi — stigningstallet er klart signifikant. 95 %-KI: .
d) . Siden (og ligger inne i ), kan vi ikke forkaste . Dataene er forenlige med at hver time gir 2 poeng.
En analyse gir , og (altså frihetsgrader). Bruk .
a) Test mot på 5 %-nivå.
b) Gi et 95 %-KI for .
Løkke 4 — Tolkning, og regresjon uten konstantledd (~12 min)
Her er SST total variasjon, SSE uforklart variasjon (rundt linja), og SSR SST SSE forklart variasjon. : betyr perfekt lineær tilpasning, at ikke forklarer noe. leses «82 % av variasjonen i forklares av ».
Derfor: svarer til . Merk kvadratet — å forveksle og (glemme å kvadrere) er en hyppig feil. Fortegnet til (samme som fortegnet til ) forsvinner i .
For studietimer-dataene (eksempel 2) er og . Finn og korrelasjonen .
Altså forklarer antall studietimer om lag 92 % av variasjonen i eksamenspoengene. Korrelasjonen er (positiv, siden ). Sjekk: — som det skal være i enkel regresjon.
Utledning: minimer , deriver mht. og sett lik null: . Brukes bare når teorien tilsier at når (f.eks. proporsjonalitet).
En fysikklov tilsier at er proporsjonal med (altså når ), så vi tilpasser uten konstantledd. Data gir og .
a) Finn .
b) Hvorfor bruker vi her modellen uten konstantledd i stedet for den vanlige?
- i stedet for frihetsgrader. Enkel regresjon estimerer to parametere, så og all inferens bruker . Dette straffes hardt (§4.6).
- Tolke ved når er urealistisk. Skjæringen er da et rent regneteknisk tall, ikke en meningsfull forventet verdi.
- Ekstrapolere utenfor dataområdet uten forbehold. Modellen er bare understøttet der du har data.
- Forveksle og korrelasjonen . I enkel regresjon er — husk kvadratet.
- Regne LS «rett fram» uten å utlede normalligningene når oppgaven ber om utledningen (§4.8).
- Glemme å tolke koeffisientene i kontekst (med enhet). En ren tallverdi uten tolkning gir ikke full uttelling.
- Forveksle estimator og estimat: (stor bokstav-uttrykk) er stokastisk; tallet fra ett datasett er et estimat.
Blandet drill (sjanger H, stigende)
Åtte målinger gir , , , . ( = bilens alder i år, = pris i 1000 kr.)
a) Finn og .
b) Tolk i kontekst.
Fortsett med bil-dataene fra oppgave 5. Det er oppgitt og .
a) Finn SSE, og .
b) Gi et 95 %-KI for og avgjør om prisfallet er signifikant ().
En forsker vil vise egenskaper ved minste kvadrater generelt.
a) Utled og fra normalligningene.
b) Vis at .
c) Vis at .
(Kald oppgave — fasit som momentliste, ingen hint.) I en regresjon av blodtrykk () på alder (, år, målt for personer 30–70 år) får en student , og . Studenten skriver: «Forventet blodtrykk ved fødsel () er 70, og korrelasjonen mellom alder og blodtrykk er 0,49.» Pek ut de to feilene og gi de korrekte formuleringene.
Begrepsbank
Den totale variasjonen deler seg i forklart og uforklart del: , der , (forklart) og (residual). .
Antakelsen om konstant feilvarians: er den samme for alle . Brytes den (varierende spredning), er -ene feil og inferensen upålitelig; sjekkes med scale-location-plottet (kap. 3.4).
Fire antakelser om feilleddene: linearitet (), uavhengighet, konstant varians , og normalitet (). De tre siste sikrer at t-test og KI er gyldige og sjekkes med residualplott.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.
Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.