Tilbake
8.3

8.3 Enkel lineær regresjon (nykommer, elementær)

Minste kvadraters estimator med og uten konstantledd, dens forventning og varians, og bias–varians-avveiningen — regresjon slik STK1100 (ikke NTNU) tester den.

55 min
11 oppgaver
Enkel lineær regresjon (nykommerelementær)
Din fremgang i kapitlet
0 / 11 oppgaver
Forkunnskaper: Dette kapitlet bygger på kap. 8.2 Betinget forventning, prediksjon og MSE-minimering og på kap. 5.2 Maximum likelihood og momentmetoden (estimatorbegrepet, forventningsretthet).

Sist du var her:

- Fra kap. 1.2: Var(aX+bY)=a2Var(X)+b2Var(Y)+2abCov(X,Y)\text{Var}(aX+bY)=a^2\text{Var}(X)+b^2\text{Var}(Y)+2ab\,\text{Cov}(X,Y), og for uavhengige feil forsvinner kovariansleddet.
- Fra kap. 8.2: minste kvadrater er nettopp å minimere en sum av kvadrerte avvik — samme kvadratiske tap.
- Fra kap. 8.1: for binormale data ER den betingede forventningen E(YX=x)E(Y\mid X=x) denne regresjonslinjen.

En estimator (stor bokstav, stokastisk) er en oppskrift som gir et estimat (et tall) når vi setter inn data — skillet holdes konsekvent gjennom kapitlet.

I regresjon vil vi beskrive hvordan en responsvariabel YY avhenger av en forklaringsvariabel xx som vi selv kontrollerer (dose, konsentrasjon, temperatur). Dataene er par (xi,Yi)(x_i,Y_i), der xix_i-verdiene er faste tall og YiY_i-ene er stokastiske fordi målingen har tilfeldig feil. Metoden for å trekke den beste rette linjen gjennom punktene er minste kvadrater.

Kapitlet har tre læringsløkker. Løkke 1 (~19 min) setter opp modellen og utleder minste kvadraters estimator med konstantledd. Løkke 2 (~18 min) tar modellen uten konstantledd (gjennom origo) og dens forventning og varians. Løkke 3 (~18 min) bruker konfidensintervall til modellvalg og drøfter bias-varians-avveiningen. Hver løkke går teori → eksempel → oppgave.

Løkke 1 — Modellen og minste kvadrater med konstantledd (~19 min)

Den enkle lineære regresjonsmodellen
Responsen YiY_i antas å ligge på en rett linje pluss en tilfeldig feil:

Yi=β0+β1xi+εi,i=1,,nY_i=\beta_0+\beta_1 x_i+\varepsilon_i,\qquad i=1,\dots,n

Her er xix_i faste (kjente, ikke-stokastiske), β0\beta_0 (skjæringspunkt) og β1\beta_1 (stigningstall) ukjente parametre, og εi\varepsilon_i er uavhengige tilfeldige feil med E(εi)=0E(\varepsilon_i)=0 og Var(εi)=σ2\text{Var}(\varepsilon_i)=\sigma^2 (samme varians for alle — homoskedastisitet). Da er E(Yi)=β0+β1xiE(Y_i)=\beta_0+\beta_1 x_i og Var(Yi)=σ2\text{Var}(Y_i)=\sigma^2. Merk: det er YiY_i som er stokastisk, ikke xix_i.

Utledning: minste kvadraters estimatorer

Vi velger linjen som gjør summen av kvadrerte loddrette avvik minst mulig:

Q(β0,β1)=i=1n(Yiβ0β1xi)2.Q(\beta_0,\beta_1)=\sum_{i=1}^n\big(Y_i-\beta_0-\beta_1 x_i\big)^2.

Intuisjon: hvert ledd er kvadratet av avstanden fra datapunktet YiY_i til linjen ved xix_i. Å kvadrere straffer store bom hardt og gjør at over- og underbom ikke utligner hverandre.

Vi deriverer QQ med hensyn på hver parameter og setter lik null (normallikningene):

Qβ0=2(Yiβ0β1xi)=0,Qβ1=2xi(Yiβ0β1xi)=0.\frac{\partial Q}{\partial \beta_0}=-2\sum (Y_i-\beta_0-\beta_1 x_i)=0,\qquad \frac{\partial Q}{\partial \beta_1}=-2\sum x_i(Y_i-\beta_0-\beta_1 x_i)=0.

Intuisjon: den første likningen sier at residualene summerer til null; den andre at de er ukorrelerte med xix_i. Løser vi den første for β0\beta_0, får vi β^0=Yˉβ^1xˉ\hat\beta_0=\bar Y-\hat\beta_1\bar xlinjen går gjennom tyngdepunktet (xˉ,Yˉ)(\bar x,\bar Y). Setter vi dette inn i den andre, faller stigningstallet ut.

Minste kvadraters estimator (med konstantledd)
Estimatorene som minimerer kvadratsummen er:

β^1=i(xixˉ)(YiYˉ)i(xixˉ)2,β^0=Yˉβ^1xˉ\hat\beta_1=\frac{\sum_{i}(x_i-\bar x)(Y_i-\bar Y)}{\sum_i (x_i-\bar x)^2},\qquad \hat\beta_0=\bar Y-\hat\beta_1\bar x

Telleren er en «kovarians» mellom xx og YY i dataene, nevneren er spredningen i xx-verdiene Sxx=(xixˉ)2S_{xx}=\sum(x_i-\bar x)^2. Stor bokstav markerer at β^1\hat\beta_1 er en estimator (stokastisk via YiY_i-ene); setter vi inn tallverdier, får vi et estimat. En vanlig felle er å snu teller og nevner — nevneren inneholder bare xx-ene.

✏️Eksempel 1: Minste kvadraters linje

Et forsøk måler responsen YY ved fem dosenivåer xx:

xix_i12345
YiY_i3,34,86,98,611,4

Finn minste kvadraters estimat for stigningstall og skjæringspunkt.

Hjelpestørrelser: xˉ=3\bar x=3, Yˉ=(3,3+4,8+6,9+8,6+11,4)/5=35/5=7\bar Y=(3{,}3+4{,}8+6{,}9+8{,}6+11{,}4)/5=35/5=7.

Sxx=(xixˉ)2=(2)2+(1)2+0+12+22=10.S_{xx}=\sum(x_i-\bar x)^2=(-2)^2+(-1)^2+0+1^2+2^2=10.
SxY=(xixˉ)(YiYˉ)=(2)(3,7)+(1)(2,2)+0+(1)(1,6)+(2)(4,4)=7,4+2,2+1,6+8,8=20.S_{xY}=\sum(x_i-\bar x)(Y_i-\bar Y)=(-2)(-3{,}7)+(-1)(-2{,}2)+0+(1)(1{,}6)+(2)(4{,}4)=7{,}4+2{,}2+1{,}6+8{,}8=20.

Stigningstall:
β^1=SxYSxx=2010=2,0.\hat\beta_1=\frac{S_{xY}}{S_{xx}}=\frac{20}{10}=2{,}0.

Skjæringspunkt:
β^0=Yˉβ^1xˉ=72,03=1,0.\hat\beta_0=\bar Y-\hat\beta_1\bar x=7-2{,}0\cdot 3=1{,}0.

Den estimerte linjen er Y^=1,0+2,0x\hat Y=1{,}0+2{,}0\,x. Ved dose x=3x=3 predikeres respons Y^=7\hat Y=7 — nettopp tyngdepunktet.

📝Oppgave 1

(Innstegsoppgave.) I en regresjon er xˉ=4\bar x=4, Yˉ=10\bar Y=10 og stigningstallet er estimert til β^1=1,5\hat\beta_1=1{,}5. Finn skjæringspunktet β^0\hat\beta_0 og skriv opp den estimerte linjen.

📝Oppgave 2

En regresjon har data med xˉ=6\bar x=6, Yˉ=39,67\bar Y=39{,}67, Sxx=(xixˉ)2=1750S_{xx}=\sum(x_i-\bar x)^2=1750 og SxY=(xixˉ)(YiYˉ)=1760S_{xY}=\sum(x_i-\bar x)(Y_i-\bar Y)=1760.

a) Finn β^1\hat\beta_1 og β^0\hat\beta_0.

b) Predikér responsen ved x=50x=50.

📝Oppgave 3

Utled minste kvadraters estimator for β0\beta_0 ved å derivere kvadratsummen Q=(Yiβ0β1xi)2Q=\sum(Y_i-\beta_0-\beta_1 x_i)^2 med hensyn på β0\beta_0 og sette lik null. Hva sier resultatet geometrisk?

Løkke 2 — Modellen uten konstantledd og estimatorens egenskaper (~18 min)

Noen ganger vet vi at linjen må gå gjennom origo: ingen dose gir ingen respons, null konsentrasjon gir null absorpsjon. Da dropper vi skjæringspunktet og bruker modellen Yi=γ1xi+εiY_i=\gamma_1 x_i+\varepsilon_i med bare én ukjent parameter. Estimatoren blir enda enklere, og — som vi skal se i løkke 3 — får mindre varians.

Minste kvadrater uten konstantledd
For modellen gjennom origo Yi=γ1xi+εiY_i=\gamma_1 x_i+\varepsilon_i minimerer vi (Yiγ1xi)2\sum(Y_i-\gamma_1 x_i)^2. Derivasjon gir 2xi(Yiγ1xi)=0-2\sum x_i(Y_i-\gamma_1 x_i)=0, altså:

γ^1=ixiYiixi2\hat\gamma_1=\frac{\sum_i x_i Y_i}{\sum_i x_i^2}

Merk at både teller og nevner nå bruker rå xix_i og YiY_i (ikke avvik fra gjennomsnittet), fordi linjen er tvunget gjennom origo. Nevneren er xi2\sum x_i^2.

Forventning og varians for γ^1\hat\gamma_1
Estimatoren er en lineærkombinasjon av de stokastiske YiY_i-ene med faste vekter xi/xj2x_i/\sum x_j^2. Under modellen Yi=γ1xi+εiY_i=\gamma_1 x_i+\varepsilon_i:

E(γ^1)=xiE(Yi)xi2=xi(γ1xi)xi2=γ1(forventningsrett),E(\hat\gamma_1)=\frac{\sum x_i E(Y_i)}{\sum x_i^2}=\frac{\sum x_i(\gamma_1 x_i)}{\sum x_i^2}=\gamma_1\quad(\text{forventningsrett}),
Var(γ^1)=xi2Var(Yi)(xi2)2=σ2xi2.\text{Var}(\hat\gamma_1)=\frac{\sum x_i^2\,\text{Var}(Y_i)}{\left(\sum x_i^2\right)^2}=\frac{\sigma^2}{\sum x_i^2}.

Vi bruker at xix_i er faste og εi\varepsilon_i uavhengige (så ingen kovariansledd). Estimatoren er forventningsrett når origo-modellen er riktig.

✏️Eksempel 2: Regresjon gjennom origo

Absorpsjon YY måles ved fire konsentrasjoner xx (Beer-Lamberts lov tilsier linje gjennom origo):

xix_i2468
YiY_i3,45,89,311,7

a) Finn γ^1\hat\gamma_1 i modellen Yi=γ1xi+εiY_i=\gamma_1 x_i+\varepsilon_i.
b) Feilvariansen er kjent, σ2=0,36\sigma^2=0{,}36. Finn Var(γ^1)\text{Var}(\hat\gamma_1) og standardfeilen.

a) Regn hjelpestørrelsene:
xi2=4+16+36+64=120,\sum x_i^2=4+16+36+64=120,
xiYi=23,4+45,8+69,3+811,7=6,8+23,2+55,8+93,6=179,4.\sum x_iY_i=2\cdot 3{,}4+4\cdot 5{,}8+6\cdot 9{,}3+8\cdot 11{,}7=6{,}8+23{,}2+55{,}8+93{,}6=179{,}4.
γ^1=xiYixi2=179,4120=1,495.\hat\gamma_1=\frac{\sum x_iY_i}{\sum x_i^2}=\frac{179{,}4}{120}=1{,}495.

b)
Var(γ^1)=σ2xi2=0,36120=0,003,SE^=0,0030,0548.\text{Var}(\hat\gamma_1)=\frac{\sigma^2}{\sum x_i^2}=\frac{0{,}36}{120}=0{,}003,\qquad \widehat{\text{SE}}=\sqrt{0{,}003}\approx 0{,}0548.

📝Oppgave 4

En regresjon gjennom origo har xiYi=90\sum x_i Y_i=90 og xi2=60\sum x_i^2=60. Finn γ^1\hat\gamma_1.

📝Oppgave 5

For modellen Yi=γ1xi+εiY_i=\gamma_1 x_i+\varepsilon_i med uavhengige feil, E(εi)=0E(\varepsilon_i)=0, Var(εi)=σ2\text{Var}(\varepsilon_i)=\sigma^2:

a) Vis at γ^1=xiYixi2\displaystyle \hat\gamma_1=\frac{\sum x_iY_i}{\sum x_i^2} er forventningsrett.

b) Vis at Var(γ^1)=σ2/xi2\text{Var}(\hat\gamma_1)=\sigma^2/\sum x_i^2.

— naturlig pausepunkt —

Du har begge estimatorene. Siste løkke sammenligner dem: når lønner det seg å droppe konstantleddet, og hvordan bruker vi et konfidensintervall til å bestemme det?

Løkke 3 — Konfidensintervall, modellvalg og bias-varians (~18 min)

Forventning og varians for β^1\hat\beta_1
Også med konstantledd er stigningstallet en lineærkombinasjon av YiY_i-ene med faste vekter, så under modellen:

E(β^1)=β1(forventningsrett),Var(β^1)=σ2(xixˉ)2=σ2Sxx.E(\hat\beta_1)=\beta_1\quad(\text{forventningsrett}),\qquad \text{Var}(\hat\beta_1)=\frac{\sigma^2}{\sum(x_i-\bar x)^2}=\frac{\sigma^2}{S_{xx}}.

Variansen er liten når xx-verdiene er godt spredt (stor SxxS_{xx}): jo mer du varierer forklaringsvariabelen, desto mer presist estimeres stigningstallet. Standardfeilen er SE^(β^1)=σ2/Sxx\widehat{\text{SE}}(\hat\beta_1)=\sqrt{\sigma^2/S_{xx}}.

Konfidensintervall og modellvalg
Et (1α)(1-\alpha)-konfidensintervall for et parameter-estimat med kjent (eller godt estimert) standardfeil er standardformelen fra formelsamlingen:

θ^±zα/2SE^(θ^).\hat\theta\pm z_{\alpha/2}\cdot\widehat{\text{SE}}(\hat\theta).

For 95 %95\ \% er z0,025=1,96z_{0{,}025}=1{,}96. Modellvalg via intervallet: legg et KI rundt skjæringspunktet β^0\hat\beta_0. Inneholder intervallet 00, er det forenlig med at det sanne skjæringspunktet er null — da kan origo-modellen forsvares. Ligger 00 utenfor, bør konstantleddet beholdes. (Merk: dette er et informativt intervallargument, ikke en hypotesetest — STK1100 stopper ved konfidensintervallet.)

Bias-varians-avveiningen
Å droppe konstantleddet gir en estimator med mindre varians, men med risiko for skjevhet (bias) dersom det sanne skjæringspunktet ikke er null:

Var(γ^1)=σ2xi2  σ2(xixˉ)2=Var(β^1),\text{Var}(\hat\gamma_1)=\frac{\sigma^2}{\sum x_i^2}\ \le\ \frac{\sigma^2}{\sum(x_i-\bar x)^2}=\text{Var}(\hat\beta_1),

siden xi2=(xixˉ)2+nxˉ2(xixˉ)2\sum x_i^2=\sum(x_i-\bar x)^2+n\bar x^2\ge\sum(x_i-\bar x)^2. Ulikheten er streng når xˉ0\bar x\ne 0 og likhet når xˉ=0\bar x=0. Den enklere modellen foretrekkes når vi har god grunn til å tro at linjen går gjennom origo (da er den forventningsrett og har lavere varians); er vi usikre, koster den mulig skjevhet. Dette er avveiningen mellom presisjon og korrekthet.

✏️Eksempel 3: Konfidensintervall og modellvalg

Vi bruker dataene fra Eksempel 1 (n=5n=5, Sxx=10S_{xx}=10, β^1=2,0\hat\beta_1=2{,}0, β^0=1,0\hat\beta_0=1{,}0) og antar kjent feilvarians σ2=0,25\sigma^2=0{,}25.

a) Sett opp et 95 %95\ \%-konfidensintervall for stigningstallet β1\beta_1.

b) Standardfeilen for skjæringspunktet er SE^(β^0)=σ1n+xˉ2Sxx\widehat{\text{SE}}(\hat\beta_0)=\sigma\sqrt{\tfrac1n+\tfrac{\bar x^2}{S_{xx}}}. Regn ut et 95 %95\ \%-KI for β0\beta_0 og vurder om origo-modellen kan forsvares.

a) Var(β^1)=σ2/Sxx=0,25/10=0,025\text{Var}(\hat\beta_1)=\sigma^2/S_{xx}=0{,}25/10=0{,}025, så SE^=0,0250,158\widehat{\text{SE}}=\sqrt{0{,}025}\approx 0{,}158. Med z0,025=1,96z_{0{,}025}=1{,}96:
2,0±1,960,158=2,0±0,31=(1,69, 2,31).2{,}0\pm 1{,}96\cdot 0{,}158=2{,}0\pm 0{,}31=(1{,}69,\ 2{,}31).
Intervallet inneholder ikke 00 — det er en klar positiv sammenheng.

b) Med xˉ=3\bar x=3, n=5n=5, Sxx=10S_{xx}=10:
SE^(β^0)=0,2515+910=0,50,2+0,9=0,51,10,524.\widehat{\text{SE}}(\hat\beta_0)=\sqrt{0{,}25}\sqrt{\tfrac15+\tfrac{9}{10}}=0{,}5\sqrt{0{,}2+0{,}9}=0{,}5\sqrt{1{,}1}\approx 0{,}524.
β^0±1,960,524=1,0±1,03=(0,03, 2,03).\hat\beta_0\pm 1{,}96\cdot 0{,}524=1{,}0\pm 1{,}03=(-0{,}03,\ 2{,}03).
Intervallet inneholder 00 (så vidt). Det er dermed forenlig med at det sanne skjæringspunktet er null, og origo-modellen kan forsvares — men grensen er nær, så konklusjonen er ikke sterk.

📝Oppgave 6

En regresjon med konstantledd (design med exact β^1=3\hat\beta_1=3) har x=(0,1,2,3,4)x=(0,1,2,3,4) og Y=(2,2;4,6;8,4;10,6;14,2)Y=(2{,}2;\,4{,}6;\,8{,}4;\,10{,}6;\,14{,}2), altså xˉ=2\bar x=2, Yˉ=8\bar Y=8, Sxx=10S_{xx}=10, SxY=30S_{xY}=30. Feilvariansen er σ2=1\sigma^2=1.

a) Finn β^1\hat\beta_1 og β^0\hat\beta_0.

b) Sett opp et 95 %95\ \%-KI for β1\beta_1.

📝Oppgave 7

To variable måles på samme data x=(2,4,6,8)x=(2,4,6,8), Y=(3,4;5,8;9,3;11,7)Y=(3{,}4;\,5{,}8;\,9{,}3;\,11{,}7). Feilvariansen er σ2=0,36\sigma^2=0{,}36. For disse dataene er xˉ=5\bar x=5, xi2=120\sum x_i^2=120, Sxx=(xixˉ)2=20S_{xx}=\sum(x_i-\bar x)^2=20.

a) Regn ut Var(γ^1)\text{Var}(\hat\gamma_1) (uten konstantledd) og Var(β^1)\text{Var}(\hat\beta_1) (med konstantledd), og bekreft at den første er minst.

b) Forklar generelt hvorfor Var(γ^1)Var(β^1)\text{Var}(\hat\gamma_1)\le\text{Var}(\hat\beta_1), og når det er likhet.

📝Oppgave 8

Vi har data der et 95 %95\ \%-KI for skjæringspunktet blir (0,03, 2,03)(-0{,}03,\ 2{,}03) og for stigningstallet (1,69, 2,31)(1{,}69,\ 2{,}31).

a) Hvilken modell (med eller uten konstantledd) støttes av intervallene, og hvorfor?

b) En kollega vil alltid velge modellen uten konstantledd fordi den «har lavere varians». Gi et balansert svar med bias-varians-argumentet.

Begrepsbank til eksamen

Begrepsbanken er flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget for kapitlet gjelder kjernestoffet.

Minste kvadraters metode

Å velge linjen som minimerer summen av kvadrerte loddrette avvik (Yiβ0β1xi)2\sum(Y_i-\beta_0-\beta_1 x_i)^2. Man deriverer med hensyn på hver parameter, setter lik null (normallikningene) og løser. Samme kvadratiske tap som i beste prediksjon (kap. 8.2).

Spredningssummen SxxS_{xx}
Sxx=(xixˉ)2S_{xx}=\sum(x_i-\bar x)^2 måler hvor spredt forklaringsvariabelen er. Den er nevneren i β^1\hat\beta_1 og i Var(β^1)=σ2/Sxx\text{Var}(\hat\beta_1)=\sigma^2/S_{xx}: stor spredning i xx gir presist estimert stigningstall.
Forventningsrett estimator

En estimator θ^\hat\theta er forventningsrett (forventningstro) når E(θ^)=θE(\hat\theta)=\theta: den treffer i snitt riktig. Både β^1\hat\beta_1 og β^0\hat\beta_0 er forventningsrette under regresjonsmodellen; γ^1\hat\gamma_1 er det bare når det sanne skjæringspunktet er null.

Homoskedastisitet

Antakelsen Var(εi)=σ2\text{Var}(\varepsilon_i)=\sigma^2 for alle ii — feilene har samme varians uansett xx. Dette er nettopp egenskapen den betingede variansen σ22(1ρ2)\sigma_2^2(1-\rho^2) i binormalen har (kap. 8.1), noe som knytter regresjon til binormalmodellen.

Modellvalg via intervallet

Legg et KI rundt β^0\hat\beta_0: inneholder det 00, er origo-modellen forenlig med data og kan forsvares (spesielt om faglig begrunnet); ligger 00 utenfor, beholdes konstantleddet. Et informativt intervallargument, ikke en hypotesetest.

Identiteten xi2=Sxx+nxˉ2\sum x_i^2=S_{xx}+n\bar x^2

Nøkkelen bak at Var(γ^1)Var(β^1)\text{Var}(\hat\gamma_1)\le\text{Var}(\hat\beta_1): siden nxˉ20n\bar x^2\ge 0 er xi2Sxx\sum x_i^2\ge S_{xx}. Ulikheten mellom variansene er streng når xˉ0\bar x\ne 0 og blir likhet når xˉ=0\bar x=0.

Faste forklaringsvariabler

I regresjonsmodellen er xix_i kjente, ikke-stokastiske tall (kontrollerte nivåer). Derfor behandles de som konstanter i all forventnings- og variansregning, og usikkerheten kommer utelukkende fra de tilfeldige feilene εi\varepsilon_i.

Broen til binormalen

For binormale data er den betingede forventningen E(YX=x)=μ2+ρσ2σ1(xμ1)\displaystyle E(Y\mid X=x)=\mu_2+\rho\frac{\sigma_2}{\sigma_1}(x-\mu_1) nettopp en lineær regresjonsmodell (kap. 8.1). Regresjonens β1\beta_1 svarer til ρσ2/σ1\rho\sigma_2/\sigma_1, og feilvariansen σ2\sigma^2 til den betingede variansen σ22(1ρ2)\sigma_2^2(1-\rho^2).

Repetisjonsoppgaver
Din fremgang
0 / 3 oppgaver
Symbol- og formelliste

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.