Tilbake
8.2

8.2 Inferens og prediksjon i regresjon — og residualplottet sensor alltid spør om

KI og test for helningen, prediksjon i x₀ med KI vs. PI — og residualdiagnostikken som nesten alltid er en deloppgave.

60 min
8 oppgaver
Inferensprediksjon i regresjonresidualplottet sensor alltid spør om
Din fremgang i kapitlet
0 / 8 oppgaver
Forkunnskaper: Bygger direkte på estimeringen i kap. 8.1 (LS-estimatene, SSE\text{SSE}, s2=SSE/(n2)s^2=\text{SSE}/(n-2) og standardfeilen SE(β^)\text{SE}(\hat{\beta})). Selve inferensmaskineriet — testobservator, forkastingsregel og konfidensintervall — er testritualet fra kap. 7.1 og KI-tankegangen fra kap. 6.1, nå anvendt på β^\hat{\beta} i stedet for Xˉ\bar{X}. Til ln-modellen trenger du å kunne regne med logaritmer og eksponensialfunksjonen.

Sist du var her — de tre verktøyene vi bygger på (ferdig oppfrisket):

1. Standardfeilen til helningen (kap. 8.1). SE(β^)=sSxx\text{SE}(\hat{\beta})=\dfrac{s}{\sqrt{S_{xx}}}, med s=SSE/(n2)s=\sqrt{\text{SSE}/(n-2)} og SSE=Syyβ^Sxy\text{SSE}=S_{yy}-\hat{\beta}S_{xy}. Dette er byggeklossen i alle testene og intervallene under.
2. Testritualet (kap. 7.1). Sett opp H0H_0 og H1H_1; regn testobservatoren; sammenlign med kritisk verdi (eller p-verdi); konkluder i klartekst. Vi bytter bare ut Xˉ\bar{X}-observatoren med β^\hat{\beta}-observatoren.
3. KI-formen (kap. 6.1). Et konfidensintervall er estimat±(kvantil)(standardfeil)\text{estimat} \pm (\text{kvantil})\cdot(\text{standardfeil}). Her blir kvantilen tn2,α/2t_{n-2,\alpha/2} (samme frihetsgrad n2n-2 som i s2s^2).

Kapitlet er forkunnskap for NTNU-varianten uten konstantledd (kap. 8.3).

Vi har linja på plass. Nå spør vi: er helningen β\beta virkelig forskjellig fra null (har xx forklaringskraft?), hvor sikre er vi på den (KI), og hva forutsier modellen ved en ny xx-verdi — og med hvilken usikkerhet? Til slutt sjekker vi om modellen i det hele tatt passer: det gjør vi grafisk med residualplott.

Fire løkker: test og KI for helningen (løkke 1), prediksjon med KI vs. PI (løkke 2), residualdiagnostikk (løkke 3) og transformerte modeller (løkke 4). Hver løkke går teori \to eksempel \to oppgave. Vi trekker herdetidsdataene fra kap. 8.1 videre som en rød tråd.

Samlet kjernetid ≈ 60 min. Ta gjerne en pause mellom løkkene — pausepunktene er markert.

Løkke 1 — Test og konfidensintervall for helningen (~15 min)

Testobservatoren for helningen
Vi vil teste en påstand om det sanne stigningstallet, typisk H0:β=β0H_0:\beta=\beta_0 (ofte β0=0\beta_0=0). Siden β^\hat{\beta} er forventningsrett med Var(β^)=σ2/Sxx\text{Var}(\hat{\beta})=\sigma^2/S_{xx} og feilene er normalfordelte, er β^\hat{\beta} normalfordelt. Erstatter vi det ukjente σ\sigma med estimatet ss, får vi en testobservator som følger en tt-fordeling — nøyaktig samme mekanisme som t-testen for et gjennomsnitt i kap. 7.1, men med β^\hat{\beta}:

T=β^β0S/Sxx=β^β0SE(β^)  tn2under H0.T=\frac{\hat{\beta}-\beta_0}{S/\sqrt{S_{xx}}}=\frac{\hat{\beta}-\beta_0}{\text{SE}(\hat{\beta})}\ \sim\ t_{n-2}\quad\text{under }H_0.

Frihetsgraden er n2n-2 — samme antall som i variansestimatet s2s^2, fordi to parametre (α^,β^\hat{\alpha},\hat{\beta}) er estimert. Bruk tn1t_{n-1} her, og du mister poeng. Forkastingsregelen er den vanlige: ved tosidig test på nivå α\alpha forkaster vi H0H_0 hvis T>tn2,α/2|T|>t_{n-2,\alpha/2} (øvre haleareal α/2\alpha/2). En testobservator er bare tallet vi regner ut for å måle hvor langt estimatet ligger fra H0H_0-verdien, målt i antall standardfeil.

Konfidensintervall for helningen β\beta
Snur vi testobservatoren, får vi et konfidensintervall for β\beta på formen estimat ±\pm kvantil \cdot standardfeil (KI-formen fra kap. 6.1):

β^ ± tn2,α/2sSxx.\hat{\beta}\ \pm\ t_{n-2,\alpha/2}\cdot\frac{s}{\sqrt{S_{xx}}}.

Et 95%95\,\%-intervall bruker tn2,0,025t_{n-2,0{,}025}. Ligger 00 utenfor intervallet, forkaster vi H0:β=0H_0:\beta=05%5\,\%-nivå — test og intervall gir samme konklusjon. Intervallet blir smalt når standardfeilen er liten, altså når ss er liten (lite støy) og SxxS_{xx} stor (godt spredte xx-verdier).

✏️Eksempel 1: Har temperaturen forklaringskraft? (herdetid)

Bruk herdetidsdataene fra kap. 8.1: n=12n=12, β^=0,70\hat{\beta}=-0{,}70, Sxx=500S_{xx}=500, s=2,55s=2{,}55, altså SE(β^)=s/Sxx=0,114\text{SE}(\hat{\beta})=s/\sqrt{S_{xx}}=0{,}114. Test på 5%5\,\%-nivå om herdetiden avhenger av temperaturen (H0:β=0H_0:\beta=0 mot H1:β0H_1:\beta\neq0), og gi et 95%95\,\% konfidensintervall for β\beta.

Hypoteser: H0:β=0H_0:\beta=0 (temperaturen har ingen effekt) mot H1:β0H_1:\beta\neq0 (tosidig).

Testobservator (frihetsgrad n2=10n-2=10):
T=β^0SE(β^)=0,700,114=6,14.T=\frac{\hat{\beta}-0}{\text{SE}(\hat{\beta})}=\frac{-0{,}70}{0{,}114}=-6{,}14.

Kritisk verdi: t10,0,025=2,228t_{10,0{,}025}=2{,}228 (formelsamlingens tt-tabell). Siden 6,14=6,14>2,228|{-6{,}14}|=6{,}14>2{,}228, forkaster vi H0H_0. Temperaturen har klart forklaringskraft for herdetiden (p0,05p\ll0{,}05).

Konfidensintervall:
β^±t10,0,025SE(β^)=0,70±2,2280,114=0,70±0,254,\hat{\beta}\pm t_{10,0{,}025}\cdot\text{SE}(\hat{\beta})=-0{,}70\pm2{,}228\cdot0{,}114=-0{,}70\pm0{,}254,
altså (0,954, 0,446)(-0{,}954,\ -0{,}446). Null ligger utenfor — samme konklusjon som testen.

> Sensornotat: frihetsgrad n2=10n-2=10, ikke n1=11n-1=11. Konklusjonen skal stå i klartekst («temperaturen påvirker herdetiden»), ikke bare «forkast H0H_0».

📝Oppgave 1

(Innstegsoppgave.) I en regresjon med n=15n=15 er β^=2,4\hat{\beta}=2{,}4 og SE(β^)=0,6\text{SE}(\hat{\beta})=0{,}6.

a) Hvilken frihetsgrad har testobservatoren?

b) Regn ut testobservatoren for H0:β=0H_0:\beta=0.

c) Med kritisk verdi t13,0,025=2,160t_{13,0{,}025}=2{,}160: forkastes H0H_0?

— naturlig pausepunkt —

Løkke 2 — Prediksjon: konfidensintervall vs. prediksjonsintervall (~16 min)

Punktprediksjon og de to intervallene
Ved en gitt xx-verdi x0x_0 er punktprediksjonen verdien på den estimerte linja:

y^0=α^+β^x0.\hat{y}_0=\hat{\alpha}+\hat{\beta}x_0.

Men vi kan spørre om to forskjellige ting, og de har forskjellige intervaller:

1. Konfidensintervall (KI) for forventningen E(Y0)=α+βx0E(Y_0)=\alpha+\beta x_0 — «hvor ligger den gjennomsnittlige responsen ved x0x_0?». Usikkerheten kommer bare fra at α^,β^\hat{\alpha},\hat{\beta} er estimert:
y^0 ± tn2,α/2s1n+(x0xˉ)2Sxx.\hat{y}_0\ \pm\ t_{n-2,\alpha/2}\cdot s\sqrt{\frac{1}{n}+\frac{(x_0-\bar{x})^2}{S_{xx}}}.

2. Prediksjonsintervall (PI) for en NY observasjon Y0Y_0 — «hvor ligger neste enkeltmåling ved x0x_0?». Nå kommer det i tillegg et helt nytt feilledd ε0\varepsilon_0 med varians σ2\sigma^2, og det gir et ekstra 11-tall under rottegnet:
y^0 ± tn2,α/2s1+1n+(x0xˉ)2Sxx.\hat{y}_0\ \pm\ t_{n-2,\alpha/2}\cdot s\sqrt{1+\frac{1}{n}+\frac{(x_0-\bar{x})^2}{S_{xx}}}.

Hele forskjellen er 11-tallet (variansen til den nye målingens eget feilledd). PI er derfor alltid bredere enn KI ved samme x0x_0. Spør oppgaven om «en ny/framtidig måling», bruk PI; spør den om «forventet/gjennomsnittlig respons», bruk KI. Frihetsgraden er n2n-2 i begge.

Hvorfor presisjonen er størst i xˉ\bar{x} — og faren ved ekstrapolering

Leddet (x0xˉ)2Sxx\dfrac{(x_0-\bar{x})^2}{S_{xx}} er null når x0=xˉx_0=\bar{x} og vokser jo lengre x0x_0 ligger fra xˉ\bar{x}. Derfor er begge intervallene smalest midt i dataene (ved xˉ\bar{x}) og vider seg ut mot kantene — som et sammentrykt timeglass rundt linja. Intuitivt: en liten feil i helningen β^\hat{\beta} vipper linja rundt tyngdepunktet (xˉ,yˉ)(\bar{x},\bar{y}), så jo lengre ut du er, desto mer flytter prediksjonen seg.

Ekstrapolering er å predikere for en x0x_0 utenfor dataområdet. Da er (x0xˉ)2(x_0-\bar{x})^2 stor (bredt intervall), og — verre — vi har ingen data som bekrefter at den rette linja fortsatt gjelder der ute. Ekstrapolering skal alltid flagges eksplisitt som usikker; det er et fast poeng i tolkningsdelen (sjanger M).

✏️Eksempel 2: KI og PI ved 55 grader (herdetid)

Fortsatt herdetidsdataene: y^=1150,70x\hat{y}=115-0{,}70x, n=12n=12, xˉ=50\bar{x}=50, Sxx=500S_{xx}=500, s=2,55s=2{,}55, t10,0,025=2,228t_{10,0{,}025}=2{,}228. Ved x0=55x_0=55 grader: (a) gi et 95%95\,\% KI for den forventede herdetiden, (b) et 95%95\,\% PI for herdetiden til én ny måling, og (c) forklar hvorfor PI er bredere enn ved x0=50x_0=50.

Punktprediksjon: y^0=1150,7055=11538,5=76,5\hat{y}_0=115-0{,}70\cdot55=115-38{,}5=76{,}5 minutter.

a) KI for forventningen E(Y0)E(Y_0). Regn faktoren under rottegnet:
1n+(x0xˉ)2Sxx=112+(5550)2500=0,0833+0,0500=0,1333,0,1333=0,3652.\frac{1}{n}+\frac{(x_0-\bar{x})^2}{S_{xx}}=\frac{1}{12}+\frac{(55-50)^2}{500}=0{,}0833+0{,}0500=0{,}1333,\quad\sqrt{0{,}1333}=0{,}3652.
Halvbredde =2,2282,550,3652=2,07=2{,}228\cdot2{,}55\cdot0{,}3652=2{,}07, så
KI=76,5±2,07=(74,43, 78,57).\text{KI}=76{,}5\pm2{,}07=(74{,}43,\ 78{,}57).

b) PI for ny observasjon. Samme, men med 11-tallet:
1+0,1333=1,1333=1,0646,2,2282,551,0646=6,05,\sqrt{1+0{,}1333}=\sqrt{1{,}1333}=1{,}0646,\quad 2{,}228\cdot2{,}55\cdot1{,}0646=6{,}05,
PI=76,5±6,05=(70,45, 82,55).\text{PI}=76{,}5\pm6{,}05=(70{,}45,\ 82{,}55).
PI er mye bredere enn KI — den nye målingens eget feilledd dominerer.

c) Ved x0=50=xˉx_0=50=\bar{x} er (x0xˉ)2=0(x_0-\bar{x})^2=0, så faktoren er 1+1/12=1,041\sqrt{1+1/12}=1{,}041; ved x0=55x_0=55 er den 1,0651{,}065. Avstanden x0xˉ=5|x_0-\bar{x}|=5 løfter faktoren, så intervallet blir bredere jo lengre fra xˉ\bar{x} vi predikerer.

> Sensornotat: «ny måling» \Rightarrow PI (med 11-tallet). Skriver du KI der, får du et intervall som er altfor smalt for en enkeltmåling — den vanligste fella i prediksjonsdelen.

📝Oppgave 2

En bedrift modellerer strømforbruk YY (kWh) mot utetemperatur xx (grader) og finner y^=2103,0x\hat{y}=210-3{,}0x, n=20n=20, xˉ=8\bar{x}=8, Sxx=800S_{xx}=800, s=6,0s=6{,}0, t18,0,025=2,101t_{18,0{,}025}=2{,}101.

a) Gi punktprediksjonen ved x0=2x_0=2 grader.

b) Gi et 95%95\,\% prediksjonsintervall for strømforbruket en enkelt kald dag med x0=2x_0=2.

c) Ville et konfidensintervall for forventningen ved x0=2x_0=2 vært smalere eller bredere? Begrunn i én setning.

— naturlig pausepunkt —

Løkke 3 — Residualdiagnostikk: passer modellen? (~16 min)

Residualplottet og hva mønstrene betyr

Modellen hviler på tre antagelser (kap. 8.1): uavhengige feil, konstant varians og normalfordelte feil. Vi sjekker dem grafisk ved å plotte residualene ei=yiy^ie_i=y_i-\hat{y}_i — og mønsteret forteller hvilken antagelse som eventuelt svikter:

- Residual mot xx (eller mot prediksjon y^i\hat{y}_i): skal se ut som en strukturløs sky rundt null. Da er alt bra.
- Traktform (spredningen vokser eller krymper systematisk): konstant varians brytes (heteroskedastisitet). Feilene er større for noen xx-verdier enn andre.
- Bueform (residualene er systematisk positive i midten og negative i endene, eller omvendt): et krumningsledd mangler — sammenhengen er ikke rett, en x2x^2-term eller en transformasjon trengs.
- Q-Q-plott av residualene (residualene mot normalkvantiler): skal ligge på en rett linje. Systematisk krumning eller tunge haler bryter normalitetsantagelsen.

Regelen sensor vil se: aldri «residualene ser fine ut» uten begrunnelse — pek på mønsteret (eller fraværet av mønster) og koble det til en konkret antagelse.

✏️Eksempel 3: Les residualplottet

I en regresjon av bruddstyrke mot herdetemperatur plottes residualene mot predikert verdi. Punktene ligger tett samlet for lave prediksjoner, men sprer seg stadig mer utover for høye prediksjoner (som en trakt som åpner mot høyre). Hvilken antagelse rammes, og hva bør du gjøre?

Diagnose: spredningen i residualene vokser systematisk med predikert verdi — en tydelig traktform. Det bryter antagelsen om konstant varians (homoskedastisitet): Var(εi)\text{Var}(\varepsilon_i) er ikke den samme for alle xix_i, men øker.

Konsekvens: LS-estimatene er fortsatt forventningsrette, men standardfeilene (og dermed KI, PI og testene) er upålitelige — de undervurderer usikkerheten der variansen er stor.

Tiltak: en variansstabiliserende transformasjon av responsen (f.eks. lnY\ln Y eller Y\sqrt{Y}), eller vektet regresjon. Etter transformasjon plotter man residualene på nytt for å sjekke at trakten er borte.

> Sensornotat: det holder ikke å si «trakt». Du må navngi antagelsen (konstant varians) og si hva du gjør (transformere/vekte). Det er der poengene sitter.

📝Oppgave 3

For hver av de tre residualplottene under, si hvilken antagelse (om noen) som rammes, og begrunn kort:

a) Residualene ligger som en jevn, strukturløs sky rundt null med samme spredning overalt.

b) Residualene er positive i midten av xx-området og negative i begge ender, i en tydelig bue.

c) Et Q-Q-plott av residualene krummer tydelig av fra den rette linja i begge haler.

— naturlig pausepunkt —

Løkke 4 — Transformerte modeller: fortsatt lineær regresjon (~13 min)

Transformerte modeller — «lineær i parametrene»

Mange sammenhenger som ser ikke-lineære ut, kan skrives som lineære i parametrene og løses med det vanlige LS-apparatet. Det avgjørende er ikke at xx inngår lineært, men at α\alpha og β\beta gjør det:

- Ln-lineær modell: lnY=α+βx+ε\ln Y=\alpha+\beta x+\varepsilon. Vi kjører regresjon med zi=lnyiz_i=\ln y_i som respons. Da gjelder alt fra dette kapitlet for zz-skalaen.
- Polynomledd: Y=α+βx+γx2+εY=\alpha+\beta x+\gamma x^2+\varepsilon — legg til x2x^2 som en ekstra «forklaringsvariabel» (fikser bueform, jf. løkke 3).
- Periodiske ledd: Y=α+βcos(x)+εY=\alpha+\beta\cos(x)+\varepsilon — bruk cos(x)\cos(x) som forklaringsvariabel.

Tilbaketransformasjon i ln-modellen (viktig!): regn KI/PI på z=lnyz=\ln y-skalaen først, og transformer så endepunktene tilbake med exp\exp. Fordi exp\exp er monotont voksende, bevares rekkefølgen: er [L,U][L,U] et 95%95\,\%-intervall for lnY0\ln Y_0, er [eL, eU][e^{L},\ e^{U}] et 95%95\,\%-intervall for Y0Y_0. Glem aldri å transformere tilbake — svaret skal være i den opprinnelige enheten.

✏️Eksempel 4: Ln-lineær nedbrytning (koffein)

Koffeinkonsentrasjonen CC i blodet avtar tilnærmet eksponentielt, så vi modellerer lnC=α+βt+ε\ln C=\alpha+\beta t+\varepsilon (tt i timer). Regresjon på z=lnCz=\ln C gir α^=4,6\hat{\alpha}=4{,}6 og β^=0,20\hat{\beta}=-0{,}20. Ved t0=10t_0=10 timer er et 95%95\,\% prediksjonsintervall for lnC0\ln C_0 funnet til (1,85, 3,35)(1{,}85,\ 3{,}35). Gi punktprediksjonen og prediksjonsintervallet for selve konsentrasjonen C0C_0.

Punktprediksjon på ln-skala: z^0=α^+β^t0=4,60,2010=2,6\hat{z}_0=\hat{\alpha}+\hat{\beta}t_0=4{,}6-0{,}20\cdot10=2{,}6.

Tilbake til konsentrasjon: C^0=e2,6=13,5\hat{C}_0=e^{2{,}6}=13{,}5 (samme enhet som CC).

Prediksjonsintervall. Transformer endepunktene med exp\exp (monotont voksende, så rekkefølgen bevares):
PI for C0=(e1,85, e3,35)=(6,4, 28,5).\text{PI for }C_0=\big(e^{1{,}85},\ e^{3{,}35}\big)=(6{,}4,\ 28{,}5).

Legg merke til at intervallet er usymmetrisk rundt 13,513{,}5 — det er normalt etter tilbaketransformasjon, og helt riktig.

> Sensornotat: det store poenget er å transformere tilbake med exp\exp til slutt. Lar du svaret stå på ln\ln-skala, er oppgaven ikke besvart.

📝Oppgave 4

En bakteriekultur vokser slik at antallet NN modelleres med lnN=α+βt+ε\ln N=\alpha+\beta t+\varepsilon (tt i timer). Regresjon på z=lnNz=\ln N gir α^=2,0\hat{\alpha}=2{,}0, β^=0,35\hat{\beta}=0{,}35.

a) Gi punktprediksjonen for antallet NN ved t0=8t_0=8 timer.

b) Et 95%95\,\% KI for forventningen E(lnN0)E(\ln N_0) ved t0=8t_0=8 er (4,6, 5,0)(4{,}6,\ 5{,}0). Gi tilsvarende KI for den forventede NN-skalaen.

c) Forklar i én setning hvorfor vi kan transformere endepunktene direkte.

Begrepsbank

De sentrale formlene og resultatkortene i kapitlet, samlet.

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet.

Formelkort: testobservatoren for β\beta

Testobservator T=β^β0s/Sxx=β^β0SE(β^)tn2T=\dfrac{\hat{\beta}-\beta_0}{s/\sqrt{S_{xx}}}=\dfrac{\hat{\beta}-\beta_0}{\text{SE}(\hat{\beta})}\sim t_{n-2} under H0:β=β0H_0:\beta=\beta_0. Frihetsgrad n2n-2 (som i s2s^2). Tosidig forkasting: T>tn2,α/2|T|>t_{n-2,\alpha/2}.

Formelkort: KI for helningen
95%95\,\% KI for β\beta: β^±tn2,0,025sSxx\hat{\beta}\pm t_{n-2,0{,}025}\cdot\dfrac{s}{\sqrt{S_{xx}}}. Ligger 00 utenfor intervallet, forkastes H0:β=0H_0:\beta=05%5\,\%-nivå — test og KI gir samme svar.
Begrep: test for β=0\beta=0

Å teste H0:β=0H_0:\beta=0 er å spørre «har xx forklaringskraft for YY?». Forkastes H0H_0, er sammenhengen statistisk sikker. Aksepteres den, er det ingen påvist lineær effekt av xx.

Formelkort: punktprediksjon

Punktprediksjonen ved x0x_0 er y^0=α^+β^x0\hat{y}_0=\hat{\alpha}+\hat{\beta}x_0 — verdien på den estimerte linja. Den er felles startpunkt for både KI og PI.

Formelkort: KI for forventningen E(Y0)E(Y_0)
y^0±tn2,α/2s1n+(x0xˉ)2Sxx\hat{y}_0\pm t_{n-2,\alpha/2}\,s\sqrt{\dfrac{1}{n}+\dfrac{(x_0-\bar{x})^2}{S_{xx}}}. Gjelder den gjennomsnittlige responsen ved x0x_0; usikkerhet bare fra estimerte α^,β^\hat{\alpha},\hat{\beta}.
Formelkort: PI for en ny observasjon
y^0±tn2,α/2s1+1n+(x0xˉ)2Sxx\hat{y}_0\pm t_{n-2,\alpha/2}\,s\sqrt{1+\dfrac{1}{n}+\dfrac{(x_0-\bar{x})^2}{S_{xx}}}. Gjelder én ny måling ved x0x_0; det ekstra 11-tallet er den nye målingens eget feilledd.
Begrep: KI vs. PI — forskjellen

Eneste forskjell er 11-tallet under rottegnet: PI har det, KI ikke. PI er derfor alltid bredere. «Forventet respons» \to KI; «ny/framtidig måling» \to PI.

Begrep: presisjon størst i xˉ\bar{x}

Leddet (x0xˉ)2/Sxx(x_0-\bar{x})^2/S_{xx} er null ved x0=xˉx_0=\bar{x} og vokser utover. Derfor er både KI og PI smalest midt i dataene og vider seg mot kantene — som et timeglass rundt linja.

Begrep: ekstrapolering

Prediksjon for x0x_0 utenfor dataområdet. Da er intervallet bredt og linjeformen ubekreftet der ute. Skal alltid flagges eksplisitt som usikker.

Begrep: residualplott

Plott av residualene ei=yiy^ie_i=y_i-\hat{y}_i mot xx eller mot prediksjon y^i\hat{y}_i. Brukes til å sjekke modellantagelsene grafisk. Sunt bilde: strukturløs sky rundt null.

Begrep: traktform = heteroskedastisitet

Systematisk voksende (eller krympende) spredning i residualene bryter antagelsen om konstant varians. Tiltak: variansstabiliserende transformasjon (lnY\ln Y, Y\sqrt{Y}) eller vektet regresjon.

Begrep: bueform = manglende krumningsledd

Residualer systematisk positive i midten og negative i endene (eller omvendt) betyr at en rett linje er feil middelverdistruktur. Legg til x2x^2-ledd eller transformer.

Begrep: Q-Q-plott av residualer

Residualer mot normalkvantiler; skal ligge på en rett linje. Krumning eller tunge haler bryter normalitetsantagelsen, som test og intervaller hviler på.

Teknikkort: ln-lineær modell
lnY=α+βx+ε\ln Y=\alpha+\beta x+\varepsilon: kjør regresjon med z=lnyz=\ln y. Regn KI/PI på zz-skala, transformer endepunktene tilbake med exp\exp. Fordi exp\exp er monotont voksende, bevares dekningsgraden. Resultatet blir usymmetrisk — helt normalt.
Begrep: lineær i parametrene

Modeller som α+βx+γx2\alpha+\beta x+\gamma x^2 eller α+βcos(x)\alpha+\beta\cos(x) er lineære i parametrene α,β,γ\alpha,\beta,\gamma og løses med vanlig LS ved å bruke x2x^2, cos(x)\cos(x) osv. som ekstra forklaringsvariabler.

Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver
Symbol- og formelliste

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Norges teknisk-naturvitenskapelige universitet. Dette er ikke offisielt studiemateriell. Les mer.