Tilbake
3.2

3.2 Å lese R-utskrift (lm-sammendraget)

Hver kolonne og linje i et lm-sammendrag: Estimate, Std. Error, t value, Pr(>|t|), Residual standard error, Multiple/Adjusted R-squared og F-statistic — hva de betyr og hvordan de brukes til inferens uten å regne alt selv.

45 min
9 oppgaver
Å lese R-utskrift (lm-sammendraget)
Din fremgang i kapitlet
0 / 9 oppgaver
Forkunnskaper: Alt i utskriften er størrelser fra kap. 3.1: Estimate er β^j\hat\beta_j, Std. Error er se(β^j)se(\hat\beta_j), t value er observatoren β^j/se(β^j)\hat\beta_j/se(\hat\beta_j), og «Residual standard error» er S=SSE/(nk1)S=\sqrt{\text{SSE}/(n-k-1)}. t-testen og konfidensintervallet er de samme som i kap. 3.1 og hviler på t-fordelingen fra kap. 2.1–2.2.

Multippel regresjon (flere prediktorer, «Adjusted R-squared», frihetsgraden nk1n-k-1) tas fullt ut i kap. 3.3 — her trenger du bare å lese tallene av.

På eksamen får du sjelden rådata og en kalkulator til en full regresjon — du får en R-utskrift og skal tolke den. Utskriften er en kompakt tabell som inneholder alt du trenger: koeffisientene, standardfeilene deres, t-verdiene, P-verdiene, spredningen rundt modellen, frihetsgradene, R2R^2 og en samlet F-test.

Målet med kapitlet er at du kan peke på hvert tall og si nøyaktig hva det er og hva det brukes til — og at du unngår de tre klassiske lesefeilene: forveksle Std. Error med t value, mistolke Pr(>|t|), og tro at en ikke-signifikant koeffisient er uviktig.

Vi går gjennom utskriften linje for linje, med tre fullstendige eksempler (enkel + to multiple).

Løkke 1 — Coefficients-tabellen (~15 min)

lm-sammendraget (summary)
R-utskriften vi tolker er summary-sammendraget av en tilpasset regresjon. Den har tre deler: (1) en Coefficients-tabell med én rad per koeffisient og fire kolonner (Estimate, Std. Error, t value, Pr(>|t|)), (2) en linje med Residual standard error og frihetsgrader, og (3) en linje med Multiple/Adjusted R-squared og en F-statistic. Vi leser tallene av — vi skriver ingen kode.
Coefficients-tabellen
Hjertet i utskriften: én rad per koeffisient i modellen. Første rad er (Intercept) (β^0\hat\beta_0), deretter én rad per forklaringsvariabel (β^1,β^2,\hat\beta_1,\hat\beta_2,\dots). De fire kolonnene er, i rekkefølge: estimatet, standardfeilen, t-verdien og den tosidige P-verdien for at nettopp den koeffisienten er null.
Estimate-kolonnen
Estimate er punktestimatet β^j\hat\beta_j — den tilpassede koeffisienten. For (Intercept) er det β^0\hat\beta_0 (skjæringen); for en forklaringsvariabel er det stigningstallet, dvs. forventet endring i responsen per enhet av den variabelen (med de øvrige holdt konstant, i multippel regresjon). Dette er tallet du tolker i kontekst.
Std. Error-kolonnen
Std. Error er standardfeilen se(β^j)se(\hat\beta_j) — den estimerte spredningen til koeffisienten. Den forteller hvor presist koeffisienten er bestemt, og den er byggeklossen i både t-verdien (kolonnen ved siden av) og konfidensintervallet (β^j±tse\hat\beta_j\pm t\cdot se). Ikke forveksle denne kolonnen med t value — det er den vanligste lesefeilen (§5.14).
t value-kolonnen
t value er testobservatoren for H0:βj=0H_0:\beta_j=0:
t value=EstimateStd. Error=β^jse(β^j).\texttt{t value}=\frac{\texttt{Estimate}}{\texttt{Std. Error}}=\frac{\hat\beta_j}{se(\hat\beta_j)}.
Den er tnk1t_{n-k-1}-fordelt under H0H_0. Du kan alltid verifisere kolonnen selv ved å dele EstimateStd. Error — en rask kryssjekk sensor liker å se.
Pr(>|t|)-kolonnen (P-verdien)
Pr(>|t|) er den tosidige P-verdien for H0:βj=0H_0:\beta_j=0 — sannsynligheten under H0H_0 for et minst like ekstremt utfall som det observerte. Liten P-verdi (<α<\alpha) betyr at koeffisienten er signifikant forskjellig fra null. Stjernene bak (***, **, *) er signifikanskoder. Pr(>|t|) er IKKE «sannsynligheten for at βj=0\beta_j=0» — hypotesen er ikke stokastisk (§5.14).
Signifikanskodene (stjernene)
Symbolene bak P-verdien markerer signifikansnivået: *** betyr P<0,001P<0{,}001, ** betyr P<0,01P<0{,}01, * betyr P<0,05P<0{,}05, . betyr P<0,1P<0{,}1, og blank betyr P0,1P\ge 0{,}1. De er en rask visuell guide, men du bør alltid lese selve P-verdien og sammenligne med det nivået oppgaven ber om (ofte 5 %).
✏️Eksempel 1: Enkel regresjon fra utskrift (sjanger H)

En regresjon av eksamenspoeng (yy) på antall studietimer (xx) for n=10n=10 studenter gir sammendraget under. Bruk t8,0,025=2,306t_{8,\,0{,}025}=2{,}306.

Coefficients:
             Estimate  Std. Error  t value  Pr(>|t|)
(Intercept)   44.8000      2.8230   15.870  2.49e-07 ***
studietimer    2.1545      0.2275    9.471  1.27e-05 ***
---
Residual standard error: 4.132 on 8 degrees of freedom
Multiple R-squared:  0.9181,   Adjusted R-squared:  0.9079
F-statistic: 89.70 on 1 and 8 DF,  p-value: 1.27e-05

a) Angi β^1\hat\beta_1 (studietimer-effekten) og standardfeilen.
b) Verifiser t value for studietimer.
c) Er stigningstallet signifikant på 5 %-nivå?
d) Gi et 95 %-KI for β1\beta_1.
e) Hva er σ^\hat\sigma, og hvor mange frihetsgrader?

a) β^1=2,1545\hat\beta_1=2{,}1545 (poeng per studietime), se(β^1)=0,2275se(\hat\beta_1)=0{,}2275.

b) t value =β^1/se=2,1545/0,2275=9,47=\hat\beta_1/se=2{,}1545/0{,}2275=9{,}47 — stemmer med utskriften.

c) Ja. Pr(>|t|) =1,27105<0,05=1{,}27\cdot 10^{-5}<0{,}05 (og t=9,47>2,306|t|=9{,}47>2{,}306), så β1\beta_1 er klart signifikant forskjellig fra 0.

d) KI =β^1±t8,0,025se=2,1545±2,3060,2275=2,1545±0,525=[1,63, 2,68]=\hat\beta_1\pm t_{8,\,0{,}025}\,se=2{,}1545\pm 2{,}306\cdot 0{,}2275=2{,}1545\pm 0{,}525=[1{,}63,\ 2{,}68].

e) σ^=\hat\sigma= «Residual standard error» =4,133=4{,}133, på n2=8n-2=8 frihetsgrader (leses rett av linja).

📝Oppgave 1

Bruk utskriften i eksempel 1.

a) Hva er den estimerte skjæringen β^0\hat\beta_0, og hva er standardfeilen?
b) Regn ut t value for (Intercept) og sjekk mot utskriften.

Løkke 2 — Residual SE, R² og F-statistikken (~15 min)

Residual standard error
«Residual standard error» er σ^=S\hat\sigma=S — den estimerte spredningen til feilleddene:
σ^=SSEnk1.\hat\sigma=\sqrt{\frac{\text{SSE}}{n-k-1}}.
Linja oppgir også «on \ldots degrees of freedom», som er nk1n-k-1 (kk = antall forklaringsvariabler). Fra denne linja henter du både σ^\hat\sigma og frihetsgraden du trenger til t-kvantilen i et konfidensintervall.
Frihetsgradene i utskriften
«on dd degrees of freedom» oppgir residualfrihetsgraden d=nk1d=n-k-1. For enkel regresjon (k=1k=1) er d=n2d=n-2; for multippel med kk prediktorer er d=nk1d=n-k-1. Du kan lese antall observasjoner baklengs: n=d+k+1n=d+k+1. Bruk nøyaktig denne frihetsgraden når du slår opp t-kvantilen til et KI (§4.6).
Multiple R-squared
«Multiple R-squared» er R2=1SSE/SSTR^2=1-\text{SSE}/\text{SST} — andelen av variasjonen i responsen som modellen forklarer. I enkel regresjon er den kvadratet av korrelasjonen mellom xx og yy. Den øker (eller står stille) hver gang en variabel legges til, så den egner seg ikke til å sammenligne modeller med ulikt antall prediktorer — bruk «Adjusted R-squared» til det.
Adjusted R-squared
«Adjusted R-squared» er den justerte R2R^2-en, som straffer for antall prediktorer:
Rjust2=1SSE/(nk1)SST/(n1).R^2_{\text{just}}=1-\frac{\text{SSE}/(n-k-1)}{\text{SST}/(n-1)}.
Den kan synke hvis en tilføyd variabel ikke forklarer nok. Derfor er det denne — ikke «Multiple R-squared» — du bruker til å velge mellom modeller (mer i kap. 3.3).
F-statistic (samlet test)
«F-statistic» tester om modellen som helhet forklarer noe: H0:β1==βk=0H_0:\beta_1=\cdots=\beta_k=0 (alle helninger null) mot at minst én er ulik null. Linja oppgir «FF on kk and nk1n-k-1 DF» og en samlet p-value. Liten samlet P-verdi betyr at minst én prediktor bidrar. I enkel regresjon er F=(t value)2F=(\texttt{t value})^2 for stigningstallet, og den samlede P-verdien er lik Pr(>|t|) for stigningstallet.
✏️Eksempel 2: Multippel regresjon fra utskrift (sjanger I)

Boligpris (yy, i 1000 kr) er regressert på areal (x1x_1, m²) og alder (x2x_2, år) for n=12n=12 boliger. Bruk t9,0,025=2,262t_{9,\,0{,}025}=2{,}262.

Coefficients:
             Estimate  Std. Error  t value  Pr(>|t|)
(Intercept)  480.136     102.198     4.698  0.00112 ** 
areal         22.305       0.863    25.833  9.4e-10 ***
alder         -8.058       1.672    -4.818  0.00095 ***
---
Residual standard error: 35.34 on 9 degrees of freedom
Multiple R-squared:  0.9974,   Adjusted R-squared:  0.9968
F-statistic: 1735 on 2 and 9 DF,  p-value: 2.3e-12

a) Tolk koeffisienten for areal i kontekst.
b) Er alder signifikant på 5 %-nivå?
c) Gi et 95 %-KI for areal-koeffisienten.
d) Hvor mange frihetsgrader har residualene, og hva er nn?
e) Hva sier F-statistikken?

a) β^1=22,305\hat\beta_1=22{,}305: med alder holdt konstant er én ekstra m² assosiert med om lag 22 300 kr høyere forventet pris.

b) Ja. For alder er Pr(>|t|) =0,00095<0,05=0{,}00095<0{,}05 (og t=4,818>2,262|t|=4{,}818>2{,}262), så alder er signifikant. β^2=8,058\hat\beta_2=-8{,}058: med areal holdt konstant faller forventet pris ca. 8 000 kr per år eldre.

c) KI =22,305±2,2620,863=22,305±1,952=[20,35, 24,26]=22{,}305\pm 2{,}262\cdot 0{,}863=22{,}305\pm 1{,}952=[20{,}35,\ 24{,}26].

d) Residualene har nk1=9n-k-1=9 frihetsgrader med k=2k=2 prediktorer, så n=9+2+1=12n=9+2+1=12.

e) F=1735F=1735 på 2 og 9 frihetsgrader med samlet P-verdi 2,31012\approx 2{,}3\cdot 10^{-12}: modellen som helhet forklarer klart mer enn ren tilfeldighet — minst én av areal/alder bidrar.

📝Oppgave 2

Bruk den multiple utskriften i eksempel 2.

a) Verifiser t value for alder (== Estimate/Std. Error).
b) Hva er σ^\hat\sigma?
c) Hvorfor er «Adjusted R-squared» (0,9968) litt lavere enn «Multiple R-squared» (0,9974)?

Løkke 3 — Bruk utskriften: KI, signifikans og betinget tolkning (~15 min)

Konfidensintervall fra utskriften
Et (1α)(1-\alpha)-KI for en koeffisient bygges rett fra to kolonner:
Estimate±tnk1,α/2Std. Error.\texttt{Estimate}\pm t_{n-k-1,\,\alpha/2}\cdot\texttt{Std. Error}.
Du henter Estimate og Std. Error fra koeffisientraden, og frihetsgraden nk1n-k-1 fra «Residual standard error»-linja. Kvantilen tnk1,α/2t_{n-k-1,\,\alpha/2} slås opp i formelsamlingen (eller er oppgitt).
Signifikans fra Pr(>|t|)
En koeffisient er signifikant på nivå α\alpha hvis Pr(>|t|) <α<\alpha. Tilsvarende: hvis 00 ligger utenfor det (1α)(1-\alpha)-KI-et (dualiteten). For 5 %-nivå betyr Pr(>|t|) <0,05<0{,}05 at variabelen har en påvisbar effekt gitt de øvrige i modellen.
Betinget tolkning (ikke-signifikant ≠ uviktig)
Hver P-verdi i utskriften er betinget på de øvrige variablene i modellen. En stor Pr(>|t|) betyr «denne variabelen bidrar ikke utover det de andre allerede fanger» — ikke at variabelen er uviktig i seg selv. Legges en korrelert variabel til eller fjernes, kan både estimatet og P-verdien endre seg. Å lese en ikke-signifikant koeffisient som «uviktig» uten dette forbeholdet er en klassisk feil (§5.14).
✏️Eksempel 3: En ikke-signifikant koeffisient (betinget tolkning)

En respons yy er regressert på x1x_1 og x2x_2 for n=12n=12 enheter. Utskriften er:

Coefficients:
             Estimate  Std. Error  t value  Pr(>|t|)
(Intercept)   19.829       5.285    3.752   0.00460 ** 
x1             3.500       0.460    7.602   3.3e-05 ***
x2            -0.411       0.489   -0.840   0.42300    
---
Residual standard error: 4.486 on 9 degrees of freedom
Multiple R-squared:  0.9168,   Adjusted R-squared:  0.8984
F-statistic: 49.6 on 2 and 9 DF,  p-value: 1.4e-05

a) Er x2x_2 signifikant på 5 %-nivå?
b) Kan vi konkludere at x2x_2 er «uviktig» for yy?
c) Hva forteller den samlede F-testen?

a) Nei. For x2x_2 er Pr(>|t|) =0,423>0,05=0{,}423>0{,}05 (og t=0,84|t|=0{,}84 er langt under en kritisk verdi rundt 2,26). Vi kan ikke forkaste H0:β2=0H_0:\beta_2=0.

b) Ikke uten forbehold. P-verdien er betinget på at x1x_1 allerede er i modellen. Den sier at x2x_2 ikke bidrar utover det x1x_1 fanger — ofte fordi x1x_1 og x2x_2 er korrelerte. x2x_2 kan godt henge sammen med yy alene; testen gjelder tilleggseffekten gitt x1x_1.

c) F=49,6F=49{,}6 på 2 og 9 frihetsgrader, samlet P-verdi 1,41051{,}4\cdot 10^{-5}: modellen som helhet forklarer klart noe — drevet av den sterkt signifikante x1x_1 (***), ikke av x2x_2.

📝Oppgave 3

Bruk utskriften i eksempel 3. t9,0,025=2,262t_{9,\,0{,}025}=2{,}262.

a) Gi et 95 %-KI for koeffisienten til x1x_1.
b) Bruk dualiteten til å bekrefte at x1x_1 er signifikant, men x2x_2 ikke er det.

📝Oppgave 4

En medstudent ser på utskriften i eksempel 2 og sier: «Pr(>|t|) for areal er 9,410109{,}4\cdot 10^{-10}, altså er det bare 0,00000009 % sannsynlig at areal-koeffisienten er null.»

a) Hva er galt med formuleringen?
b) Gi den korrekte tolkningen av P-verdien.

📝Oppgave 5

(Delvis utfylt utskrift.) I en enkel regresjon (n=15n=15) er Estimate for stigningstallet 0,840{,}84 og Std. Error 0,300{,}30. t value og Pr(>|t|) er visket bort.

a) Regn ut t value.
b) Med t13,0,025=2,160t_{13,\,0{,}025}=2{,}160: er stigningstallet signifikant på 5 %-nivå?
c) Gi et 95 %-KI for stigningstallet.

Begrepsbank

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet. Korte, navngitte definisjoner for eksamensrepetisjon.
(Intercept)-raden

Første rad i Coefficients-tabellen, med estimatet for konstantleddet β^0\hat\beta_0. Tolkes som forventet respons når alle forklaringsvariabler er null — meningsfullt bare hvis det punktet ligger i/nær dataområdet.

Verifisere t value-kolonnen

En rask kryssjekk: t value skal være Estimate delt på Std. Error. Stemmer det ikke, har du lest feil kolonne. Sensor liker å se denne kontrollen.

Hente σ̂ fra utskriften
σ^\hat\sigma leses direkte som «Residual standard error»-tallet; frihetsgraden nk1n-k-1 står på samme linje («on \ldots degrees of freedom»). Begge trengs til KI og prediksjon.
F-test mot t-test

t-testene i Coefficients-tabellen tester én koeffisient om gangen; F-statistikken tester alle helningene samlet (H0:β1==βk=0H_0:\beta_1=\cdots=\beta_k=0). I enkel regresjon er F=(t value)2F=(\texttt{t value})^2 og de gir samme P-verdi.

Residualene i utskriften
summary viser ofte en «Residuals»-oppsummering (min, 1Q, median, 3Q, max) over toppen. Grovt symmetriske residualer med median nær 0 er et første tegn på at modellantakelsene holder; detaljert sjekk gjøres med residualplott (kap. 3.4).
Antall prediktorer k fra df

Residualfrihetsgraden er nk1n-k-1. Kjenner du nn, er k=n1dfk=n-1-\text{df}; kjenner du kk, er n=df+k+1n=\text{df}+k+1. Nyttig når oppgaven ikke oppgir nn eksplisitt.

Samlet P-verdi (F-linja)

P-verdien på F-statistic-linja hører til den samlede testen H0:H_0: alle helninger =0=0. Liten samlet P-verdi betyr at modellen forklarer mer enn tilfeldig — men sier ikke hvilke enkeltvariabler som bidrar (det gjør t-testene).

Feil: Std. Error tatt for t value

Den hyppigste lesefeilen. Std. Error er en spredning (samme enhet som koeffisienten); t value er et enhetsløst forhold ofte >2>2 ved signifikans. Del EstimateStd. Error for å skille dem.

P-verdi-mistolkning (utskrift)
Pr(>|t|) er IKKE sannsynligheten for at koeffisienten er null. Den er sannsynligheten under H0:βj=0H_0:\beta_j=0 for en minst like ekstrem t-verdi. Koeffisienten er fast, ikke stokastisk.
Kolonnerekkefølgen

Fra venstre: Estimate (β^j\hat\beta_j) → Std. Error (sese) → t value (β^j/se\hat\beta_j/se) → Pr(>|t|) (tosidig P-verdi). Å huske rekkefølgen hindrer kolonneforveksling.

Symbol- og formelliste
Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.