3.2 Å lese R-utskrift (lm-sammendraget)
Hver kolonne og linje i et lm-sammendrag: Estimate, Std. Error, t value, Pr(>|t|), Residual standard error, Multiple/Adjusted R-squared og F-statistic — hva de betyr og hvordan de brukes til inferens uten å regne alt selv.
summary-sammendraget av en regresjon) forekommer i omtrent 15 av 22 sett (68 %) — nesten alltid som del av Oppgave 3. Dette er den motsatte ferdigheten av forgjengeremnet STK1100, som drillet Python-koding: her skriver du ingen kode — du tolker en ferdig utskrift.- Du skal kjenne igjen hver kolonne: Estimate, Std. Error, t value, Pr(>|t|).
- Du skal hente og frihetsgradene fra «Residual standard error»-linja.
- Du skal bygge et konfidensintervall fra Estimate Std. Error, og lese signifikans fra Pr(>|t|).
Sensorkrav (§4.10): vit nøyaktig hvilken kolonne som er hva, og at en ikke-signifikant koeffisient ikke betyr «uviktig» — testen er betinget på de øvrige variablene. Prioritet: må sitte perfekt.
Tidsbruk: ~45 min. Ingen tunge utledninger — dette er ren utskriftslesing, men presisjonen teller.
Estimate er , Std. Error er , t value er observatoren , og «Residual standard error» er . t-testen og konfidensintervallet er de samme som i kap. 3.1 og hviler på t-fordelingen fra kap. 2.1–2.2.Multippel regresjon (flere prediktorer, «Adjusted R-squared», frihetsgraden ) tas fullt ut i kap. 3.3 — her trenger du bare å lese tallene av.
På eksamen får du sjelden rådata og en kalkulator til en full regresjon — du får en R-utskrift og skal tolke den. Utskriften er en kompakt tabell som inneholder alt du trenger: koeffisientene, standardfeilene deres, t-verdiene, P-verdiene, spredningen rundt modellen, frihetsgradene, og en samlet F-test.
Målet med kapitlet er at du kan peke på hvert tall og si nøyaktig hva det er og hva det brukes til — og at du unngår de tre klassiske lesefeilene: forveksle Std. Error med t value, mistolke Pr(>|t|), og tro at en ikke-signifikant koeffisient er uviktig.
Vi går gjennom utskriften linje for linje, med tre fullstendige eksempler (enkel + to multiple).
Løkke 1 — Coefficients-tabellen (~15 min)
summary-sammendraget av en tilpasset regresjon. Den har tre deler: (1) en Coefficients-tabell med én rad per koeffisient og fire kolonner (Estimate, Std. Error, t value, Pr(>|t|)), (2) en linje med Residual standard error og frihetsgrader, og (3) en linje med Multiple/Adjusted R-squared og en F-statistic. Vi leser tallene av — vi skriver ingen kode.(Intercept) (), deretter én rad per forklaringsvariabel (). De fire kolonnene er, i rekkefølge: estimatet, standardfeilen, t-verdien og den tosidige P-verdien for at nettopp den koeffisienten er null.Estimate er punktestimatet — den tilpassede koeffisienten. For (Intercept) er det (skjæringen); for en forklaringsvariabel er det stigningstallet, dvs. forventet endring i responsen per enhet av den variabelen (med de øvrige holdt konstant, i multippel regresjon). Dette er tallet du tolker i kontekst.Std. Error er standardfeilen — den estimerte spredningen til koeffisienten. Den forteller hvor presist koeffisienten er bestemt, og den er byggeklossen i både t-verdien (kolonnen ved siden av) og konfidensintervallet (). Ikke forveksle denne kolonnen med t value — det er den vanligste lesefeilen (§5.14).t value er testobservatoren for :Den er -fordelt under . Du kan alltid verifisere kolonnen selv ved å dele
Estimate på Std. Error — en rask kryssjekk sensor liker å se.Pr(>|t|) er den tosidige P-verdien for — sannsynligheten under for et minst like ekstremt utfall som det observerte. Liten P-verdi () betyr at koeffisienten er signifikant forskjellig fra null. Stjernene bak (***, **, *) er signifikanskoder. Pr(>|t|) er IKKE «sannsynligheten for at » — hypotesen er ikke stokastisk (§5.14).*** betyr , ** betyr , * betyr , . betyr , og blank betyr . De er en rask visuell guide, men du bør alltid lese selve P-verdien og sammenligne med det nivået oppgaven ber om (ofte 5 %).En regresjon av eksamenspoeng () på antall studietimer () for studenter gir sammendraget under. Bruk .
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 44.8000 2.8230 15.870 2.49e-07 ***
studietimer 2.1545 0.2275 9.471 1.27e-05 ***
---
Residual standard error: 4.132 on 8 degrees of freedom
Multiple R-squared: 0.9181, Adjusted R-squared: 0.9079
F-statistic: 89.70 on 1 and 8 DF, p-value: 1.27e-05a) Angi (studietimer-effekten) og standardfeilen.
b) Verifiser t value for studietimer.
c) Er stigningstallet signifikant på 5 %-nivå?
d) Gi et 95 %-KI for .
e) Hva er , og hvor mange frihetsgrader?
b) t value — stemmer med utskriften.
c) Ja. Pr(>|t|) (og ), så er klart signifikant forskjellig fra 0.
d) KI .
e) «Residual standard error» , på frihetsgrader (leses rett av linja).
Bruk utskriften i eksempel 1.
a) Hva er den estimerte skjæringen , og hva er standardfeilen?
b) Regn ut t value for (Intercept) og sjekk mot utskriften.
Løkke 2 — Residual SE, R² og F-statistikken (~15 min)
Linja oppgir også «on degrees of freedom», som er ( = antall forklaringsvariabler). Fra denne linja henter du både og frihetsgraden du trenger til t-kvantilen i et konfidensintervall.
Den kan synke hvis en tilføyd variabel ikke forklarer nok. Derfor er det denne — ikke «Multiple R-squared» — du bruker til å velge mellom modeller (mer i kap. 3.3).
p-value. Liten samlet P-verdi betyr at minst én prediktor bidrar. I enkel regresjon er for stigningstallet, og den samlede P-verdien er lik Pr(>|t|) for stigningstallet.Boligpris (, i 1000 kr) er regressert på areal (, m²) og alder (, år) for boliger. Bruk .
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 480.136 102.198 4.698 0.00112 **
areal 22.305 0.863 25.833 9.4e-10 ***
alder -8.058 1.672 -4.818 0.00095 ***
---
Residual standard error: 35.34 on 9 degrees of freedom
Multiple R-squared: 0.9974, Adjusted R-squared: 0.9968
F-statistic: 1735 on 2 and 9 DF, p-value: 2.3e-12a) Tolk koeffisienten for areal i kontekst.
b) Er alder signifikant på 5 %-nivå?
c) Gi et 95 %-KI for areal-koeffisienten.
d) Hvor mange frihetsgrader har residualene, og hva er ?
e) Hva sier F-statistikken?
b) Ja. For alder er Pr(>|t|) (og ), så alder er signifikant. : med areal holdt konstant faller forventet pris ca. 8 000 kr per år eldre.
c) KI .
d) Residualene har frihetsgrader med prediktorer, så .
e) på 2 og 9 frihetsgrader med samlet P-verdi : modellen som helhet forklarer klart mer enn ren tilfeldighet — minst én av areal/alder bidrar.
Bruk den multiple utskriften i eksempel 2.
a) Verifiser t value for alder ( Estimate/Std. Error).
b) Hva er ?
c) Hvorfor er «Adjusted R-squared» (0,9968) litt lavere enn «Multiple R-squared» (0,9974)?
Løkke 3 — Bruk utskriften: KI, signifikans og betinget tolkning (~15 min)
Du henter
Estimate og Std. Error fra koeffisientraden, og frihetsgraden fra «Residual standard error»-linja. Kvantilen slås opp i formelsamlingen (eller er oppgitt).Pr(>|t|) . Tilsvarende: hvis ligger utenfor det -KI-et (dualiteten). For 5 %-nivå betyr Pr(>|t|) at variabelen har en påvisbar effekt gitt de øvrige i modellen.Pr(>|t|) betyr «denne variabelen bidrar ikke utover det de andre allerede fanger» — ikke at variabelen er uviktig i seg selv. Legges en korrelert variabel til eller fjernes, kan både estimatet og P-verdien endre seg. Å lese en ikke-signifikant koeffisient som «uviktig» uten dette forbeholdet er en klassisk feil (§5.14).En respons er regressert på og for enheter. Utskriften er:
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 19.829 5.285 3.752 0.00460 **
x1 3.500 0.460 7.602 3.3e-05 ***
x2 -0.411 0.489 -0.840 0.42300
---
Residual standard error: 4.486 on 9 degrees of freedom
Multiple R-squared: 0.9168, Adjusted R-squared: 0.8984
F-statistic: 49.6 on 2 and 9 DF, p-value: 1.4e-05a) Er signifikant på 5 %-nivå?
b) Kan vi konkludere at er «uviktig» for ?
c) Hva forteller den samlede F-testen?
Pr(>|t|) (og er langt under en kritisk verdi rundt 2,26). Vi kan ikke forkaste .b) Ikke uten forbehold. P-verdien er betinget på at allerede er i modellen. Den sier at ikke bidrar utover det fanger — ofte fordi og er korrelerte. kan godt henge sammen med alene; testen gjelder tilleggseffekten gitt .
c) på 2 og 9 frihetsgrader, samlet P-verdi : modellen som helhet forklarer klart noe — drevet av den sterkt signifikante (***), ikke av .
Bruk utskriften i eksempel 3. .
a) Gi et 95 %-KI for koeffisienten til .
b) Bruk dualiteten til å bekrefte at er signifikant, men ikke er det.
En medstudent ser på utskriften i eksempel 2 og sier: «Pr(>|t|) for areal er , altså er det bare 0,00000009 % sannsynlig at areal-koeffisienten er null.»
a) Hva er galt med formuleringen?
b) Gi den korrekte tolkningen av P-verdien.
(Delvis utfylt utskrift.) I en enkel regresjon () er Estimate for stigningstallet og Std. Error . t value og Pr(>|t|) er visket bort.
a) Regn ut t value.
b) Med : er stigningstallet signifikant på 5 %-nivå?
c) Gi et 95 %-KI for stigningstallet.
- Forveksle Std. Error-kolonnen med t value. Standardfeilen er spredningen; t-verdien er Estimate/Std. Error. Kryssjekk alltid ved å dele selv.
- Lese Pr(>|t|) som «sannsynligheten for at ». P-verdien beregnes UNDER og måler hvor ekstreme dataene er — ikke sannsynligheten for hypotesen (§5.14).
- Tolke en ikke-signifikant koeffisient som «uviktig» uten forbehold. P-verdien er betinget på de øvrige variablene; en korrelert variabel kan skjule effekten.
- Hente feil frihetsgrad til KI-et. Bruk fra «Residual standard error»-linja, ikke .
- Bruke «Multiple R-squared» til modellvalg. Den øker alltid; bruk «Adjusted R-squared».
- Glemme å tolke koeffisienten i kontekst (med enhet og «de andre holdt konstant» i multippel regresjon).
Begrepsbank
Første rad i Coefficients-tabellen, med estimatet for konstantleddet . Tolkes som forventet respons når alle forklaringsvariabler er null — meningsfullt bare hvis det punktet ligger i/nær dataområdet.
En rask kryssjekk: t value skal være Estimate delt på Std. Error. Stemmer det ikke, har du lest feil kolonne. Sensor liker å se denne kontrollen.
t-testene i Coefficients-tabellen tester én koeffisient om gangen; F-statistikken tester alle helningene samlet (). I enkel regresjon er og de gir samme P-verdi.
summary viser ofte en «Residuals»-oppsummering (min, 1Q, median, 3Q, max) over toppen. Grovt symmetriske residualer med median nær 0 er et første tegn på at modellantakelsene holder; detaljert sjekk gjøres med residualplott (kap. 3.4).Residualfrihetsgraden er . Kjenner du , er ; kjenner du , er . Nyttig når oppgaven ikke oppgir eksplisitt.
P-verdien på F-statistic-linja hører til den samlede testen alle helninger . Liten samlet P-verdi betyr at modellen forklarer mer enn tilfeldig — men sier ikke hvilke enkeltvariabler som bidrar (det gjør t-testene).
Den hyppigste lesefeilen. Std. Error er en spredning (samme enhet som koeffisienten); t value er et enhetsløst forhold ofte ved signifikans. Del Estimate på Std. Error for å skille dem.
Pr(>|t|) er IKKE sannsynligheten for at koeffisienten er null. Den er sannsynligheten under for en minst like ekstrem t-verdi. Koeffisienten er fast, ikke stokastisk.Fra venstre: Estimate () → Std. Error () → t value () → Pr(>|t|) (tosidig P-verdi). Å huske rekkefølgen hindrer kolonneforveksling.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.
Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.