Tilbake
4.3

4.3 Øvingseksamen 2 — rotasjonsmalen (Bayes, ANOVA/dummy, konfundering)

Et sett som trekker inn de roterende A-differensiatorene: et Bayes-/konjugeringspunkt i estimeringen, ANOVA koblet til dummy-regresjon, og en tydelig konfunderingsdrøfting i den multiple regresjonen.

90 min
0 oppgaver
Øvingseksamen 2rotasjonsmalen (BayesANOVA/dummykonfundering)
Din fremgang i kapitlet
0 / 0 oppgaver
Forkunnskaper (hentes frem før du starter klokka):

- kap. 1.2 — ML-kjeden LL \to \ell \to score \to løs \to bekreft maksimum, som bærer oppgave 1a–c.
- kap. 1.4 — konjugering med kjernetrikset (samle eksponentene), gamma-kjernen og Bayes-estimatoren som veid snitt, som bærer oppgave 1d–f.
- kap. 2.6 — enveis ANOVA-modellen, F-observatoren MSB/MSW og lesing av ANOVA-tabellen, som bærer oppgave 2.
- kap. 3.3 — dummy-koding, matriseform, justert R2R^2 og konfundering, som bærer oppgave 2c og hele oppgave 3.
- kap. 4.1 — tidsbudsjett og strategien for kjededelte oppgaver.

Poisson-egenskapene E(X)=V(X)=λE(X)=V(X)=\lambda og gamma-fordelingens form er STK1100-stoff; kap. 0.2 frisker dem opp.

Oppgavesettet

Oppgave 1 — Estimering og Bayes for en Poisson-rate (a–f)

Ved en serverpark registreres antall driftsavvik per døgn. La X1,,XnX_1,\dots,X_n være antall avvik i n=8n=8 uavhengige døgn, der XiPoisson(λ)X_i \sim \text{Poisson}(\lambda) med punktsannsynlighet
p(x;λ)=λxx!eλ,x=0,1,2,p(x;\lambda)=\frac{\lambda^x}{x!}e^{-\lambda},\qquad x=0,1,2,\dots
Observert sum er i=18xi=36\sum_{i=1}^{8} x_i = 36. For Poisson er E(Xi)=V(Xi)=λE(X_i)=V(X_i)=\lambda (STK1100-stoff, repetert i kap. 0.2).

a) Sett opp likelihoodfunksjonen L(λ)L(\lambda) og log-likelihooden (λ)\ell(\lambda).

b) Utled scorefunksjonen, løs scoreligningen og vis at ML-estimatoren er λ^=Xˉ\hat\lambda = \bar X. Bekreft at løsningen er et maksimumspunkt.

c) Vis at λ^\hat\lambda er forventningsrett, og finn V(λ^)V(\hat\lambda).

d) Driftsavdelingen har forhåndskunnskap fra tilsvarende anlegg, uttrykt som en gamma(α,β)(\alpha,\beta)-apriori for λ\lambda med α=2\alpha=2 og β=1\beta=1 (skalaparametrisering: π(λ)λα1eλ/β\pi(\lambda)\propto\lambda^{\alpha-1}e^{-\lambda/\beta}). Utled aposteriorifordelingen for λ\lambda gitt dataene. Samle eksponentene eksplisitt.

e) Finn Bayes-estimatoren for λ\lambda, og regn ut estimatet. (For gamma(α,β)(\alpha,\beta) er E=αβE=\alpha\beta — står i formelsamlingen.)

f) Vis at Bayes-estimatet kan skrives som et veid gjennomsnitt av ML-estimatet xˉ\bar x og apriori-forventningen αβ\alpha\beta. Angi vekten på dataene, regn den ut her, og forklar hva som skjer med Bayes-estimatoren når nn\to\infty.

Oppgave 2 — Enveis ANOVA og dummy-regresjon (a–e)

Et næringsmiddellaboratorium måler vitamin C-innhold (mg per 100 g) i jordbær etter fire ukers lagring med tre metoder: romtemperatur, kjøleskap og frys, med seks kartonger per metode (N=18N=18). Gruppegjennomsnittene er xˉrom=9,5\bar x_{\text{rom}}=9{,}5, xˉkjøl=13,0\bar x_{\text{kjøl}}=13{,}0 og xˉfrys=15,5\bar x_{\text{frys}}=15{,}5. En enveis ANOVA gir tabellen under, der to celler er sladdet:

            Df   Sum Sq   Mean Sq   F value    Pr(>F)
metode       2   109.00      [?]       [?]    6.12e-07
Residuals   15    19.00      [?]

a) Formuler ANOVA-modellen og hypotesene som F-testen prøver.

b) Fyll ut Mean Sq-kolonnen og F-verdien, og gjennomfør testen på 5 %-nivå. Forklar hvorfor testen forkaster for store F-verdier, og hvorfor nivået blir nøyaktig 5 %. Oppgitt: F2,15,0,05=3,68F_{2,\,15,\,0{,}05}=3{,}68.

c) De samme dataene analyseres som lineær regresjon med indikatorvariabler (dummyer), med romtemperatur som referanse:

Coefficients:
            Estimate  Std. Error  t value  Pr(>|t|)
(Intercept)   9.5000      0.4595   20.676  1.95e-12
kjoleskap     3.5000      0.6498    5.386  7.56e-05
frys          6.0000      0.6498    9.234  1.41e-07
---
Residual standard error: 1.1255 on 15 degrees of freedom
Multiple R-squared:  0.8516,   Adjusted R-squared:  0.8318
F-statistic: 43.03 on 2 and 15 DF,  p-value: 6.12e-07

Forklar hva (Intercept), kjoleskap og frys estimerer, og pek på to steder der utskriften og ANOVA-tabellen må stemme overens.

d) Bruk MSW fra (b) til å teste kontrasten H0:μfrysμrom=0H_0:\mu_{\text{frys}}-\mu_{\text{rom}}=0 mot Ha:μfrysμrom0H_a:\mu_{\text{frys}}-\mu_{\text{rom}}\ne 0 på 5 %-nivå, og angi et 95 %-konfidensintervall for differansen. Sammenlign med frys-raden i utskriften. Oppgitt: t15,0,025=2,131t_{15,\,0{,}025}=2{,}131.

e) Hva sier den signifikante ANOVA-testen om lagringsmetodene — og hva sier den ikke?

Oppgave 3 — Multippel regresjon: konfundering, modellvalg og diagnostikk (a–f)

For n=20n=20 utleieleiligheter i samme by er registrert månedsleie yy (kr), areal x1x_1 (m²) og avstand fra sentrum x2x_2 (km). Korrelasjonen mellom areal og avstand i utvalget er 0,800{,}80 — store leiligheter ligger gjennomgående lengre fra sentrum. To modeller er tilpasset:

Modell A: leie ~ areal

Coefficients:
            Estimate  Std. Error  t value  Pr(>|t|)
(Intercept)  5122.00     1046.55    4.894  1.17e-04
areal         173.29       15.15   11.441  1.08e-09
---
Residual standard error: 1283.3 on 18 degrees of freedom
Multiple R-squared:  0.8791,   Adjusted R-squared:  0.8724
F-statistic: 130.9 on 1 and 18 DF,  p-value: 1.08e-09

Modell B: leie ~ areal + avstand

Coefficients:
            Estimate  Std. Error  t value  Pr(>|t|)
(Intercept)  3693.68      450.45    8.200  2.60e-07
areal         253.31       10.36   24.442  1.10e-14
avstand      -555.56       57.90   -9.595  2.83e-08
---
Residual standard error: 521.3 on 17 degrees of freedom
Multiple R-squared:  0.9812,   Adjusted R-squared:  0.9789
F-statistic: 442.7 on 2 and 17 DF,  p-value: 2.18e-15

a) Bruk modell A: tolk stigningstallet for areal i kontekst, og forklar hvordan frihetsgradstallet 18 fremkommer.

b) I modell B er areal-koeffisienten 253,31253{,}31 — mot 173,29173{,}29 i modell A. Forklar mekanismen bak endringen. Hvilken av de to koeffisientene beskriver arealeffekten for leiligheter med samme avstand fra sentrum?

c) Test på 5 %-nivå om avstand har effekt på leia når areal er med i modellen, og angi et 95 %-konfidensintervall for avstandskoeffisienten. Oppgitt: t17,0,025=2,110t_{17,\,0{,}025}=2{,}110.

d) Avgjør med justert R2R^2 hvilken modell som foretrekkes, og forklar hvorfor Multiple R-squared alene ikke kan brukes til dette valget.

e) Skriv modell B på matriseform Y=Xβ+εY=X\beta+\varepsilon: angi dimensjonene til XX og β\beta, minste kvadraters estimator på matriseform, og betingelsen for at den er entydig.

f) Hvilke tre standardplott vil du bruke til å vurdere modell B, og hva ser du etter i hvert av dem? Hva ville et vifteformet residualplott (spredning som øker med tilpasset verdi) bety for gyldigheten av testen i (c)?

Løsningsforslag oppgave 1
Løsningsforslag oppgave 2
Løsningsforslag oppgave 3

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.