Tilbake
2.1

2.1 Konfidensintervall: t, Wald, andeler og varians

Standardintervallene og valget mellom dem: t-intervall ved ukjent σ, Wald-intervall for en MLE, andels-intervall og χ²-intervall for variansen — med riktig kvantil og frihetsgrad.

60 min
15 oppgaver
KonfidensintervallWaldandelervarians
Din fremgang i kapitlet
0 / 15 oppgaver
Forkunnskaper: Dette kapitlet bygger på Wald-intervallet og standardfeilen i kap. 1.3 (ML-estimatorens tilnærmede normalfordeling, se(θ^)se(\hat\theta), zz-kvantilen) og på estimator-egenskapene i kap. 1.1 (forventningsretthet, varians). De CLT-tilnærmede intervallene kommer fra STK1100 kap. 6.2 CLT-tilnærmet konfidensintervall (→ stk1100-6-2) (klartekst — STK1100 er ikke bygget ennå). For tt-, zz- og χ2\chi^2-fordelingene: formelsamlingen for STK1110 (tren oppslag av kvantiler).

Alt du trenger fra sannsynlighetsteorien — at (n1)S2/σ2(n-1)S^2/\sigma^2 er khikvadratfordelt — repeteres kort her. Trenger du å friske opp integral/derivasjon: R2 2.4 Bestemt integral.

Et punktestimat gir ett tall — men hvor mye kan vi stole på det? Konfidensintervallet svarer ved å legge en usikkerhetsmargin rundt estimatet: et intervall som med en oppgitt sannsynlighet (typisk 95 %) fanger den ukjente parameteren.

Alle standardintervallene har samme grunnform: estimat ±\pm kvantil ×\times standardfeil. Kunsten på eksamen er å velge riktig kvantil (z eller t?) og riktig frihetsgrad — og for variansen: et intervall som ikke er symmetrisk i det hele tatt.

Vi går i fem løkker: (1) t-intervallet for forventningen, (2) hva et KI egentlig betyr, (3) Wald-intervallet for en ML-estimator, (4) andels-intervallet, (5) khikvadrat-intervallet for variansen. Hver løkke: teori \to gjennomregnet eksempel \to øvingsoppgave.

Løkke 1 — t-intervallet for forventningen (~14 min)

t-fordelingen
t-fordelingen oppstår når vi standardiserer et normalfordelt gjennomsnitt, men må bruke det estimerte standardavviket SS i stedet for det sanne σ\sigma. Den ligner standardnormalen, men har tyngre haler — ekstra usikkerhet fordi SS selv varierer fra utvalg til utvalg.

For normale data X1,,XnX_1,\dots,X_n gjelder eksakt
XˉμS/ntn1,\frac{\bar X-\mu}{S/\sqrt n}\sim t_{n-1},
en t-fordeling med n1n-1 frihetsgrader. Jo større nn, jo nærmere standardnormalen (for nn\to\infty er t=N(0,1)t_\infty=N(0,1)). Kvantilene ligger i formelsamlingen.

t-konfidensintervallet for forventningen μ\mu
t-konfidensintervallet brukes for forventningen μ\mu når dataene er (tilnærmet) normale og σ\sigma er ukjent — det normale tilfellet i praksis. Et (1α)(1-\alpha)-intervall er
Xˉ±tn1,α/2Sn,\bar X \pm t_{n-1,\,\alpha/2}\cdot \frac{S}{\sqrt n},
der tn1,α/2t_{n-1,\alpha/2} er øvre α/2\alpha/2-kvantil i t-fordelingen med n1n-1 frihetsgrader (P(Tn1>tn1,α/2)=α/2P(T_{n-1}>t_{n-1,\alpha/2})=\alpha/2). Her er Xˉ\bar X estimatet, S/nS/\sqrt n standardfeilen til gjennomsnittet, og tn1,α/2t_{n-1,\alpha/2} kvantilantallet standardfeil. For 95 % og n1=15n-1=15 er t15,0,025=2,131t_{15,\,0{,}025}=2{,}131.
Hvorfor t (ikke z), og hvorfor n1n-1 frihetsgrader (utledes):

1. Med kjent σ\sigma er Xˉμσ/nN(0,1)\dfrac{\bar X-\mu}{\sigma/\sqrt n}\sim N(0,1) eksakt, og vi ville brukt zz-kvantilen.
Intuisjon: teller normal, nevner en fast konstant \Rightarrow standardnormal.
2. Men σ\sigma er ukjent, så vi setter inn SS. Nå er nevneren S/nS/\sqrt n stokastiskSS varierer mellom utvalg. Det legger til ekstra usikkerhet og gjør halene tyngre enn i normalen.
Intuisjon: vi «gjetter» spredningen, og gjettet kan bomme \Rightarrow bredere fordeling.
3. Nøkkelen bak n1n-1: utvalgsvariansen oppfyller (n1)S2σ2χn12\dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1} — den mister én frihetsgrad fordi S2S^2 er regnet om Xˉ\bar X (ett estimert senter binder opp én grad).
Intuisjon: når du har regnet Xˉ\bar X, er bare n1n-1 av avvikene XiXˉX_i-\bar X «frie» — det siste er bestemt av at de summerer til null.
4. Kvotienten av en standardnormal og roten av en uavhengig χn12/(n1)\chi^2_{n-1}/(n-1) er per definisjon tn1t_{n-1}. Derfor: t, ikke z, og n1n-1 frihetsgrader.

✏️Eksempel 1: t-intervall for en forventning (sjanger D)

Bruddstyrken (i kN) til n=16n=16 prøvestykker har gjennomsnitt xˉ=20,5\bar x=20{,}5 og utvalgsstandardavvik s=3,2s=3{,}2. Anta normale data med ukjent σ\sigma. Konstruer et 95 % konfidensintervall for forventet bruddstyrke μ\mu, og forklar valget av fordeling og frihetsgrad.

Ukjent σ\sigma og normale data \Rightarrow t-intervall med n1=15n-1=15 frihetsgrader.

Standardfeil: S/n=3,2/16=3,2/4=0,80S/\sqrt n = 3{,}2/\sqrt{16}=3{,}2/4=0{,}80.

Kvantil (formelsamling): t15,0,025=2,131t_{15,\,0{,}025}=2{,}131.

Margin: 2,1310,80=1,7052{,}131\cdot 0{,}80=1{,}705.

xˉ±t15,0,025sn=20,5±1,705=[18,80, 22,20] kN.\bar x \pm t_{15,\,0{,}025}\frac{s}{\sqrt n}=20{,}5\pm 1{,}705=[18{,}80,\ 22{,}20]\ \text{kN}.

Valget: tt fordi σ\sigma er estimert med SS; n1=15n-1=15 fordi (n1)S2/σ2χ152(n-1)S^2/\sigma^2\sim\chi^2_{15}. Prosedyren fanger den sanne μ\mu i 95 % av gjentatte utvalg; her ga den [18,80, 22,20][18{,}80,\ 22{,}20] kN.

📝Oppgave 1

Du skal lage et 95 % t-intervall fra et utvalg på n=10n=10 normale observasjoner med ukjent σ\sigma.

a) Hvor mange frihetsgrader har t-fordelingen?

b) Hvilken kvantil tn1,α/2t_{n-1,\alpha/2} skal du slå opp (formelsamlingen gir t9,0,025=2,262t_{9,\,0{,}025}=2{,}262)?

📝Oppgave 2

Måleavvik (mm) fra n=25n=25 enheter har xˉ=100\bar x=100 og s=10s=10. Anta normale data, ukjent σ\sigma. Konstruer et 95 % konfidensintervall for μ\mu. Bruk t24,0,025=2,064t_{24,\,0{,}025}=2{,}064.

📝Oppgave 3

En liten stikkprøve på n=9n=9 batterier har levetid med xˉ=50\bar x=50 timer og s=6s=6 timer (normale data, ukjent σ\sigma). Lag et 99 % konfidensintervall for forventet levetid. Bruk t8,0,005=3,355t_{8,\,0{,}005}=3{,}355.

Løkke 2 — Hva et konfidensintervall betyr (~8 min)

Frekventistisk tolkning av konfidensintervallet

Et 95 % konfidensintervall betyr at prosedyren — regelen «Xˉ±tS/n\bar X\pm t\cdot S/\sqrt n» — fanger den sanne parameteren i 95 % av gjentatte utvalg. Det er ikke «95 % sannsynlighet for at μ\mu ligger i akkurat dette intervallet».

Grunnen: den sanne μ\mu er et fast (ukjent) tall, ikke stokastisk. Det som varierer fra utvalg til utvalg, er intervallgrensene. Etter at du har regnet ut ett konkret intervall [18,80, 22,20][18{,}80,\ 22{,}20], ligger μ\mu enten inni eller utenfor — det er ingen sannsynlighet igjen. Sannsynligheten 0,95 hører til metoden, ikke det enkelte tallet.

Konfidensnivå og dekningsgrad
Konfidensnivået (1α)(1-\alpha) er den tilstrebede dekningen — hvor ofte prosedyren skal fange parameteren. Dekningsgraden er den faktiske sannsynligheten for at intervallet inneholder parameteren over gjentatte utvalg. For t-intervallet med normale data er dekningen eksakt (1α)(1-\alpha); for Wald- og andels-intervaller er den tilnærmet (1α)(1-\alpha) (eksakt bare i store utvalg).
📝Oppgave 4

En student skriver: «Vi fant intervallet [18,80, 22,20][18{,}80,\ 22{,}20], så det er 95 % sannsynlig at μ\mu ligger mellom 18,80 og 22,20.» Hva er galt, og hvordan formulerer du det riktig?

Løkke 3 — Wald-intervallet for en ML-estimator (~10 min)

Wald-konfidensintervallet for en MLE
Wald-intervallet (fra kap. 1.3) bruker at ML-estimatoren er tilnærmet normalfordelt i store utvalg, θ^ca.N(θ,1/(nI(θ)))\hat\theta\overset{\text{ca.}}{\sim}N(\theta,\,1/(nI(\theta))). Et tilnærmet (1α)(1-\alpha)-intervall er
θ^±zα/2se(θ^),se(θ^)=1nI(θ^).\hat\theta \pm z_{\alpha/2}\,se(\hat\theta),\qquad se(\hat\theta)=\sqrt{\frac{1}{nI(\hat\theta)}}.
Her brukes zz-kvantilen (ikke tt), fordi normalformen kommer fra ML-asymptotikken (sentralgrenseteoremet) — ikke fra en eksakt normalmodell med estimert σ\sigma. z0,025=1,96z_{0{,}025}=1{,}96 for 95 %. Nevn asymptotikken eksplisitt (sensorkrav §4.4).
z eller t? Den avgjørende forskjellen:

- t-intervall (Xˉ±tn1,α/2S/n\bar X\pm t_{n-1,\alpha/2}S/\sqrt n): eksakt normalmodell, σ\sigma estimert med SS. Bruk t.
- Wald-intervall (θ^±zα/2se\hat\theta\pm z_{\alpha/2}\,se): ingen eksakt normalmodell — normalformen er en asymptotisk tilnærming fra ML-teorien. Bruk z.

En av de vanligste feilene er å bytte om disse. Spør alltid: Er normalformen eksakt (fra normale data) eller asymptotisk (fra store utvalg)?

✏️Eksempel 2: Wald-intervall for en Poisson-rate (sjanger D)

Antall driftsavbrudd per måned antas Poisson(λ)(\lambda). Over n=50n=50 måneder er gjennomsnittet xˉ=2,4\bar x=2{,}4. ML-estimatoren er λ^=Xˉ\hat\lambda=\bar X og Fisher-informasjonen I(λ)=1/λI(\lambda)=1/\lambda (kap. 1.3). Gi et 95 % Wald-intervall for λ\lambda.

λ^=xˉ=2,4\hat\lambda=\bar x=2{,}4. Standardfeil:
se(λ^)=1nI(λ^)=λ^n=2,450=0,219.se(\hat\lambda)=\sqrt{\frac{1}{nI(\hat\lambda)}}=\sqrt{\frac{\hat\lambda}{n}}=\sqrt{\frac{2{,}4}{50}}=0{,}219.
Med z0,025=1,96z_{0{,}025}=1{,}96: 2,4±1,960,219=2,4±0,429=[1,97, 2,83]2{,}4\pm 1{,}96\cdot 0{,}219=2{,}4\pm 0{,}429=[1{,}97,\ 2{,}83] avbrudd per måned.

Poeng: her brukes zz (ikke tt) fordi normalformen er ML-asymptotikken — si det eksplisitt.

📝Oppgave 5

Antall feilmeldinger per dag er Poisson(λ)(\lambda) med I(λ)=1/λI(\lambda)=1/\lambda. Over n=80n=80 dager er xˉ=1,5\bar x=1{,}5. Gi et 95 % Wald-intervall for λ\lambda, og forklar hvorfor du bruker zz og ikke tt.

Løkke 4 — Andels-intervallet (~9 min)

Konfidensintervall for en andel pp
Andels-intervallet gjelder når du observerer antall «suksesser» XX i nn uavhengige forsøk, Xbinomisk(n,p)X\sim\text{binomisk}(n,p), og estimerer p^=X/n\hat p=X/n. Dette er et spesialtilfelle av Wald-intervallet (p^\hat p er ML-estimatoren, med I(p)=1/[p(1p)]I(p)=1/[p(1-p)]). Et tilnærmet (1α)(1-\alpha)-intervall er
p^±zα/2p^(1p^)n.\hat p \pm z_{\alpha/2}\sqrt{\frac{\hat p(1-\hat p)}{n}}.
Standardfeilen p^(1p^)/n\sqrt{\hat p(1-\hat p)/n} er 1/(nI(p^))\sqrt{1/(nI(\hat p))} med p^\hat p satt inn. Tilnærmingen er god når np^n\hat p og n(1p^)n(1-\hat p) begge er romslig større enn 5.
✏️Eksempel 3: Andels-intervall (sjanger D)

I en spørreundersøkelse svarer X=80X=80 av n=250n=250 tilfeldig utvalgte «ja». Gi et 95 % konfidensintervall for andelen pp i populasjonen som ville svart «ja».

p^=80/250=0,32\hat p = 80/250 = 0{,}32. Sjekk tilnærming: np^=80n\hat p=80 og n(1p^)=170n(1-\hat p)=170, begge 5\gg 5 — greit.

se(p^)=0,320,68250=0,000870=0,0295.se(\hat p)=\sqrt{\frac{0{,}32\cdot 0{,}68}{250}}=\sqrt{0{,}000870}=0{,}0295.

Wald: 0,32±1,960,0295=0,32±0,0578=[0,262, 0,378]0{,}32\pm 1{,}96\cdot 0{,}0295=0{,}32\pm 0{,}0578=[0{,}262,\ 0{,}378].

Prosedyren fanger den sanne andelen i 95 % av gjentatte utvalg; her [0,262, 0,378][0{,}262,\ 0{,}378], altså mellom ca. 26 % og 38 %.

📝Oppgave 6

Av n=400n=400 produserte enheter er X=120X=120 defekte. Gi et 95 % konfidensintervall for defektandelen pp.

Løkke 5 — Khikvadrat-intervallet for variansen (~11 min)

Utvalgsvariansens fordeling
For normale data er den skalerte utvalgsvariansen khikvadratfordelt:
(n1)S2σ2χn12.\frac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}.
Dette er samme resultat som gir t-intervallet sin n1n-1 frihetsgrad. Det er også pivoten vi bruker for å lage et intervall for variansen σ2\sigma^2 selv: størrelsen (n1)S2/σ2(n-1)S^2/\sigma^2 har en fordeling som ikke avhenger av σ\sigma, så vi kan sette kvantiler rundt den og løse for σ2\sigma^2.
Khikvadrat-intervallet for variansen σ2\sigma^2
Intervallet for variansen er asymmetrisk — fordi khikvadratfordelingen er skjev. Et (1α)(1-\alpha)-intervall for σ2\sigma^2 er
[(n1)S2χn1,α/22, (n1)S2χn1,1α/22],\left[\frac{(n-1)S^2}{\chi^2_{n-1,\,\alpha/2}},\ \frac{(n-1)S^2}{\chi^2_{n-1,\,1-\alpha/2}}\right],
der χn1,α/22\chi^2_{n-1,\alpha/2} er øvre α/2\alpha/2-kvantil og χn1,1α/22\chi^2_{n-1,1-\alpha/2} er nedre α/2\alpha/2-kvantil (øvre 1α/21-\alpha/2). Legg merke til at den store kvantilen står i nedre grense (deler på et stort tall \to liten verdi). For standardavviket σ\sigma: ta kvadratrot av begge grenser.
Hvorfor formen (utledes):

1. Start med pivoten (n1)S2σ2χn12\dfrac{(n-1)S^2}{\sigma^2}\sim\chi^2_{n-1}, som fanges mellom sine to α/2\alpha/2-kvantiler med sannsynlighet 1α1-\alpha:
P ⁣(χn1,1α/22(n1)S2σ2χn1,α/22)=1α.P\!\left(\chi^2_{n-1,\,1-\alpha/2}\le \frac{(n-1)S^2}{\sigma^2}\le \chi^2_{n-1,\,\alpha/2}\right)=1-\alpha.
Intuisjon: nedre kvantil kutter av α/2\alpha/2 til venstre, øvre kvantil α/2\alpha/2 til høyre.
2. Løs den doble ulikheten for σ2\sigma^2. Inverter (og snu ulikhetstegnene) — den største kvantilen havner i nevneren av den nedre grensen:
(n1)S2χn1,α/22σ2(n1)S2χn1,1α/22.\frac{(n-1)S^2}{\chi^2_{n-1,\,\alpha/2}}\le \sigma^2\le \frac{(n-1)S^2}{\chi^2_{n-1,\,1-\alpha/2}}.
Intuisjon: å dele på et stort tall gir en liten nedre grense — derfor byttet plassering.
3. Intervallet er ikke symmetrisk om S2S^2; det er en egenskap ved fordelingen, ikke en regnefeil.

✏️Eksempel 4: Khikvadrat-intervall for varians og standardavvik (sjanger D, eksamensnivå)

Fyllmengden (i ml) i n=20n=20 flasker har utvalgsvarians s2=20,25s^2=20{,}25 (altså s=4,5s=4{,}5). Anta normale data. Gi et 95 % konfidensintervall for variansen σ2\sigma^2 og for standardavviket σ\sigma. Bruk χ19,0,0252=32,852\chi^2_{19,\,0{,}025}=32{,}852 og χ19,0,9752=8,907\chi^2_{19,\,0{,}975}=8{,}907.

Frihetsgrader n1=19n-1=19, og (n1)s2=1920,25=384,75(n-1)s^2=19\cdot 20{,}25=384{,}75.

σ2[384,7532,852, 384,758,907]=[11,71, 43,20] ml2.\sigma^2\in\left[\frac{384{,}75}{32{,}852},\ \frac{384{,}75}{8{,}907}\right]=[11{,}71,\ 43{,}20]\ \text{ml}^2.

Legg merke til at den store kvantilen 32,85232{,}852 gir den nedre grensen. For standardavviket σ\sigma tar vi kvadratrot:
σ[11,71, 43,20]=[3,42, 6,57] ml.\sigma\in[\sqrt{11{,}71},\ \sqrt{43{,}20}]=[3{,}42,\ 6{,}57]\ \text{ml}.

Intervallet er tydelig asymmetrisk om s=4,5s=4{,}5 — riktig, siden khikvadratfordelingen er skjev.

📝Oppgave 7

Måleavvik fra n=15n=15 kalibreringer har utvalgsvarians s2=25s^2=25 (normale data). Bruk χ14,0,0252=26,119\chi^2_{14,\,0{,}025}=26{,}119 og χ14,0,9752=5,629\chi^2_{14,\,0{,}975}=5{,}629.

a) Gi et 95 % konfidensintervall for σ2\sigma^2.

b) Gi et 95 % konfidensintervall for σ\sigma.

c) Hvorfor er intervallet asymmetrisk om s2s^2?

📝Oppgave 8

(Krevende — velg riktig intervalltype selv.) I fire ulike situasjoner: (i) forventet vekt fra n=30n=30 normale målinger, ukjent σ\sigma; (ii) andelen som foretrekker et produkt, ut fra 60 «ja» av 200; (iii) en Poisson-rate estimert med ML fra 100 observasjoner; (iv) variabiliteten (variansen) i en normal prosess fra n=12n=12 målinger. Angi for HVER situasjon hvilket intervall og hvilken kvantil (z, t eller χ2\chi^2, med frihetsgrad) du ville brukt — uten å regne ut tall.

📝Oppgave 9

(Kald oppgave — fasit som momentliste, ingen hint.) Reaksjonstider (sekunder) fra n=12n=12 normale forsøk har xˉ=8,4\bar x=8{,}4 og s=1,8s=1{,}8. Gi et 90 % konfidensintervall for forventet reaksjonstid, tolk det frekventistisk i én setning, og forklar hva som ville skjedd med bredden om du gikk til 95 %. Bruk t11,0,05=1,796t_{11,\,0{,}05}=1{,}796.

Blandet drill (sjanger D, stigende)

📝Oppgave 10

Et laboratorium måler pH i n=16n=16 prøver: xˉ=7,05\bar x=7{,}05, s=0,20s=0{,}20 (normale data, ukjent σ\sigma).

a) Gi et 95 % konfidensintervall for forventet pH. Bruk t15,0,025=2,131t_{15,\,0{,}025}=2{,}131.

b) Ligger pH 7,00 innenfor intervallet?

📝Oppgave 11

En meningsmåling gir p^=0,45\hat p=0{,}45 blant n=1000n=1000 spurte.

a) Gi et 95 % konfidensintervall for pp.

b) Hvor mange respondenter måtte du (grovt) hatt for å halvere marginens bredde, alt annet likt?

Begrepsbank

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet. Korte, navngitte definisjoner for eksamensrepetisjon.
t-kvantilen tν,αt_{\nu,\alpha}

Øvre α\alpha-kvantil i t-fordelingen med ν\nu frihetsgrader: P(Tν>tν,α)=αP(T_\nu>t_{\nu,\alpha})=\alpha. Tosidig (1α)(1-\alpha)-intervall bruker tν,α/2t_{\nu,\alpha/2}. Ligger i formelsamlingen. For store ν\nu nærmer tν,αt_{\nu,\alpha} seg zαz_\alpha.

z-kvantilen zα/2z_{\alpha/2}

Øvre α/2\alpha/2-kvantil i standardnormalen: P(Z>zα/2)=α/2P(Z>z_{\alpha/2})=\alpha/2. For 95 % er z0,025=1,96z_{0{,}025}=1{,}96; for 90 % z0,05=1,645z_{0{,}05}=1{,}645; for 99 % z0,005=2,576z_{0{,}005}=2{,}576.

khikvadrat-kvantilen χν,α2\chi^2_{\nu,\alpha}

Øvre α\alpha-kvantil i khikvadratfordelingen med ν\nu frihetsgrader: P(χν2>χν,α2)=αP(\chi^2_\nu>\chi^2_{\nu,\alpha})=\alpha. Fordelingen er skjev, så χν,α/22\chi^2_{\nu,\alpha/2}\ne speiling av χν,1α/22\chi^2_{\nu,1-\alpha/2} — derfor blir varians-intervallet asymmetrisk.

Utvalgsvariansen S2S^2
S2=1n1i=1n(XiXˉ)2S^2=\dfrac{1}{n-1}\sum_{i=1}^n(X_i-\bar X)^2 — det forventningsrette anslaget på σ2\sigma^2. Deleren n1n-1 (ikke nn) korrigerer for at avvikene måles fra Xˉ\bar X, ikke fra den sanne μ\mu.
Utvalgsstandardavviket SS
S=S2S=\sqrt{S^2}, anslaget på σ\sigma. Merk: SS er ikke forventningsrett for σ\sigma selv om S2S^2 er det for σ2\sigma^2 (kvadratrot er en ikke-lineær transformasjon). Brukes i standardfeilen S/nS/\sqrt n.
Standardfeilen til gjennomsnittet
se(Xˉ)=S/nse(\bar X)=S/\sqrt n — det estimerte standardavviket til Xˉ\bar X. (Det sanne er σ/n\sigma/\sqrt n.) Faller som 1/n1/\sqrt n: firedobler du utvalget, halveres standardfeilen.
Feilmarginen

Halve bredden på et symmetrisk konfidensintervall: kvantil ×\times standardfeil (f.eks. tn1,α/2S/nt_{n-1,\alpha/2}\,S/\sqrt n). Intervallet er estimat ±\pm feilmargin. Marginen krymper med større nn og vokser med høyere konfidensnivå.

Pivotstørrelse

En funksjon av data og parameter hvis fordeling ikke avhenger av parameteren — f.eks. (Xˉμ)/(S/n)tn1(\bar X-\mu)/(S/\sqrt n)\sim t_{n-1} eller (n1)S2/σ2χn12(n-1)S^2/\sigma^2\sim\chi^2_{n-1}. Man setter kvantiler rundt pivoten og løser ulikheten for parameteren.

Fordelingen (n1)S2/σ2χn12(n-1)S^2/\sigma^2\sim\chi^2_{n-1}

For normale data er den skalerte utvalgsvariansen khikvadratfordelt med n1n-1 frihetsgrader. Dette resultatet står bak både n1n-1 i t-intervallet og hele khikvadrat-intervallet for variansen.

Frihetsgrader

Antall uavhengige biter informasjon som er igjen etter at parametere er estimert fra dataene. Ett gjennomsnitt binder én grad, så ett-utvalgs S2S^2 har n1n-1. I regresjon mister man én grad per estimert koeffisient (n2n-2 i enkel, nk1n-k-1 i multippel — kommer i Del 3).

t mot z — når hva

Bruk t når normalformen er eksakt men σ\sigma er estimert (normale data, Xˉ±tS/n\bar X\pm t\,S/\sqrt n). Bruk z når normalformen er en asymptotisk tilnærming (Wald for MLE, andeler). Spørsmålet er alltid: eksakt normal eller asymptotisk normal?

Ensidig konfidensintervall

Et intervall som bare begrenser parameteren fra én side, f.eks. øvre grense Xˉ+tn1,αS/n\bar X + t_{n-1,\alpha}\,S/\sqrt n (hele α\alpha i én hale). Brukes når bare én retning er interessant (f.eks. «forventningen er høyst …»). Merk: da brukes α\alpha, ikke α/2\alpha/2.

Gyldighetsbetingelsen for andels-intervallet

Normaltilnærmingen bak p^±zα/2p^(1p^)/n\hat p\pm z_{\alpha/2}\sqrt{\hat p(1-\hat p)/n} er god når np^5n\hat p\ge 5 og n(1p^)5n(1-\hat p)\ge 5 (noen krever 10\ge 10). For små nn eller p^\hat p nær 0 eller 1 blir den upresis (og kan gi grenser utenfor [0,1][0,1]).

Wilson-intervallet (kjenne til)

Et mer nøyaktig andels-intervall enn Wald, særlig for små nn eller ekstreme p^\hat p; det unngår grenser utenfor [0,1][0,1]. Wald-intervallet er standard på eksamen, men vit at det finnes bedre alternativer. (Prioritet: kjenne til.)

Intervall for standardavviket σ\sigma

Ta kvadratrot av begge grensene i σ2\sigma^2-intervallet: [(n1)S2/χn1,α/22, (n1)S2/χn1,1α/22]\left[\sqrt{(n-1)S^2/\chi^2_{n-1,\alpha/2}},\ \sqrt{(n-1)S^2/\chi^2_{n-1,1-\alpha/2}}\right]. Fortsatt asymmetrisk om SS.

Bredde og presisjon

Bredden på et symmetrisk KI er 2×2\times feilmargin. Den krymper som 1/n1/\sqrt n (mer data) og vokser med konfidensnivået (større kvantil). Å halvere bredden krever firedobling av nn.

Normalantakelsen og robusthet

t- og khikvadrat-intervallene forutsetter normale data. t-intervallet er ganske robust mot moderate avvik fra normalitet (særlig for stor nn), mens khikvadrat-intervallet for variansen er følsomt for ikke-normalitet — vær varsom der.

Estimator mot estimat
Estimatoren Xˉ\bar X (stor bokstav) er en stokastisk variabel — den har en fordeling, og det er den som gir intervallet sin dekningsegenskap. Estimatet xˉ\bar x (liten bokstav) er tallet fra ett konkret utvalg. Gjennomgående sensorkrav å skille dem.
Kobling KI og test (dualitet)

Et tosidig (1α)(1-\alpha)-konfidensintervall inneholder nøyaktig de verdiene θ0\theta_0 som ikke forkastes av en tosidig test på nivå α\alpha. Ligger θ0\theta_0 utenfor intervallet, forkastes H0:θ=θ0H_0:\theta=\theta_0. Denne dualiteten utvikles i kap. 2.2.

Symmetrisk mot asymmetrisk intervall

t-, Wald- og andels-intervaller er symmetriske om estimatet (estimat ±\pm margin). Intervallet for variansen er asymmetrisk fordi khikvadratfordelingen er skjev; det samme gjelder de asymmetriske pivot-intervallene fra kap. 1.3. Asymmetri er da riktig, ikke en feil.

Andel som spesialtilfelle av Wald

Andels-estimatoren p^=X/n\hat p=X/n er ML-estimatoren for binomisk(n,p)(n,p), med I(p)=1/[p(1p)]I(p)=1/[p(1-p)]. Derfor er andels-intervallet nøyaktig Wald-intervallet: se(p^)=1/(nI(p^))=p^(1p^)/nse(\hat p)=\sqrt{1/(nI(\hat p))}=\sqrt{\hat p(1-\hat p)/n}.

Vanligste feiltolkning

«Det er 95 % sannsynlig at θ\theta ligger i dette intervallet» er feil: θ\theta er fast, ikke stokastisk. Riktig utsagn refererer alltid til prosedyren over gjentatte utvalg, ikke det ene tallparet.

Symbol- og formelliste
Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.