Tilbake
1.1

1.1 Estimatorers egenskaper: forventningsretthet, varians, MSE og konsistens

Hva gjør en estimator god — forventningsretthet, varians, skjevhet, MSE og konsistens — og hvordan to estimatorer sammenlignes og den beste velges.

55 min
14 oppgaver
Estimatorers egenskaperforventningsretthetvariansMSEkonsistens
Din fremgang i kapitlet
0 / 14 oppgaver
Forkunnskaper: Dette kapitlet bygger på regnereglene for forventning og varians fra kap. 0.2 — særlig E(aX+bY)=aE(X)+bE(Y)E(aX+bY)=aE(X)+bE(Y), Var(aX)=a2Var(X)\text{Var}(aX)=a^2\text{Var}(X) og Var(Xˉ)=σ2/n\text{Var}(\bar X)=\sigma^2/n — og på kjennskap til kjikvadratfordelingen (χ2\chi^2) derfra. Estimator-begrepet er innført i STK1100 kap. 5.1 Estimatorer og egenskaper (→ stk1100-5-1) (klartekst — STK1100 er ikke bygget ennå).

Du trenger trygg derivasjon og enkel algebra; vil du friske opp, se R1 4.1 Derivasjonsregler. Alt det statistiske forklares her.

Når du har et datasett, vil du gjette verdien av en ukjent parameter — forventet levetid, en sannsynlighet, en varians. Regelen du bruker for å regne gjettet ut av dataene, kalles en estimator. Men hvordan vet du at én regel er bedre enn en annen?

Dette kapitlet gir de fire målestokkene sensor bruker: forventningsretthet (treffer estimatoren i snitt riktig?), varians (hvor mye spriker den?), MSE (hvordan veies bom mot spredning når estimatoren er skjev?) og konsistens (nærmer den seg sannheten når utvalget vokser?). Med dem kan du sammenligne to estimatorer og begrunne valget — nettopp det oppgave 1 spør om.

Kapitlet er bygget som fire læringsløkker: hver går teori → gjennomregnet eksempel → øvingsoppgave, så du arbeider deg gjennom stoffet bit for bit.

Løkke 1 — Estimator, estimat og forventningsretthet (~14 min)

Det aller første sensor ser etter, er om du holder to ting fra hverandre: regelen (en tilfeldig variabel, fordi den avhenger av det tilfeldige utvalget) og tallet den gir på ett konkret datasett. Vi bruker store bokstaver for det tilfeldige og små for tallet — konsekvent gjennom hele boka.

Estimator

En estimator er en regel — en funksjon av de tilfeldige observasjonene X1,,XnX_1,\dots,X_n — som vi bruker for å anslå en ukjent parameter θ\theta. Fordi den er en funksjon av tilfeldige variabler, er estimatoren selv en tilfeldig variabel med sin egen fordeling, forventning og varians. Vi skriver den med hatt og stor bokstav: Θ^\hat\Theta (eller θ^\hat\theta når konteksten er klar). Eksempel: Xˉ=1ni=1nXi\displaystyle \bar X=\frac1n\sum_{i=1}^n X_i er en estimator for forventningen μ\mu.

Estimat

Et estimat er tallet estimatoren gir når du setter inn de faktisk observerte verdiene x1,,xnx_1,\dots,x_n. Det er ikke tilfeldig — det er ett fast tall. Skrivemåte med små bokstaver: θ^=xˉ\hat\theta=\bar x. Merk skillet: Xˉ\bar X (estimator) har en varians; xˉ=4,9\bar x=4{,}9 (estimat) er bare et tall. Å si «variansen til estimatet» er en kategorifeil sensor straffer.

Punktestimator

En punktestimator gir ett enkelt tallanslag for parameteren (i motsetning til et intervallestimat, som gir et helt intervall — det kommer i Del 2). Alle estimatorene i dette kapitlet er punktestimatorer.

En god estimator bør treffe riktig i gjennomsnitt over mange tenkte gjentakelser av forsøket. Det er nettopp det forventningsretthet måler.

Forventningsretthet (forventningsrett estimator)
En estimator Θ^\hat\Theta er forventningsrett (engelsk: unbiased) for θ\theta dersom forventningen treffer parameteren eksakt:

E(Θ^)=θfor alle mulige verdier av θ.E(\hat\Theta)=\theta \quad \text{for alle mulige verdier av } \theta.

Tolkning: gjentar du forsøket uendelig mange ganger, blir gjennomsnittet av estimatene lik den sanne verdien. Estimatoren bommer ikke systematisk — den kan spre seg, men sentreres riktig.

Skjevhet (bias)
Skjevheten til en estimator er det systematiske avviket mellom forventningen og parameteren:

b(Θ^)=E(Θ^)θ.b(\hat\Theta)=E(\hat\Theta)-\theta.

Er b(Θ^)=0b(\hat\Theta)=0, er estimatoren forventningsrett. Positiv skjevhet betyr at estimatoren i snitt ligger for høyt, negativ for lavt. Når en oppgave ber om en forventningsrett estimator, skal du kvantifisere skjevheten og korrigere den (gange med en passende konstant).

✏️Eksempel 1: Utvalgsgjennomsnittet er forventningsrett (sjanger B)

La X1,,XnX_1,\dots,X_n være uavhengige med E(Xi)=μE(X_i)=\mu. Vis at Xˉ=1nXi\displaystyle \bar X=\frac1n\sum X_i er en forventningsrett estimator for μ\mu.

Vi bruker at forventning er lineær:

E(Xˉ)=E ⁣(1ni=1nXi)=1ni=1nE(Xi)=1nnμ=μ.E(\bar X)=E\!\left(\frac1n\sum_{i=1}^n X_i\right)=\frac1n\sum_{i=1}^n E(X_i)=\frac1n\cdot n\mu=\mu.

Siden E(Xˉ)=μE(\bar X)=\mu for enhver μ\mu, er Xˉ\bar X forventningsrett. Skjevheten er b(Xˉ)=μμ=0b(\bar X)=\mu-\mu=0.

Merk språket: Xˉ\bar X (stor bokstav) er estimatoren vi tar forventningen av; ett konkret tallsvar xˉ\bar x ville vært estimatet.

📝Oppgave 1

La X1,,XnX_1,\dots,X_n være uavhengige med E(Xi)=μE(X_i)=\mu. Betrakt estimatoren μ^=13X1+13X2+13X3\hat\mu=\tfrac13 X_1+\tfrac13 X_2+\tfrac13 X_3 (bare de tre første, likt vektet).

a) Er μ^\hat\mu forventningsrett for μ\mu?

b) Hva blir skjevheten hvis du i stedet bruker μ~=12X1+12X2\tilde\mu=\tfrac12 X_1+\tfrac12 X_2?

Ikke alle naturlige estimatorer er forventningsrette. Det viktigste eksempelet er variansestimatoren med divisor nn — den bommer systematisk litt for lavt.

Intuisjon: når du måler spredning rundt Xˉ\bar X i stedet for rundt den ukjente μ\mu, undervurderer du spredningen litt, fordi Xˉ\bar X ligger nærmere dine egne data enn μ\mu gjør. Derfor deler vi på n1n-1, ikke nn.

Utvalgsvariansen S2S^2
Utvalgsvariansen er den forventningsrette estimatoren for variansen σ2\sigma^2:

S2=1n1i=1n(XiXˉ)2,E(S2)=σ2.S^2=\frac{1}{n-1}\sum_{i=1}^n (X_i-\bar X)^2, \qquad E(S^2)=\sigma^2.

Divisoren er n1n-1 (ikke nn) nettopp for å nøytralisere at avvikene måles fra Xˉ\bar X og ikke fra den ukjente μ\mu. Tallet n1n-1 kalles frihetsgrader og går igjen i hele Del 2.

✏️Eksempel 2: ML-variansestimatoren er skjev (sjanger B)

La X1,,XnX_1,\dots,X_n være uavhengige med varians σ2\sigma^2. Betrakt σ^2=1ni=1n(XiXˉ)2\displaystyle \hat\sigma^2=\frac1n\sum_{i=1}^n (X_i-\bar X)^2 (divisor nn — dette er ML-estimatoren fra kap. 1.2). Finn skjevheten og angi en forventningsrett korreksjon.

Vi bruker et resultat verdt å kunne: E ⁣[(XiXˉ)2]=(n1)σ2E\!\left[\sum (X_i-\bar X)^2\right]=(n-1)\sigma^2 (avvikssummen har n1n-1 frihetsgrader). Da er

E(σ^2)=1nE ⁣[(XiXˉ)2]=1n(n1)σ2=n1nσ2.E(\hat\sigma^2)=\frac1n\,E\!\left[\sum (X_i-\bar X)^2\right]=\frac1n(n-1)\sigma^2=\frac{n-1}{n}\,\sigma^2.

Skjevheten blir

b(σ^2)=n1nσ2σ2=σ2n<0,b(\hat\sigma^2)=\frac{n-1}{n}\sigma^2-\sigma^2=-\frac{\sigma^2}{n}<0,

så ML-estimatoren bommer systematisk for lavt, og bommen krymper som 1/n1/n. Den forventningsrette korreksjonen er å gange med nn1\displaystyle \frac{n}{n-1}:

nn1σ^2=1n1(XiXˉ)2=S2,E(S2)=σ2.\frac{n}{n-1}\hat\sigma^2=\frac{1}{n-1}\sum (X_i-\bar X)^2=S^2, \qquad E(S^2)=\sigma^2.

Tallsjekk (n=6, σ2=4n=6,\ \sigma^2=4): E(σ^2)=5643,33E(\hat\sigma^2)=\tfrac56\cdot4\approx3{,}33, skjevhet 4/60,67-4/6\approx-0{,}67.

📝Oppgave 2

En estimator θ^\hat\theta har E(θ^)=nn+2θ\displaystyle E(\hat\theta)=\frac{n}{n+2}\theta.

a) Finn skjevheten b(θ^)b(\hat\theta).

b) Finn en konstant cc slik at cθ^c\hat\theta er forventningsrett for θ\theta.

Løkke 2 — Varians, standardfeil og effisiens (~14 min)

To forventningsrette estimatorer treffer begge riktig i snitt — men den ene kan sprike langt mer enn den andre fra gang til gang. Målestokken for spriket er variansen, og den avgjør hvilken estimator du bør foretrekke.

Varians til en estimator
Variansen Var(Θ^)=E ⁣[(Θ^E(Θ^))2]\text{Var}(\hat\Theta)=E\!\left[(\hat\Theta-E(\hat\Theta))^2\right] måler hvor mye estimatoren spriker rundt sin egen forventning fra utvalg til utvalg. Liten varians betyr en presis, stabil estimator. For utvalgsgjennomsnittet er Var(Xˉ)=σ2/n\text{Var}(\bar X)=\sigma^2/n — den krymper når utvalget vokser.
Standardfeil (sese)
Standardfeilen er standardavviket til estimatoren: se(Θ^)=Var(Θ^)se(\hat\Theta)=\sqrt{\text{Var}(\hat\Theta)}. Den har samme enhet som parameteren og brukes direkte i konfidensintervall (Del 2). For Xˉ\bar X er se(Xˉ)=σ/nse(\bar X)=\sigma/\sqrt n; er σ\sigma ukjent, settes SS inn og gir den estimerte standardfeilen S/nS/\sqrt n.
Effisiens (mest effisiente estimator)

Blant to eller flere forventningsrette estimatorer for samme parameter kalles den med minst varians den mest effisiente. Effisiens = presisjon: den effisiente estimatoren utnytter dataene best. Å velge den mest effisiente er standardsvaret på «hvilken estimator foretrekker du, og hvorfor?».

Estimator-sammenligning på varians

Er to estimatorer begge forventningsrette for θ\theta, velger du den med minst varians (den mest effisiente). Dette er den korrekte sammenligningen bare når begge er forventningsrette; er den ene skjev, må du bruke MSE i stedet (løkke 3).

La oss se hvorfor Xˉ\bar X er en god idé, ved å sammenligne estimatorer som bruker ulikt antall observasjoner.

Intuisjon: jo flere uavhengige observasjoner du midler over, desto mer utjevnes tilfeldighetene — variansen synker som 1/n1/n. En estimator som bare bruker noen få observasjoner, kaster bort informasjon.

✏️Eksempel 3: To forventningsrette estimatorer — hvilken vinner? (sjanger B)

La X1,,XnX_1,\dots,X_n (n3n\ge3) være uavhengige med E(Xi)=μE(X_i)=\mu, Var(Xi)=σ2\text{Var}(X_i)=\sigma^2. Sammenlign Xˉ=1nXi\displaystyle \bar X=\frac1n\sum X_i med μ^2=12(X1+X2)\displaystyle \hat\mu_2=\frac12(X_1+X_2). Begge er forventningsrette (løkke 1). Hvilken foretrekker du?

Vi regner variansene med reglene fra kap. 0.2 (Var(aX)=a2Var(X)\text{Var}(aX)=a^2\text{Var}(X), varianser adderer for uavhengige):

Var(Xˉ)=σ2n,Var(μ^2)=14σ2+14σ2=σ22.\text{Var}(\bar X)=\frac{\sigma^2}{n}, \qquad \text{Var}(\hat\mu_2)=\tfrac14\sigma^2+\tfrac14\sigma^2=\frac{\sigma^2}{2}.

For n>2n>2 er σ2/n<σ2/2\sigma^2/n<\sigma^2/2, så Xˉ\bar X har minst varians og er mest effisient. Konklusjon: foretrekk Xˉ\bar X — den bruker all informasjonen, mens μ^2\hat\mu_2 kaster bort n2n-2 observasjoner.

Tallsjekk (n=6n=6): Var(Xˉ)=σ2/6\text{Var}(\bar X)=\sigma^2/6 mot σ2/2\sigma^2/2Xˉ\bar X har tre ganger mindre varians.

📝Oppgave 3
X1,,XnX_1,\dots,X_n er uavhengige med forventning μ\mu og varians σ2\sigma^2. Betrakt de to forventningsrette estimatorene Xˉ\bar X og μ^3=14X1+34X2\hat\mu_3=\tfrac14 X_1+\tfrac34 X_2.

a) Vis at μ^3\hat\mu_3 er forventningsrett.

b) Regn ut Var(μ^3)\text{Var}(\hat\mu_3) og avgjør med begrunnelse hvilken av Xˉ\bar X og μ^3\hat\mu_3 du foretrekker for n=5n=5.

Invers-varians-vekting

Skal du kombinere to uavhengige, forventningsrette estimatorer θ^1,θ^2\hat\theta_1,\hat\theta_2 med varianser σ12,σ22\sigma_1^2,\sigma_2^2 til én forventningsrett estimator wθ^1+(1w)θ^2w\hat\theta_1+(1-w)\hat\theta_2, oppnås minst varians ved å vekte omvendt proporsjonalt med variansene: w=σ22σ12+σ22w=\dfrac{\sigma_2^2}{\sigma_1^2+\sigma_2^2}. Den mest presise estimatoren får størst vekt.

✏️Eksempel 4: Optimal kombinasjon av to estimatorer (sjanger B)

To laboratorier måler samme størrelse θ\theta uavhengig og forventningsrett: θ^1\hat\theta_1 med Var(θ^1)=2\text{Var}(\hat\theta_1)=2 og θ^2\hat\theta_2 med Var(θ^2)=5\text{Var}(\hat\theta_2)=5 (samme enhet). Finn vekten ww i θ^=wθ^1+(1w)θ^2\hat\theta=w\hat\theta_1+(1-w)\hat\theta_2 som gir minst varians, og angi den minste variansen.

Kombinasjonen er forventningsrett for enhver ww (fordi w+(1w)=1w+(1-w)=1). Variansen er

Var(θ^)=w22+(1w)25.\text{Var}(\hat\theta)=w^2\cdot 2+(1-w)^2\cdot 5.

Deriver og sett lik null: ddw=4w10(1w)=14w10=0w=1014=570,714\displaystyle \frac{d}{dw}=4w-10(1-w)=14w-10=0\Rightarrow w=\tfrac{10}{14}=\tfrac57\approx0{,}714. Dette stemmer med invers-varians-formelen w=52+5=57w=\dfrac{5}{2+5}=\dfrac57. Minste varians:

Var(θ^)=(57)2 ⁣2+(27)2 ⁣5=5049+2049=7049=1071,43.\text{Var}(\hat\theta)=\left(\tfrac57\right)^2\!\cdot2+\left(\tfrac27\right)^2\!\cdot5=\tfrac{50}{49}+\tfrac{20}{49}=\tfrac{70}{49}=\tfrac{10}{7}\approx1{,}43.

Legg merke til at 1,431{,}43 er mindre enn begge de opprinnelige variansene (22 og 55) — å kombinere lønner seg alltid.

📝Oppgave 4

To uavhengige, forventningsrette estimatorer for θ\theta har Var(θ^1)=3\text{Var}(\hat\theta_1)=3 og Var(θ^2)=6\text{Var}(\hat\theta_2)=6. Finn den vekten ww i θ^=wθ^1+(1w)θ^2\hat\theta=w\hat\theta_1+(1-w)\hat\theta_2 som minimerer variansen, og regn ut den minste variansen.

Løkke 3 — MSE når estimatoren er skjev (~13 min)

Sammenligning på varians alene forutsetter at begge estimatorene er forventningsrette. Men noen ganger er en litt skjev estimator faktisk bedre — fordi den spriker mye mindre. For å veie bom mot spredning i ett tall bruker vi middels kvadratisk feil (MSE).

Middels kvadratisk feil (MSE)
Middels kvadratisk feil er forventet kvadrert avstand mellom estimatoren og parameteren:

MSE(Θ^)=E ⁣[(Θ^θ)2].\text{MSE}(\hat\Theta)=E\!\left[(\hat\Theta-\theta)^2\right].

Den straffer både spredning og systematisk bom, og er det riktige sammenligningsmålet når estimatorene ikke begge er forventningsrette. Mindre MSE er bedre.

Skjevhet–varians-dekomponeringen
MSE splittes alltid i varians pluss skjevhet i annen:

MSE(Θ^)=Var(Θ^)+b(Θ^)2.\text{MSE}(\hat\Theta)=\text{Var}(\hat\Theta)+b(\hat\Theta)^2.

For en forventningsrett estimator (b=0b=0) er MSE=Var\text{MSE}=\text{Var}. Formelen viser avveiingen: en liten skjevhet kan lønne seg hvis den kjøper en stor variansreduksjon. Utledning: E[(Θ^θ)2]=E[(Θ^EΘ^)2]+(EΘ^θ)2E[(\hat\Theta-\theta)^2]=E[(\hat\Theta-E\hat\Theta)^2]+(E\hat\Theta-\theta)^2, der krysstoget forsvinner fordi E[Θ^EΘ^]=0E[\hat\Theta-E\hat\Theta]=0.

Estimator-sammenligning på MSE

Når minst én estimator er skjev, sammenlignes de på MSE, ikke varians: velg den med minst Var+b2\text{Var}+b^2. Å sammenligne en skjev og en forventningsrett estimator på varians alene er en klassisk feil — variansen ser da lav ut nettopp fordi estimatoren jukser mot en gal verdi.

Et slående eksempel: blant alle estimatorer på formen c(XiXˉ)2c\sum(X_i-\bar X)^2 for normalvariansen σ2\sigma^2 er verken S2S^2 (divisor n1n-1) eller ML-estimatoren (divisor nn) den med minst MSE — det er en enda mer skjev estimator.

Intuisjon: ved å krympe estimatoren litt ekstra (mindre cc) ofrer du litt forventningsretthet, men kutter variansen mer enn skjevheten koster. MSE-optimum ligger derfor ved en bevisst skjev estimator.

✏️Eksempel 5: Skjev estimator med minst MSE (sjanger B, eksamensnivå)

La X1,,XnX_1,\dots,X_n være uavhengige N(μ,σ2)N(\mu,\sigma^2) og W=i=1n(XiXˉ)2W=\sum_{i=1}^n(X_i-\bar X)^2. Fra formelsamlingen: W/σ2χn12W/\sigma^2\sim\chi^2_{n-1}, så E(W)=(n1)σ2E(W)=(n-1)\sigma^2 og Var(W)=2(n1)σ4\text{Var}(W)=2(n-1)\sigma^4 (en χ2\chi^2 med kk frihetsgrader har varians 2k2k). Blant estimatorene σ^c2=cW\hat\sigma^2_c=cW, finn cc som minimerer MSE, og sammenlign med S2S^2 og ML-estimatoren for n=6n=6, σ2=4\sigma^2=4.

Skjevhet og varians for σ^c2=cW\hat\sigma^2_c=cW:

b(c)=E(cW)σ2=[c(n1)1]σ2,Var(cW)=c22(n1)σ4.b(c)=E(cW)-\sigma^2=[c(n-1)-1]\sigma^2, \qquad \text{Var}(cW)=c^2\cdot 2(n-1)\sigma^4.

MSE (i enheter av σ4\sigma^4), med k=n1k=n-1:

MSE(c)/σ4=2kc2+(ck1)2.\text{MSE}(c)/\sigma^4=2k\,c^2+(ck-1)^2.

Deriver med hensyn på cc og sett lik null: 4kc+2k(ck1)=02c+ck1=0c=1k+2=1n+14kc+2k(ck-1)=0\Rightarrow 2c+ck-1=0\Rightarrow c=\dfrac{1}{k+2}=\dfrac{1}{n+1}.

Så den MSE-optimale estimatoren er 1n+1(XiXˉ)2\dfrac{1}{n+1}\sum(X_i-\bar X)^2skjev (den deler på n+1n+1). For n=6n=6, σ2=4\sigma^2=4 (altså σ4=16\sigma^4=16):

EstimatorccMSE
S2S^2 (forventningsrett)1/51/56,406{,}40
ML (1/n1/n)1/61/64,894{,}89
MSE-optimal (1/(n+1)1/(n+1))1/71/74,574{,}57

Den forventningsrette S2S^2 har størst MSE av de tre; den bevisst skjeve 1/(n+1)1/(n+1)-estimatoren har minst. Poeng: forventningsretthet er ikke alltid det samme som «best» — MSE avgjør.
📝Oppgave 5

To estimatorer for θ\theta: θ^A\hat\theta_A er forventningsrett med Var(θ^A)=9\text{Var}(\hat\theta_A)=9; θ^B\hat\theta_B har skjevhet b(θ^B)=2b(\hat\theta_B)=2 og Var(θ^B)=4\text{Var}(\hat\theta_B)=4.

a) Regn ut MSE for begge.

b) Hvilken foretrekker du, og hvorfor er varians-sammenligning her misvisende?

Løkke 4 — Konsistens (~14 min)

Den siste egenskapen handler om hva som skjer når utvalget vokser: en god estimator bør nærme seg sannheten når nn\to\infty. Dette er konsistens, og standardverktøyet for å vise det er Tsjebysjeffs ulikhet.

Konvergens i sannsynlighet
En følge estimatorer Θ^n\hat\Theta_n konvergerer i sannsynlighet mot θ\theta, skrevet Θ^nPθ\hat\Theta_n\xrightarrow{P}\theta, dersom for enhver toleranse ε>0\varepsilon>0:

P ⁣(Θ^nθε)0na˚n.P\!\left(|\hat\Theta_n-\theta|\ge\varepsilon\right)\to 0 \quad \text{når } n\to\infty.

Med andre ord: sannsynligheten for å bomme mer enn en vilkårlig liten ε\varepsilon dør ut når utvalget vokser.

Tsjebysjeffs ulikhet
For en tilfeldig variabel YY med endelig varians og enhver ε>0\varepsilon>0:

P ⁣(YE(Y)ε)Var(Y)ε2.P\!\left(|Y-E(Y)|\ge\varepsilon\right)\le\frac{\text{Var}(Y)}{\varepsilon^2}.

Ulikheten binder sannsynligheten for et stort avvik til variansen — jo mindre varians, desto mindre sjanse for å bomme mye. Det er broen fra «variansen går mot 0» til «estimatoren treffer».

Konsistens

En estimator Θ^n\hat\Theta_n er konsistent for θ\theta dersom Θ^nPθ\hat\Theta_n\xrightarrow{P}\theta når nn\to\infty. Tommelfingerregel (den du bruker på eksamen): er estimatoren forventningsrett (eller asymptotisk forventningsrett) og Var(Θ^n)0\text{Var}(\hat\Theta_n)\to0, så er den konsistent. Da går nemlig MSE0\text{MSE}\to0, og Tsjebysjeff gir resten.

Utledningen sensor vil se (bruk Tsjebysjeff på Θ^n\hat\Theta_n målt mot θ\theta via MSE):

P ⁣(Θ^nθε)E[(Θ^nθ)2]ε2=MSE(Θ^n)ε2=Var(Θ^n)+b(Θ^n)2ε2.P\!\left(|\hat\Theta_n-\theta|\ge\varepsilon\right)\le\frac{E[(\hat\Theta_n-\theta)^2]}{\varepsilon^2}=\frac{\text{MSE}(\hat\Theta_n)}{\varepsilon^2}=\frac{\text{Var}(\hat\Theta_n)+b(\hat\Theta_n)^2}{\varepsilon^2}.

Intuisjon: høyresiden er en øvre grense for bomsannsynligheten. Går både variansen og skjevheten mot 0, går hele brøken mot 0 for enhver fast ε\varepsilon — altså konsistens. Dette er den korte, komplette begrunnelsen. (Den generelle formen av Tsjebysjeff-ulikheten med E(Y)E(Y) erstattet av θ\theta og Var\text{Var} erstattet av MSE holder fordi E[(Θ^nθ)2]E[(\hat\Theta_n-\theta)^2] per definisjon er MSE.)

✏️Eksempel 6: Utvalgsgjennomsnittet er konsistent (sjanger B)

La X1,,XnX_1,\dots,X_n være uavhengige med E(Xi)=μE(X_i)=\mu og Var(Xi)=σ2<\text{Var}(X_i)=\sigma^2<\infty. Vis at Xˉ\bar X er en konsistent estimator for μ\mu.

To ting: Xˉ\bar X er forventningsrett (E(Xˉ)=μE(\bar X)=\mu, skjevhet 0), og Var(Xˉ)=σ2/n0\text{Var}(\bar X)=\sigma^2/n\to0 når nn\to\infty. Dermed er MSE(Xˉ)=σ2/n+00\text{MSE}(\bar X)=\sigma^2/n+0\to0. Tsjebysjeff gir da for enhver ε>0\varepsilon>0:

P ⁣(Xˉμε)σ2/nε20.P\!\left(|\bar X-\mu|\ge\varepsilon\right)\le\frac{\sigma^2/n}{\varepsilon^2}\to 0.

Altså XˉPμ\bar X\xrightarrow{P}\muXˉ\bar X er konsistent. (Dette er selve loven om store tall, utledet via Tsjebysjeff.)

📝Oppgave 6

En estimator θ^n\hat\theta_n har E(θ^n)=θ+3nE(\hat\theta_n)=\theta+\dfrac{3}{n} og Var(θ^n)=5n\text{Var}(\hat\theta_n)=\dfrac{5}{n}.

a) Er θ^n\hat\theta_n forventningsrett? Er den asymptotisk forventningsrett?

b) Vis at θ^n\hat\theta_n er konsistent.

Blandet drill (sjanger B, stigende)

📝Oppgave 7

Forklar med én setning hver forskjellen på: a) estimator og estimat; b) forventningsrett og konsistent.

📝Oppgave 8
X1,,XnX_1,\dots,X_n er uavhengige med E(Xi)=θE(X_i)=\theta og Var(Xi)=θ2\text{Var}(X_i)=\theta^2 (variansen avhenger av θ\theta). Betrakt Xˉ\bar X.

a) Vis at Xˉ\bar X er forventningsrett for θ\theta.

b) Finn Var(Xˉ)\text{Var}(\bar X) og vis at Xˉ\bar X er konsistent.

📝Oppgave 9

En forventningsrett estimator θ^1\hat\theta_1 har varians σ2/n\sigma^2/n. En konkurrent θ^2=nn+1θ^1\displaystyle \hat\theta_2=\frac{n}{n+1}\hat\theta_1 krymper den litt.

a) Finn skjevheten til θ^2\hat\theta_2.

b) Uttrykk MSE(θ^2)\text{MSE}(\hat\theta_2) ved σ2,n,θ\sigma^2,n,\theta.

📝Oppgave 10

(Kald oppgave — momentliste som fasit.) X1,,XnX_1,\dots,X_n er uavhengige N(μ,σ2)N(\mu,\sigma^2). Sammenlign ML-variansestimatoren σ^2=1n(XiXˉ)2\displaystyle \hat\sigma^2=\frac1n\sum(X_i-\bar X)^2 og S2=1n1(XiXˉ)2\displaystyle S^2=\frac{1}{n-1}\sum(X_i-\bar X)^2 som estimatorer for σ2\sigma^2: forventningsrett/skjev, og hvem har minst MSE? Bruk Var(W)=2(n1)σ4\text{Var}(W)=2(n-1)\sigma^4 der W=(XiXˉ)2W=\sum(X_i-\bar X)^2.

Begrepsbank

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet. Korte, navngitte definisjoner du kan pugge til eksamen.
Utvalgsgjennomsnittet Xˉ\bar X
Xˉ=1ni=1nXi\displaystyle \bar X=\frac1n\sum_{i=1}^n X_i — den forventningsrette, konsistente og mest effisiente estimatoren for forventningen μ\mu når vektene skal summere til 1. Grunnbyggesteinen i nesten all inferens.
ML-variansestimatoren (divisor nn)
σ^2=1n(XiXˉ)2\displaystyle \hat\sigma^2=\frac1n\sum(X_i-\bar X)^2 — maximum-likelihood-estimatoren for σ2\sigma^2 (kap. 1.2). Skjev med b=σ2/nb=-\sigma^2/n, men konsistent og med mindre MSE enn S2S^2 i normalmodellen.
Skjevhetskorreksjon

Å gange en skjev estimator med en konstant som fjerner skjevheten. Har Θ^\hat\Theta forventning kθk\theta, er 1kΘ^\displaystyle \frac1k\hat\Theta forventningsrett. Eksempel: S2=nn1σ^2\displaystyle S^2=\frac{n}{n-1}\hat\sigma^2.

Asymptotisk forventningsrett

En estimator er asymptotisk forventningsrett dersom skjevheten går mot 0 når nn\to\infty: b(Θ^n)0b(\hat\Theta_n)\to0. Svakere krav enn forventningsrett, men nok (sammen med Var0\text{Var}\to0) for konsistens.

Utvalgsfordeling (samplingfordeling)

Fordelingen til en estimator over alle mulige utvalg av størrelse nn. Estimatorens forventning og varians er forventning og varians i denne fordelingen — ikke i datafordelingen.

Relativ effisiens

Forholdet mellom variansene til to forventningsrette estimatorer, Var(Θ^2)/Var(Θ^1)\text{Var}(\hat\Theta_2)/\text{Var}(\hat\Theta_1). Er forholdet >1>1, er Θ^1\hat\Theta_1 mer effisient. Et tall på hvor mye informasjon den dårligere estimatoren kaster bort.

Minimum-varians forventningsrett estimator (MVUE)

Den forventningsrette estimatoren med aller minst varians blant alle forventningsrette. ML-estimatoren når ofte denne grensen i store utvalg. Nedre grense for variansen gis av Cramér–Rao (kap. 1.3). (Prioritet: kjenne til.)

Presisjon

Den inverse variansen 1/Var(Θ^)1/\text{Var}(\hat\Theta). Høy presisjon = liten varians. Invers-varians-vekting er å vekte hver estimator med sin presisjon.

Estimeringsfeil

Differansen Θ^θ\hat\Theta-\theta mellom estimator og sann parameter — selv en tilfeldig variabel med forventning b(Θ^)b(\hat\Theta) og varians Var(Θ^)\text{Var}(\hat\Theta). MSE er forventet kvadrert estimeringsfeil.

Nedre variansgrense (Cramér–Rao)

Ingen forventningsrett estimator kan ha mindre varians enn 1/(nI(θ))1/(nI(\theta)), der I(θ)I(\theta) er Fisher-informasjonen (kap. 1.3). Setter en teoretisk bunn for hvor presis en forventningsrett estimator kan være. (Prioritet: kjenne til — utdypes i kap. 1.3.)

Konvensjon: stor mot liten bokstav

Gjennom hele boka: store bokstaver (XX, Xˉ\bar X, Θ^\hat\Theta, S2S^2) er tilfeldige variabler; små bokstaver (xx, xˉ\bar x, θ^\hat\theta) er observerte tall. Denne konvensjonen er selve skillet estimator/estimat og et fast sensorpoeng.

Loven om store tall (via konsistens)

At XˉPμ\bar X\xrightarrow{P}\mu når nn\to\infty — utvalgsgjennomsnittet konvergerer mot forventningen. I denne boka utledes den som et spesialtilfelle av konsistens via Tsjebysjeff (eksempel 6).

Rimelighetskrav til estimat

Et estimat skal ligge i parameterens gyldige område (en varians 0\ge0, en sannsynlighet i [0,1][0,1]). Ligger estimatet utenfor, er noe galt — en billig, men effektiv selvsjekk sensor forventer.

Symbol- og formelliste
Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.