Tilbake
1.3

1.3 Fisher-informasjon, MLE-asymptotikk, Wald-KI og Cramér–Rao

Fisher-informasjonen I(θ), MLE-ens tilnærmede normalfordeling N(θ,1/(nI(θ))), Wald-konfidensintervallet og Cramér–Raos nedre grense — det som skiller A-besvarelsen.

60 min
14 oppgaver
Fisher-informasjonMLE-asymptotikkWald-KICramér–Rao
Din fremgang i kapitlet
0 / 14 oppgaver
Forkunnskaper: Dette kapitlet bygger rett på ML-kjeden i kap. 1.2 (likelihood LL, log-likelihood \ell, score s=s=\ell' og maksimumsbekreftelsen <0\ell''<0) og estimator-egenskapene i kap. 1.1 (forventningsretthet, varians, konsistens). Den andrederiverte \ell'' fra kap. 1.2 er selve råstoffet for Fisher-informasjonen.

Normaltilnærmingen hviler på sentralgrenseteoremet og de CLT-baserte konfidensintervallene fra STK1100 kap. 6.2 CLT-tilnærmet konfidensintervall (→ stk1100-6-2), og ML-grunnlaget fra STK1100 kap. 5.2 Maximum likelihood og momentmetoden (→ stk1100-5-2) (klartekst — STK1100 er ikke bygget ennå). Trenger du å friske opp derivasjon og forventning som integral, se R2 2.4 Bestemt integral og R1 4.1 Derivasjonsregler.

Sist du var her (fra kap. 1.2 — nøkkelformlene du trenger nå):

(θ)=i=1nlogf(xi;θ),s(θ)=(θ),(θ^)<0.\ell(\theta)=\sum_{i=1}^n\log f(x_i;\theta),\qquad s(\theta)=\ell'(\theta),\qquad \ell''(\hat\theta)<0.

Du deriverte log-likelihood to ganger for å bekrefte maksimum. Den samme andrederiverte \ell'' er byggesteinen i dette kapitlet: tar du forventningen av -\ell'' og snur fortegnet, får du Fisher-informasjonen. ML-estimatoren θ^\hat\theta (f.eks. Xˉ\bar X for Poisson, 1/Xˉ1/\bar X for eksponential) er punktet vi nå skal sette usikkerhet på.

ML-estimatoren gir deg et tall. Men eksamen — og virkeligheten — spør: hvor sikkert er det tallet? Svaret ligger i hvor skarp toppen på log-likelihood-kurven er. En spiss topp betyr at dataene peker tydelig på én verdi (liten usikkerhet); en flat topp betyr stor usikkerhet.

Fisher-informasjonen måler nettopp denne skarpheten — den forventede krumningen i toppen. Jo mer informasjon, jo mindre varians, jo smalere konfidensintervall. Dette kapitlet knytter sammen fire ting som henger uløselig sammen: informasjonen I(θ)I(\theta), ML-estimatorens tilnærmede normalfordeling, Wald-konfidensintervallet og Cramér–Raos teoretiske grense for hvor godt det i det hele tatt går an å estimere.

Kapitlet går i seks løkker: Fisher-info → asymptotisk fordeling → standardfeil → Wald-KI → asymmetrisk pivot → Cramér–Rao og invarians. Hver løkke: teori → gjennomregnet eksempel → øvingsoppgave.

Løkke 1 — Fisher-informasjonen (~12 min)

Fisher-informasjonen I(θ)I(\theta)
Fisher-informasjonen måler hvor mye én observasjon i gjennomsnitt forteller om parameteren — den forventede krumningen (nedadbøyningen) av log-likelihood i det sanne punktet. Formelt er den den forventede negative andrederiverte av log-tettheten:

I(θ)=E ⁣[2θ2logf(X;θ)].I(\theta)=-E\!\left[\frac{\partial^2}{\partial\theta^2}\log f(X;\theta)\right].

Stor I(θ)I(\theta) = skarp topp = presis estimering. Merk store XX: vi tar forventning over den stokastiske variabelen, så I(θ)I(\theta) blir et tall som avhenger bare av θ\theta, ikke av de konkrete dataene.

Hvorfor krumning = informasjon (utledes):

1. Toppen av (θ)\ell(\theta) ligger der scoren er null. Nær toppen buer kurven nedover, så den andrederiverte (θ)\ell''(\theta) er negativ.
Intuisjon: en spiss topp (sterkt negativ \ell'') betyr at log-likelihood faller raskt når du beveger deg vekk fra ML-verdien — dataene «insisterer» på verdien.
2. For én observasjon er krumningen 2θ2logf(X;θ)\displaystyle \frac{\partial^2}{\partial\theta^2}\log f(X;\theta) selv stokastisk (den avhenger av XX). Vi tar forventningen for å få et fast mål og snur fortegnet så tallet blir positivt:
I(θ)=E ⁣[2θ2logf(X;θ)].I(\theta)=-E\!\left[\frac{\partial^2}{\partial\theta^2}\log f(X;\theta)\right].
Intuisjon: gjennomsnittlig hvor spiss toppen er, målt som en positiv informasjonsmengde.
3. Det finnes en ekvivalent form via variansen av scoren (neste definisjon), som ofte er lettere å regne.

Fisher-informasjonen som score-varians
Fisher-informasjonen kan også regnes som variansen av scoren i én observasjon:

I(θ)=E ⁣[(θlogf(X;θ))2]=Var ⁣(θlogf(X;θ)).I(\theta)=E\!\left[\left(\frac{\partial}{\partial\theta}\log f(X;\theta)\right)^2\right]=\operatorname{Var}\!\left(\frac{\partial}{\partial\theta}\log f(X;\theta)\right).

De to formlene gir alltid samme svar (under regularitetsbetingelsene), fordi scoren har forventning null. Velg den som er lettest å regne for din tetthet — andrederivert-formen er vanligst på eksamen.

Informasjonen i hele utvalget In(θ)I_n(\theta)
Informasjonen i hele utvalget er additiv: nn uavhengige observasjoner gir nn ganger informasjonen i én:

In(θ)=nI(θ).I_n(\theta)=n\,I(\theta).

Dette er nøkkelen til hvorfor mer data gir mindre usikkerhet — informasjonen vokser lineært med nn, og variansen til ML-estimatoren (neste løkke) er nettopp 1/In(θ)1/I_n(\theta). Bland aldri I(θ)I(\theta) (én observasjon) med In(θ)=nI(θ)I_n(\theta)=nI(\theta) (hele utvalget) — en klassisk trekkbelastning.

✏️Eksempel 1: Fisher-informasjon for Poisson (sjanger C)

Antall skader per forsikringsavtale er Poisson(λ)(\lambda) med punktsannsynlighet f(x;λ)=eλλx/x!f(x;\lambda)=e^{-\lambda}\lambda^x/x!. Finn Fisher-informasjonen I(λ)I(\lambda) i én observasjon og In(λ)I_n(\lambda) for nn observasjoner.

logf=λ+xlogλlogx!\log f=-\lambda+x\log\lambda-\log x!.

Førstederivert (score): λlogf=1+xλ\dfrac{\partial}{\partial\lambda}\log f=-1+\dfrac{x}{\lambda}.

Andrederivert: 2λ2logf=xλ2\dfrac{\partial^2}{\partial\lambda^2}\log f=-\dfrac{x}{\lambda^2}.

Ta forventning og snu fortegn (bruk E(X)=λE(X)=\lambda):
I(λ)=E ⁣[Xλ2]=E(X)λ2=λλ2=1λ.I(\lambda)=-E\!\left[-\frac{X}{\lambda^2}\right]=\frac{E(X)}{\lambda^2}=\frac{\lambda}{\lambda^2}=\frac{1}{\lambda}.

For hele utvalget: In(λ)=nI(λ)=nλI_n(\lambda)=nI(\lambda)=\dfrac{n}{\lambda}. Merk: stor λ\lambda (mye spredning) gir lavere informasjon per observasjon.

📝Oppgave 1

Levetider er eksponentialfordelte med rate λ\lambda, f(x;λ)=λeλxf(x;\lambda)=\lambda e^{-\lambda x}, x>0x>0 (husk E(X)=1/λE(X)=1/\lambda). Finn Fisher-informasjonen I(λ)I(\lambda) i én observasjon og In(λ)I_n(\lambda).

Løkke 2 — ML-estimatorens asymptotiske fordeling (~10 min)

ML-estimatorens asymptotiske fordeling
Under regularitetsbetingelsene er maximum-likelihood-estimatoren tilnærmet normalfordelt i store utvalg, sentrert på den sanne verdien, med varians lik den inverse utvalgsinformasjonen:

θ^  ca.  N ⁣(θ, 1nI(θ))(n stor).\hat\theta \;\overset{\text{ca.}}{\sim}\; N\!\left(\theta,\ \frac{1}{nI(\theta)}\right)\qquad(n \text{ stor}).

Dette er grunnlaget for Wald-konfidensintervallet. Bruker du normaltilnærmingen, må du nevne at det er denne ML-asymptotikken (sentralgrenseteoremet) som gjelder (sensorkrav §4.4). Andre argument i N(,)N(\cdot,\cdot) er variansen, aldri standardavviket.

✏️Eksempel 2: Asymptotisk fordeling for Poisson (sjanger C)

For Poisson(λ)(\lambda) er ML-estimatoren λ^=Xˉ\hat\lambda=\bar X (kap. 1.2) og I(λ)=1/λI(\lambda)=1/\lambda (eksempel 1). Angi den tilnærmede fordelingen til λ^\hat\lambda for stor nn.

ML-asymptotikken gir
λ^ca.N ⁣(λ,1nI(λ))=N ⁣(λ,λn).\hat\lambda\overset{\text{ca.}}{\sim}N\!\left(\lambda,\frac{1}{nI(\lambda)}\right)=N\!\left(\lambda,\frac{\lambda}{n}\right).
Her stemmer tilnærmingen med det eksakte: E(Xˉ)=λE(\bar X)=\lambda og Var(Xˉ)=λ/n\operatorname{Var}(\bar X)=\lambda/n nøyaktig. Poeng til sensor: si eksplisitt at normalformen følger av ML-asymptotikken/sentralgrenseteoremet — ikke bare «Xˉ\bar X er normal».
📝Oppgave 2

Data er eksponentialfordelte med rate λ\lambda og I(λ)=1/λ2I(\lambda)=1/\lambda^2 (oppgave 1), med ML-estimator λ^=1/Xˉ\hat\lambda=1/\bar X. Angi den tilnærmede fordelingen til λ^\hat\lambda for stor nn, og skriv variansen ut.

Løkke 3 — Standardfeil og Wald-konfidensintervall (~12 min)

Standardfeilen se(θ^)se(\hat\theta)
Standardfeilen til en estimator er det estimerte standardavviket — anslaget på hvor mye θ^\hat\theta typisk bommer. For en ML-estimator setter vi den estimerte informasjonen i stedet for den sanne (plugg inn θ^\hat\theta):

se(θ^)=1nI(θ^).se(\hat\theta)=\sqrt{\frac{1}{nI(\hat\theta)}}.

Dette er varians\sqrt{\text{varians}}, men med θ\theta erstattet av estimatet fordi den sanne θ\theta er ukjent. Standardfeilen er byggesteinen i Wald-intervallet.

Wald-konfidensintervallet
Wald-konfidensintervallet tar ML-estimatorens tilnærmede normalfordeling og legger på ±\pm et kvantilantall standardfeil. Et tilnærmet (1α)(1-\alpha)-intervall for θ\theta er

θ^±zα/2se(θ^),se(θ^)=1nI(θ^).\hat\theta \pm z_{\alpha/2}\,se(\hat\theta),\qquad se(\hat\theta)=\sqrt{\frac{1}{nI(\hat\theta)}}.

zα/2z_{\alpha/2} er øvre α/2\alpha/2-kvantil i standardnormalen (z0,025=1,96z_{0{,}025}=1{,}96 for 95 %). Koble alltid variansen eksplisitt til 1/(nI(θ))1/(nI(\theta)) — det er det sensor ser etter (§4.4).

Hvorfor formen θ^±zα/2se\hat\theta\pm z_{\alpha/2}\,se (utledes):

1. Start med pivoten θ^θse(θ^)ca.N(0,1)\dfrac{\hat\theta-\theta}{se(\hat\theta)}\overset{\text{ca.}}{\sim}N(0,1).
Intuisjon: standardiser ML-estimatoren — trekk fra forventningen, del på standardfeilen.
2. En standardnormal ligger mellom zα/2-z_{\alpha/2} og zα/2z_{\alpha/2} med sannsynlighet 1α1-\alpha:
P ⁣(zα/2θ^θsezα/2)1α.P\!\left(-z_{\alpha/2}\le \frac{\hat\theta-\theta}{se}\le z_{\alpha/2}\right)\approx 1-\alpha.
Intuisjon: zα/2z_{\alpha/2} kutter av α/2\alpha/2 i hver hale.
3. Løs ulikheten for θ\theta (med sese behandlet som en fast størrelse): θ^zα/2seθθ^+zα/2se\hat\theta-z_{\alpha/2}se\le\theta\le\hat\theta+z_{\alpha/2}se.
Intuisjon: det gir det symmetriske Wald-intervallet.

✏️Eksempel 3: Wald-intervall for Poisson-rate (sjanger D)

Antall skader per avtale er Poisson(λ)(\lambda). Du observerer n=40n=40 avtaler med gjennomsnitt xˉ=3,5\bar x=3{,}5 skader. Konstruer et 95 % Wald-konfidensintervall for λ\lambda.

ML-estimatet er λ^=xˉ=3,5\hat\lambda=\bar x=3{,}5. Informasjonen er I(λ)=1/λI(\lambda)=1/\lambda, så
se(λ^)=1nI(λ^)=λ^n=3,540=0,296.se(\hat\lambda)=\sqrt{\frac{1}{nI(\hat\lambda)}}=\sqrt{\frac{\hat\lambda}{n}}=\sqrt{\frac{3{,}5}{40}}=0{,}296.
Med z0,025=1,96z_{0{,}025}=1{,}96:
3,5±1,960,296=3,5±0,580=[2,92, 4,08].3{,}5 \pm 1{,}96\cdot 0{,}296 = 3{,}5 \pm 0{,}580 = [2{,}92,\ 4{,}08].
Prosedyren fanger den sanne raten i 95 % av gjentatte utvalg; her gir den [2,92, 4,08][2{,}92,\ 4{,}08] skader per avtale. Nevn at normalformen bak intervallet er ML-asymptotikken.
📝Oppgave 3

I et utvalg på n=200n=200 enheter er andelen defekte p^=0,30\hat p=0{,}30. For Bernoulli(p)(p) er I(p)=1/[p(1p)]I(p)=1/[p(1-p)]. Konstruer et 95 % Wald-intervall for pp.

Løkke 4 — Asymmetrisk pivot-form (~10 min)

Asymmetrisk (pivot-basert) Wald-intervall
Asymmetrisk Wald-intervall. Når standardfeilen selv avhenger av parameteren — seθse\propto\theta — er det mer presist å beholde den sanne θ\theta i pivoten i stedet for å plugge inn θ^\hat\theta. For eksponentialmodellen (forventning θ\theta, I(θ)=1/θ2I(\theta)=1/\theta^2, så standardavviket er θ/n\theta/\sqrt n) gir pivoten θ^θθ/n\dfrac{\hat\theta-\theta}{\theta/\sqrt n} intervallet

[θ^1+zα/2/n, θ^1zα/2/n].\left[\frac{\hat\theta}{1+z_{\alpha/2}/\sqrt n},\ \frac{\hat\theta}{1-z_{\alpha/2}/\sqrt n}\right].

Dette er asymmetrisk om θ^\hat\theta — og det er et trekk, ikke en feil (§4.7). Den symmetriske Wald-formen er en grovere tilnærming, og kan gi negative grenser for en positiv parameter.

Utledning (eksponential, se=θ/nse=\theta/\sqrt n; skriv z=zα/2z=z_{\alpha/2}):

1. Behold sann θ\theta i nevneren: zθ^θθ/nz-z\le\dfrac{\hat\theta-\theta}{\theta/\sqrt n}\le z.
Intuisjon: vi standardiserer med den ekte usikkerheten, ikke den estimerte.
2. Venstre ulikhet: θ^θzθ/nθ^θ(1+z/n)θθ^1+z/n\hat\theta-\theta\le z\theta/\sqrt n\Rightarrow \hat\theta\le\theta(1+z/\sqrt n)\Rightarrow \theta\ge\dfrac{\hat\theta}{1+z/\sqrt n}.
3. Høyre ulikhet: θ^θzθ/nθ^θ(1z/n)θθ^1z/n\hat\theta-\theta\ge -z\theta/\sqrt n\Rightarrow \hat\theta\ge\theta(1-z/\sqrt n)\Rightarrow \theta\le\dfrac{\hat\theta}{1-z/\sqrt n}.
Intuisjon: de to grensene deler ikke θ^\hat\theta likt — nedre og øvre ende skyves ulikt.

Sammen: [θ^1+z/n, θ^1z/n]\left[\dfrac{\hat\theta}{1+z/\sqrt n},\ \dfrac{\hat\theta}{1-z/\sqrt n}\right]. (Den eksakte χ2\chi^2-pivoten for samme modell kommer i kap. 2.5.)

✏️Eksempel 4: Symmetrisk mot asymmetrisk Wald (sjanger D, eksamensnivå)

Ventetider (minutter) er eksponentialfordelte med forventning θ\theta, f(x;θ)=1θex/θ\displaystyle f(x;\theta)=\frac1\theta e^{-x/\theta}, og I(θ)=1/θ2I(\theta)=1/\theta^2. Du har n=25n=25 observasjoner med xˉ=8,0\bar x=8{,}0. Gi (a) det symmetriske og (b) det asymmetriske 95 % Wald-intervallet for θ\theta, og kommentér forskjellen.

ML: θ^=xˉ=8,0\hat\theta=\bar x=8{,}0. se(θ^)=1/(nI(θ^))=θ^/n=8/5=1,6se(\hat\theta)=\sqrt{1/(nI(\hat\theta))}=\hat\theta/\sqrt n=8/5=1{,}6. z/n=1,96/5=0,392z/\sqrt n=1{,}96/5=0{,}392.

a) Symmetrisk: 8,0±1,961,6=8,0±3,136=[4,86, 11,14]8{,}0\pm1{,}96\cdot1{,}6=8{,}0\pm3{,}136=[4{,}86,\ 11{,}14].

b) Asymmetrisk pivot: [81+0,392, 810,392]=[81,392, 80,608]=[5,75, 13,16]\left[\dfrac{8}{1+0{,}392},\ \dfrac{8}{1-0{,}392}\right]=\left[\dfrac{8}{1{,}392},\ \dfrac{8}{0{,}608}\right]=[5{,}75,\ 13{,}16].

Forskjell: det asymmetriske intervallet strekker seg lenger oppover (mot store θ\theta) og mindre nedover — riktig, siden usikkerheten vokser med θ\theta. Det symmetriske er en grovere approksimasjon. Begge er 95 %-intervall; det asymmetriske foretrekkes når sese avhenger av parameteren.

📝Oppgave 4

Bruk samme eksponentialmodell (se=θ/nse=\theta/\sqrt n) med n=16n=16 observasjoner og xˉ=5,0\bar x=5{,}0 timer.

a) Gi det symmetriske 95 % Wald-intervallet for θ\theta.

b) Gi det asymmetriske pivot-intervallet.

c) Hvilket er å foretrekke, og hvorfor?

Løkke 5 — Cramér–Rao og effisiens (~10 min)

Cramér–Raos nedre grense
Cramér–Raos nedre grense setter en teoretisk bunn for hvor liten variansen til en forventningsrett estimator kan bli. For enhver forventningsrett estimator TT for θ\theta gjelder

Var(T)1nI(θ)=1In(θ).\operatorname{Var}(T)\ge \frac{1}{nI(\theta)}=\frac{1}{I_n(\theta)}.

Ingen forventningsrett estimator kan slå denne grensen. Den er nøyaktig den variansen ML-estimatoren oppnår asymptotisk — derfor kan ingen gjøre det vesentlig bedre enn maximum likelihood i store utvalg.

Asymptotisk effisiens
Asymptotisk effisiens. En estimator er asymptotisk effisient hvis variansen når Cramér–Rao-grensen 1/(nI(θ))1/(nI(\theta)) når nn\to\infty. Maximum-likelihood-estimatoren er asymptotisk effisient under regularitetsbetingelsene — den henter i praksis ut all informasjonen dataene inneholder. Dette er hovedgrunnen til at ML er standardvalget.
✏️Eksempel 5: $\bar X$ oppnår Cramér–Rao-grensen (Poisson)

For Poisson(λ)(\lambda) er λ^=Xˉ\hat\lambda=\bar X forventningsrett med Var(Xˉ)=λ/n\operatorname{Var}(\bar X)=\lambda/n, og I(λ)=1/λI(\lambda)=1/\lambda. Vis at Xˉ\bar X oppnår Cramér–Rao-grensen, og forklar hva det betyr.

Cramér–Rao-grensen er 1nI(λ)=1n(1/λ)=λn\dfrac{1}{nI(\lambda)}=\dfrac{1}{n\cdot(1/\lambda)}=\dfrac{\lambda}{n}. Dette er nøyaktig Var(Xˉ)\operatorname{Var}(\bar X). Altså oppnår Xˉ\bar X grensen — den er en effisient estimator (ikke bare asymptotisk): ingen forventningsrett estimator for λ\lambda kan ha mindre varians. Derfor er det umulig å forbedre Xˉ\bar X i Poisson-modellen.

📝Oppgave 5

For eksponentialmodellen med forventning θ\theta er θ^=Xˉ\hat\theta=\bar X forventningsrett med Var(Xˉ)=θ2/n\operatorname{Var}(\bar X)=\theta^2/n, og I(θ)=1/θ2I(\theta)=1/\theta^2.

a) Finn Cramér–Rao-grensen.

b) Oppnår Xˉ\bar X den?

c) Hva forteller det deg?

Løkke 6 — Invarians: transformer Wald-intervallet (~8 min)

Invarians-transformasjon av et konfidensintervall
Invarians-transformasjon av et konfidensintervall. Er [L, U][L,\ U] et (1α)(1-\alpha)-intervall for θ\theta og ψ=g(θ)\psi=g(\theta) en monoton voksende funksjon, så er

[g(L), g(U)][\,g(L),\ g(U)\,]

et (1α)(1-\alpha)-intervall for ψ\psi — dekningsgraden bevares fordi gg er én-til-én. Er gg avtakende, bytter endepunktene plass: [g(U), g(L)][g(U),\ g(L)]. Punktestimatet transformeres samtidig ved invariansprinsippet (kap. 1.2): ψ^=g(θ^)\hat\psi=g(\hat\theta). Ingen ny ML- eller Fisher-regning trengs.

✏️Eksempel 6: Transformer intervallet til raten (sjanger C/D)

For eksponentialmodellen (forventning θ\theta) fant du 95 %-intervallet [4,86, 11,14][4{,}86,\ 11{,}14] for θ\theta (eksempel 4a), med θ^=8,0\hat\theta=8{,}0. Raten er λ=1/θ\lambda=1/\theta. Finn ML-estimatet og et 95 %-intervall for λ\lambda.

Invariansprinsippet gir punktestimatet λ^=1/θ^=1/8=0,125\hat\lambda=1/\hat\theta=1/8=0{,}125 per minutt. Funksjonen g(θ)=1/θg(\theta)=1/\theta er avtakende, så endepunktene bytter plass:
[111,14, 14,86]=[0,090, 0,206].\left[\frac{1}{11{,}14},\ \frac{1}{4{,}86}\right]=[0{,}090,\ 0{,}206].
Altså [0,090, 0,206][0{,}090,\ 0{,}206] for raten λ\lambda. Vi gjorde verken ny ML eller ny Fisher-regning — bare transformerte intervallet.
📝Oppgave 6

Fra samme modell har du 95 %-intervallet [2,55, 7,45][2{,}55,\ 7{,}45] for forventet ventetid θ\theta (oppgave 4a), θ^=5,0\hat\theta=5{,}0.

a) Finn ML-estimatet og et 95 %-intervall for logθ\log\theta.

b) Finn tilsvarende for raten λ=1/θ\lambda=1/\theta.

Blandet drill (sjanger C + D, stigende)

📝Oppgave 7

Data er N(μ,σ2)N(\mu,\sigma^2) med kjent σ2\sigma^2. Vis at Fisher-informasjonen om μ\mu i én observasjon er I(μ)=1/σ2I(\mu)=1/\sigma^2, og angi In(μ)I_n(\mu).

📝Oppgave 8

Vindstyrker er Rayleigh-fordelte, f(x;θ)=xθ2ex2/(2θ2)\displaystyle f(x;\theta)=\frac{x}{\theta^2}e^{-x^2/(2\theta^2)}, med E(X2)=2θ2E(X^2)=2\theta^2 og ML-estimator θ^=Xi2/(2n)\hat\theta=\sqrt{\sum X_i^2/(2n)} (kap. 1.2).

a) Vis at I(θ)=4/θ2I(\theta)=4/\theta^2.

b) Med n=30n=30 og θ^=4,0\hat\theta=4{,}0, gi et 95 % Wald-intervall for θ\theta.

📝Oppgave 9

(Krevende.) For Poisson(λ)(\lambda) er I(λ)=1/λI(\lambda)=1/\lambda. En kollega foreslår å estimere λ\lambda med bare den første observasjonen, T=X1T=X_1.

a) Er TT forventningsrett? Finn Var(T)\operatorname{Var}(T).

b) Sammenlign Var(T)\operatorname{Var}(T) med Cramér–Rao-grensen for nn observasjoner og med Var(Xˉ)\operatorname{Var}(\bar X).

c) Hva er den relative effisiensen til TT mot Xˉ\bar X?

📝Oppgave 10

(Kald oppgave — momentliste som fasit.) Data er eksponentialfordelte med rate λ\lambda, I(λ)=1/λ2I(\lambda)=1/\lambda^2, λ^=1/Xˉ\hat\lambda=1/\bar X. Med n=100n=100 og xˉ=4,0\bar x=4{,}0: sett opp den tilnærmede fordelingen til λ^\hat\lambda, regn standardfeilen, gi et 95 % Wald-intervall for λ\lambda, og transformer det til et intervall for forventet levetid θ=1/λ\theta=1/\lambda.

Begrepsbank

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet. Korte, navngitte definisjoner for eksamensrepetisjon.
Scorefunksjonen (repetisjon)
s(θ)=(θ)s(\theta)=\ell'(\theta), den deriverte av log-likelihood. Den har forventning null i det sanne punktet, og variansen av scoren er nettopp Fisher-informasjonen I(θ)I(\theta).
Observert informasjon

Den negative andrederiverte evaluert i estimatet, (θ^)-\ell''(\hat\theta) — et datavhengig mål på krumningen. Tar du forventningen (over XX) i stedet, får du Fisher-informasjonen In(θ)I_n(\theta). Observert informasjon brukes ofte i praksis som anslag på In(θ)I_n(\theta).

Regularitetsbetingelser

Vilkår (glatt tetthet, felles støtte uavhengig av θ\theta, parameter i det indre, mulig å bytte derivasjon og integrasjon) som gjør at Fisher-teorien og ML-asymptotikken holder. Brytes de (som for uniform på [0,θ][0,\theta]), gjelder ikke N(θ,1/(nI))N(\theta,1/(nI)). (Prioritet: kjenne til.)

Fisher-info: Poisson

For Poisson(λ)(\lambda) er I(λ)=1/λI(\lambda)=1/\lambda, så In(λ)=n/λI_n(\lambda)=n/\lambda og ML-variansen er λ/n\lambda/n — lik Var(Xˉ)\operatorname{Var}(\bar X).

Fisher-info: eksponential

For eksponential med rate λ\lambda er I(λ)=1/λ2I(\lambda)=1/\lambda^2; for samme fordeling parametrisert ved forventning θ=1/λ\theta=1/\lambda er også I(θ)=1/θ2I(\theta)=1/\theta^2. ML-variansen for θ\theta er θ2/n\theta^2/n.

Fisher-info: Bernoulli

For Bernoulli(p)(p) er I(p)=1p(1p)I(p)=\dfrac{1}{p(1-p)}, så se(p^)=p^(1p^)/nse(\hat p)=\sqrt{\hat p(1-\hat p)/n} — grunnlaget for andels-konfidensintervallet.

Fisher-info: normal (kjent varians)

For N(μ,σ2)N(\mu,\sigma^2) med kjent σ2\sigma^2 er I(μ)=1/σ2I(\mu)=1/\sigma^2, så In(μ)=n/σ2I_n(\mu)=n/\sigma^2 og Var(Xˉ)=σ2/n\operatorname{Var}(\bar X)=\sigma^2/n. Her er Xˉ\bar X eksakt normalfordelt, ikke bare tilnærmet.

Fisher-info: Rayleigh

For Rayleigh(θ)(\theta) er I(θ)=4/θ2I(\theta)=4/\theta^2, så se(θ^)=θ^/(2n)se(\hat\theta)=\hat\theta/(2\sqrt n). Standardeksempel på en «eksotisk» fordeling i estimeringsoppgaven.

zz-kvantilen zα/2z_{\alpha/2}

Øvre α/2\alpha/2-kvantil i standardnormalen: P(Z>zα/2)=α/2P(Z>z_{\alpha/2})=\alpha/2. For 95 % er z0,025=1,96z_{0{,}025}=1{,}96; for 90 % er z0,05=1,645z_{0{,}05}=1{,}645; for 99 % er z0,005=2,576z_{0{,}005}=2{,}576. Tosidige intervall bruker α/2\alpha/2 i hver hale.

Standardnormalen Φ\Phi
Φ\Phi er fordelingsfunksjonen til N(0,1)N(0,1): Φ(z)=P(Zz)\Phi(z)=P(Z\le z). Kvantilen zα/2z_{\alpha/2} er verdien med Φ(zα/2)=1α/2\Phi(z_{\alpha/2})=1-\alpha/2. Ligger i formelsamlingen (tren oppslag).
Konfidensnivå og dekningsgrad
(1α)(1-\alpha) er konfidensnivået; dekningsgraden er sannsynligheten for at prosedyren fanger den sanne parameteren over gjentatte utvalg. For Wald-intervall er dekningen tilnærmet (1α)(1-\alpha) (eksakt bare i grensen).
Tolkning av konfidensintervall

Et 95 %-intervall betyr at metoden fanger θ\theta i 95 % av gjentatte utvalg — ikke at det er 95 % sannsynlig at θ\theta ligger i akkurat dette intervallet. θ\theta er ikke stokastisk; intervallgrensene er det.

Pivotstørrelse

En funksjon av data og parameter hvis fordeling ikke avhenger av parameteren — for eksempel (θ^θ)/seN(0,1)(\hat\theta-\theta)/se\sim N(0,1). Man snur ulikheten for pivoten om til et intervall for θ\theta.

Wald mot eksakt/asymmetrisk pivot

Wald er en normaltilnærming som er symmetrisk om θ^\hat\theta. Når sese avhenger av θ\theta, gir en asymmetrisk pivot (eller den eksakte χ2\chi^2-pivoten i kap. 2.5) et mer presist, asymmetrisk intervall. Asymmetri er da riktig, ikke feil.

Asymptotisk forventningsrett

En estimator er asymptotisk forventningsrett hvis E(θ^)θE(\hat\theta)\to\theta når nn\to\infty. ML-estimatorer kan være skjeve for lite nn (som σ^2\hat\sigma^2 i normalmodellen), men blir forventningsrette i grensen.

Relativ effisiens

Forholdet mellom variansene til to forventningsrette estimatorer, Var(θ^1)/Var(θ^2)\operatorname{Var}(\hat\theta_1)/\operatorname{Var}(\hat\theta_2). Den med minst varians (nærmest Cramér–Rao-grensen) er mest effisient.

Konsistens via Fisher-informasjon

Siden ML-variansen er 1/(nI(θ))01/(nI(\theta))\to0 og ML-estimatoren er asymptotisk forventningsrett, gir Tsjebysjeff (kap. 1.1) at θ^Pθ\hat\theta\xrightarrow{P}\theta. Mer informasjon (InI_n\to\infty) tvinger estimatoren mot sannheten.

Presisjon og informasjonsmengde

Bredden på Wald-intervallet er 2zα/2se=2zα/2/nI(θ^)2z_{\alpha/2}\,se=2z_{\alpha/2}/\sqrt{nI(\hat\theta)}. Mer informasjon (større II eller nn) gir smalere intervall — presisjonen vokser som n\sqrt n.

Estimert mot sann informasjon

I variansen 1/(nI(θ))1/(nI(\theta)) står den sanne θ\theta; i standardfeilen se=1/(nI(θ^))se=\sqrt{1/(nI(\hat\theta))} plugger vi inn estimatet fordi θ\theta er ukjent. Skillet er kilden til forskjellen mellom symmetrisk (plugg inn) og asymmetrisk (behold sann θ\theta) Wald.

Log-likelihoodens krumning

Fisher-informasjonen er forventet krumning av log-likelihood: In(θ)=E[(θ)]I_n(\theta)=-E[\ell''(\theta)]. Skarp topp (stor krumning) = mye informasjon = liten varians. Dette er den geometriske tolkningen av hele kapitlet.

Symbol- og formelliste
Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.