Punktestimater og konfidensintervaller.
Fra utvalg til populasjon
I statistikk ønsker vi ofte å si noe om en hel populasjon basert på et utvalg. For eksempel kan vi måle høyden til 200 tilfeldig valgte nordmenn for å si noe om gjennomsnittshøyden i hele befolkningen.
Estimering handler om å bruke utvalgsobservasjoner til å anslå ukjente populasjonsparametre. Vi skiller mellom:
- Punktestimat: Ett enkelt tall som anslår parameteren
- Intervallestimering: Et intervall som med stor sannsynlighet inneholder den sanne parameteren
Et punktestimat er en enkelt tallverdi som brukes som beste gjetning for en populasjonsparameter.
De vanligste punktestimatene:
- Utvalgsgjennomsnittet er et punktestimat for populasjonsgjennomsnittet
- Utvalgsandelen er et punktestimat for populasjonsandelen
- Utvalgsstandardavviket er et punktestimat for populasjonsstandardavviket
Vi kaller en estimator for , og den konkrete verdien vi beregner er estimatet.
I en undersøkelse målte man antall timer søvn per natt for 50 elever. Utvalget ga timer og timer. Hva er punktestimatet for den gjennomsnittlige søvnlengden i populasjonen?
Vår beste gjetning er at elever i gjennomsnitt sover 7,2 timer per natt. Men dette ene tallet gir ingen informasjon om hvor usikkert estimatet er.
Konfidensintervall for forventningsverdi
Et punktestimat alene forteller ikke hvor nøyaktig det er. Et konfidensintervall gir oss et intervall som med en angitt sannsynlighet inneholder den sanne parameteren.
Fra sentralgrenseteoremet vet vi at for store utvalg () er fordelingen til tilnærmet normalfordelt:
Standardfeilen til gjennomsnittet er . Når er ukjent, bruker vi som estimat.
der:
- er utvalgsgjennomsnittet
- er utvalgsstandardavviket
- er utvalgsstørrelsen
- er den kritiske verdien fra standardnormalfordelingen
Vanlige verdier:
| Konfidensnivå | ||
|---|---|---|
| 90 % | 0,10 | 1,645 |
| 95 % | 0,05 | 1,960 |
| 99 % | 0,01 | 2,576 |
Et tilfeldig utvalg på batterier testes. Gjennomsnittlig levetid er timer med standardavvik timer. Finn et 95 % konfidensintervall for den sanne gjennomsnittlige levetiden .
Beregning av feilmargin:
Konfidensintervall:
Vi er 95 % sikre på at den sanne gjennomsnittlige levetiden ligger mellom 47,47 og 49,53 timer.
Konfidensintervall for andel
Når vi estimerer en populasjonsandel fra en utvalgsandel (der er antall «suksesser» i utvalget), kan vi konstruere et konfidensintervall.
For store utvalg er tilnærmet normalfordelt med forventning og standardfeil . Siden er ukjent, bruker vi i stedet.
Forutsetning: og (normalapproksimasjon gyldig).
I en spørreundersøkelse svarte 240 av 800 spurte at de er enige i en påstand. Finn et 95 % konfidensintervall for den sanne andelen som er enig.
Utvalgsandel:
Sjekk forutsetning: og ✓
Standardfeil:
Feilmargin:
Konfidensintervall:
Vi er 95 % sikre på at den sanne andelen ligger mellom 26,8 % og 33,2 %.
Tolkning av konfidensintervall
Et 95 % konfidensintervall betyr ikke at det er 95 % sannsynlighet for at ligger i dette bestemte intervallet. Den sanne er en fast (ukjent) verdi, ikke en stokastisk variabel.
Korrekt tolkning: Hvis vi gjentar forsøket mange ganger og beregner et 95 % konfidensintervall hver gang, vil omtrent 95 % av alle intervallene inneholde den sanne verdien .
Enklere formulering: Vi er 95 % sikre på at metoden gir et intervall som fanger den sanne parameterverdien. Med andre ord: i det lange løp tar vi feil i omtrent 5 % av tilfellene.
Feilmargin og utvalgsstørrelse
Feilmarginen er halvparten av konfidensintervallets bredde:
Feilmarginen avtar når:
- Utvalgsstørrelsen øker (kvadratrotssammenhengen)
- Konfidensnivået reduseres (lavere )
- Standardavviket er lite
Nødvendig utvalgsstørrelse for å oppnå en ønsket feilmargin ved estimering av :
For estimering av andel med ønsket feilmargin :
Hvis er helt ukjent, bruker vi (gir størst mulig , konservativt estimat).
En forsker ønsker å estimere gjennomsnittsscoren på en test med feilmargin poeng og 95 % konfidens. Tidligere studier tyder på at . Hvor stort utvalg trengs?
Vi runder opp: .
Forskeren trenger minst 139 deltakere i utvalget.
Et politisk parti ønsker å estimere sin oppslutning med feilmargin (3 prosentpoeng) og 95 % konfidens. Ingen forhåndsinformasjon om andelen. Hvor mange må spørres?
Vi runder opp: .
Partiet trenger minst 1068 respondenter.
Løs oppgavene:
Et utvalg på gir og . Finn punktestimatet for .
I et utvalg på 200 personer svarer 70 ja. Hva er punktestimatet for andelen?
Løs oppgavene:
Finn standardfeilen til gjennomsnittet dersom og .
Hva blir standardfeilen dersom firedobles til 100?
Løs oppgavene:
Finn for et 90 % konfidensintervall.
Finn for et 99 % konfidensintervall.
Løs oppgavene:
Et utvalg på gir og . Finn et 95 % konfidensintervall for .
Løs oppgavene:
I en undersøkelse svarte 180 av 600 at de bruker kollektivtransport daglig. Finn et 95 % konfidensintervall for den sanne andelen.
Løs oppgavene:
Gjennomsnittlig ventetid ved en legevakt ble målt for 49 pasienter. minutter og minutter. Finn et 99 % konfidensintervall for gjennomsnittlig ventetid.
Løs oppgavene:
Et 95 % konfidensintervall er . Hva er punktestimatet og feilmarginen?
Løs oppgavene:
Sammenlign bredden på et 90 %, 95 % og 99 % konfidensintervall for med , og .
Løs oppgavene:
Forklar forskjellen mellom et punktestimat og et konfidensintervall. Hvorfor foretrekker vi ofte konfidensintervaller?
Løs oppgavene:
Hva er den korrekte tolkningen av et 95 % konfidensintervall?
Løs oppgavene:
Hvor stort utvalg trenger vi for å estimere et gjennomsnitt med feilmargin og 95 % konfidens dersom ?
Løs oppgavene:
Et politisk parti ønsker å estimere sin oppslutning med feilmargin og 95 % konfidens. De antar . Finn nødvendig utvalgsstørrelse.
Løs oppgavene:
Vekten av pakker fra en fabrikk ble målt: , g, g. Finn 90 %, 95 % og 99 % konfidensintervall for gjennomsnittsvekten.
Løs oppgavene:
Dersom vi dobler utvalgsstørrelsen, hva skjer med feilmarginen? Forklar algebraisk.
Løs oppgavene:
Et firma hevder at produktet veier 500 g i gjennomsnitt. Du tester og finner g, g. Finn et 95 % konfidensintervall. Støtter resultatet firmaets påstand?
Løs oppgavene:
I en valgundersøkelse svarer 320 av 1200 at de stemmer parti A. Finn et 99 % konfidensintervall for partiets oppslutning. Kan partiet ha over 30 % oppslutning?
Oppsummering
Læringspunkter:
- Et punktestimat er én tallverdi for en ukjent parameter: estimerer , og estimerer .
- Standardfeilen måler usikkerheten i gjennomsnittet — den halveres når firedobles.
- Et konfidensintervall angir et intervall som med gitt konfidensnivå fanger den sanne parameteren: .
- Vanlige kritiske verdier: (90 %), (95 %), (99 %).
- Riktig tolkning: ved mange gjentatte utvalg vil ca. 95 % av 95 %-intervallene inneholde den sanne verdien.
| Nøkkelbegrep | Forklaring |
|---|---|
| Punktestimat | Beste enkeltverdi for parameteren (, ) |
| Standardfeil | — spredningen til estimatoren |
| Konfidensintervall | Intervall med gitt dekningsgrad for parameteren |
| Feilmargin | Halve bredden av intervallet: |
| Konfidensnivå | Andelen intervaller som treffer ved gjentatte utvalg |
Viktige formler:
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.
