Tilbake
2.1
Populasjoner, utvalg og sannsynlighet

2.1 Populasjoner, utvalg og sannsynlighet

Populasjon vs. utvalg, utvalgsfeil, sannsynlighetsfordeling.

30 min
5 oppgaver
PopulasjonUtvalgSannsynlighetNormalfordeling
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 5 oppgaver

Å si noe om mange ved å spørre få

Tenk deg at du vil vite hvor mye skjermtid norske VG3-elever har i snitt. Det finnes kanskje 60 000 av dem, og du kan umulig spørre alle. Så du velger ut 200 og måler dem. Akkurat her, i dette spranget fra de mange til de få, ligger hele statistikkens hjerte.

Vi kaller hele gruppen vi vil si noe om for populasjonen, og den delen vi faktisk undersøker for utvalget. Den store utfordringen er å gjøre utvalget representativt -- at det speiler populasjonen godt nok til at vi kan generalisere. Hvordan vi trekker utvalget er derfor helt avgjørende.

Det finnes flere måter. Sannsynlighetsutvalg bygger på tilfeldighet: i et enkelt tilfeldig utvalg har alle lik sjanse (som loddtrekning), i et stratifisert utvalg deler vi populasjonen i undergrupper og trekker fra hver, og i et klyngeutvalg trekker vi hele naturlige klynger som skoler. Ikke-sannsynlighetsutvalg er enklere, men risikabelt: bekvemmelighetsutvalg bruker dem som er lettest tilgjengelige, og gir størst fare for skjevhet.

Parametere, statistikk og standardfeil

Et viktig skille går mellom det sanne og det estimerte. En populasjonsparameter er den sanne, men ukjente verdien i hele populasjonen -- som det sanne gjennomsnittet μ\mu eller standardavviket σ\sigma. En utvalgsstatistikk er verdien vi regner ut fra utvalget, som utvalgsgjennomsnittet xˉ\bar{x} og utvalgsstandardavviket ss. Et nyttig minnemerke: greske bokstaver for det sanne og ukjente, latinske for det vi har målt. Måler du reaksjonstiden hos 150 18-åringer og får xˉ=245\bar{x} = 245 ms, er det ditt beste estimat for den ukjente μ\mu.

Utvalget vil aldri treffe parameteren helt. Denne forskjellen kalles utvalgsfeil, og den finnes i to varianter. Tilfeldig utvalgsfeil skyldes ren tilfeldighet i hvem som havner i utvalget -- den er uunngåelig, men krymper når utvalget vokser. Systematisk skjevhet er verre: her avviker utvalget på en systematisk måte, og dette kan ikke fikses med et større utvalg -- et stort skjevt utvalg er like skjevt som et lite. Skjevhet kan komme fra seleksjon (ikke alle har lik sjanse), frafall (de som svarer skiller seg fra de som ikke gjør det) eller respons (folk svarer uærlig).

For å tallfeste den tilfeldige usikkerheten bruker vi standardfeilen: SE=sn\displaystyle SE = \frac{s}{\sqrt{n}}. Legg merke til kvadratroten i nevneren. Den forteller at presisjonen ikke bare henger på utvalgsstørrelsen, men på roten av den. Måler du puls hos 64 elever med s=8s = 8, blir SE=864=1,0\displaystyle SE = \frac{8}{\sqrt{64}} = 1{,}0. Med bare 16 elever blir den 816=2,0\displaystyle \frac{8}{\sqrt{16}} = 2{,}0 -- dobbelt så stor. Tommelregelen er at firedobling av utvalget halverer standardfeilen, fordi 4=2\sqrt{4} = 2.

📝Oppgave Quiz 1

Klokkekurven som styrer alt

Når vi snakker om hvilke verdier en variabel kan ta og med hvilken sannsynlighet, snakker vi om en sannsynlighetsfordeling. Den aller viktigste er normalfordelingen -- den symmetriske klokkekurven. Den er fullstendig beskrevet av to tall: gjennomsnittet μ\mu (hvor sentrum ligger) og standardavviket σ\sigma (hvor bred kurven er). Vi skriver XN(μ,σ2)X \sim N(\mu, \sigma^2).

Det fine med normalfordelingen er at den følger en enkel huskeregel, 68-95-99,7-regelen: rundt 68 % av verdiene ligger innenfor μ±1σ\mu \pm 1\sigma, rundt 95 % innenfor μ±2σ\mu \pm 2\sigma, og hele 99,7 % innenfor μ±3σ\mu \pm 3\sigma. Si at høyden til 18-årige gutter er N(180,72)N(180, 7^2). Da finner du de midterste 95 % mellom 18014=166180 - 14 = 166 cm og 180+14=194180 + 14 = 194 cm. Og hvor mange er over 194 cm? Det tilsvarer μ+2σ\mu + 2\sigma, så bare halvparten av de ytterste 5 %, altså cirka 2,5 %. Vi måler avstand fra gjennomsnittet i antall standardavvik med en z-verdi: z=xμσ\displaystyle z = \frac{x - \mu}{\sigma}.

Men hvorfor er normalfordelingen overalt i statistikken? Svaret er sentralgrenseteoremet -- et av fagets vakreste resultater. Det sier at uansett hvordan den opprinnelige fordelingen ser ut, vil fordelingen av utvalgsgjennomsnittet nærme seg en normalfordeling når utvalget blir stort nok (tommelregel n30n \geq 30). Dette er grunnen til at vi kan bruke normalfordelingen til å lage konfidensintervaller og teste hypoteser, selv når den underliggende variabelen ikke er normalfordelt i det hele tatt.

📝Oppgave Quiz 2

Oppsummering

Vi har sett at all statistikk handler om å si noe om en populasjon ved å undersøke et utvalg. Vi bruker greske bokstaver (μ\mu, σ\sigma) for de sanne, ukjente parameterne og latinske (xˉ\bar{x}, ss) for utvalgsstatistikken. Tilfeldig utvalgsfeil kan reduseres med større utvalg, men systematisk skjevhet kan ikke det. Standardfeilen SE=sn\displaystyle SE = \frac{s}{\sqrt{n}} måler presisjonen og synker med kvadratroten av utvalgsstørrelsen.

Normalfordelingen er klokkekurven beskrevet av μ\mu og σ\sigma, og 68-95-99,7-regelen gir en rask oversikt over hvor verdiene ligger. Til slutt sikrer sentralgrenseteoremet at utvalgsgjennomsnitt er tilnærmet normalfordelte for store nok utvalg -- selve grunnlaget for konfidensintervaller og hypotesetester.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.