Hypotesetest for μ med normalfordeling — ensidig og tosidig.
Test av et gjennomsnitt
I kapittel 7.4 testet vi påstander om andeler, og regnet p-verdiene med den binomiske fordelingen. Nå skal vi teste påstander om et gjennomsnitt: «pærene varer 1200 timer», «flaskene inneholder 500 ml», «reisetiden er 32 minutter».
Hele tankegangen er den samme — fem skritt, p-verdi mot signifikansnivå. Det nye er at vi regner med normalfordelingen, fordi vi vet fra kapittel 6 hvordan oppfører seg:
og at er tilnærmet normalfordelt når er stor nok — uansett hvordan enkeltmålingene er fordelt. Det er sentralgrensesetningen som gjør denne testen mulig i praksis.
Spørsmålet vi skal svare på, er hver gang det samme: hvor mange standardfeil ligger det målte gjennomsnittet fra den påståtte verdien?
Når er sann, er tilnærmet standard normalfordelt. Tallet sier hvor mange standardfeil det målte gjennomsnittet ligger fra den påståtte verdien.
p-verdien avhenger av hvilken alternativ hypotese vi har:
| p-verdi | |
|---|---|
De tilhørende kritiske verdiene er
| ensidig | tosidig | |
|---|---|---|
| 0,10 | 1,282 | 1,645 |
| 0,05 | 1,645 | 1,960 |
| 0,01 | 2,326 | 2,576 |
Er ukjent, brukes — forsvarlig når , akkurat som i kapittel 7.2.
En produsent oppgir at lyspærene deres varer i gjennomsnitt 1200 timer. Standardavviket er kjent fra produksjonen: timer. Et forbrukerorgan tester 40 tilfeldige pærer og måler gjennomsnittet timer. De mistenker at pærene varer kortere enn lovet.
a) Sett opp hypoteser.
b) Regn ut .
c) Finn p-verdien og konkluder på 5 %-nivå.
d) Hva blir konklusjonen på 1 %-nivå?
Hva vet vi? t, t, , t.
a) Mistanken er at levetiden er kortere, så testen er venstresidig:
b) Først standardfeilen:
Så testobservatoren — formelen tom først, så med tall:
Det målte gjennomsnittet ligger altså 2,25 standardfeil under den påståtte verdien. Minustegnet betyr «under», og det skal være der — det er selve retningen i testen.
c) Siden peker nedover, er p-verdien arealet i venstre hale:
Vi sammenligner:
forkastes.

Venstresidig test. Testobservatoren ligger til venstre for den kritiske grensen , altså inne i forkastningsområdet, og . De to måtene å avgjøre på gir samme svar, slik de alltid gjør.
Konklusjon i kontekst: Testen gir grunnlag for å si at pærene i gjennomsnitt varer kortere enn de 1200 timene produsenten oppgir. Var påstanden riktig, ville et utvalg på 40 pærer gitt et gjennomsnitt på 1168 timer eller lavere i bare omtrent 1 av 100 tester.
d) På 1 %-nivå: , så beholdes. Testen er signifikant på 5 %-nivå, men ikke på 1 %-nivå.
Svar: a) mot . b) . c) , forkastes på 5 %-nivå. d) På 1 %-nivå beholdes .
NB — fortegnet på er informasjon. Et negativt betyr at målingen ligger under . Hadde vi fått i denne oppgaven, ville p-verdien vært — altså det motsatte av signifikant. Pærene ville da vart lenger enn lovet, og det er ikke det vi tester.
Gjør den samme utregningen som i eksempel 1. Et treningssenter hevder at medlemmene i gjennomsnitt trener 60 minutter per økt. Standardavviket er kjent: minutter. En undersøkelse av 64 tilfeldige økter gir minutter. Senteret vil vise at snittet er høyere enn 60.
Sett opp og .
Finn standardfeilen.
Regn ut .
Finn p-verdien og konkluder på 5 %-nivå.
Hvilket gjennomsnitt måtte de målt for akkurat å forkaste på 5 %-nivå?
Tosidig test — når begge retninger teller
En fyllmaskin skal ikke fylle for lite. Men den skal heller ikke fylle for mye — det koster penger, og kundene skal få det de betaler for, verken mer eller mindre. Her er begge avvik et problem, og testen blir tosidig:
Da må signifikansnivået deles på to, med i hver hale. Det er derfor grensen flyttes fra 1,645 til 1,96 når — og det er den samme 1,96 som i konfidensintervallet i kapittel 7.2. Det er ingen tilfeldighet; vi kommer tilbake til sammenhengen i eksempel 3.
p-verdien regnes ved å ta halen på den siden observasjonen falt, og så gange med 2:
Absoluttverdien gjør at det ikke spiller noen rolle hvilken vei avviket gikk — vi spør bare hvor langt unna vi er.
En maskin skal fylle 500 ml i hver flaske. Kvalitetsavdelingen måler 30 tilfeldige flasker og finner ml og ml. Både for lite og for mye er uønsket.
a) Sett opp hypoteser, og forklar hvorfor testen er tosidig.
b) Regn ut .
c) Finn p-verdien og konkluder på 1 %-nivå.
d) Regn ut et 95 % konfidensintervall, og sammenlign med konklusjonen.
Hva vet vi? ml, , ml, ml. Her er ukjent, men , så vi bruker .
a) Avvik i begge retninger er et problem:
b) Standardfeilen:
Testobservatoren:
Avviket er altså over tre standardfeil.
c) Tosidig p-verdi:
forkastes, også på 1 %-nivå.
Konklusjon i kontekst: Maskinen fyller ikke 500 ml i gjennomsnitt. Avviket er så stort at det ikke med rimelighet kan forklares av tilfeldig variasjon mellom flasker — maskinen bør justeres.
d) Konfidensintervallet:
Verdien 500 ligger utenfor intervallet — samme konklusjon som testen ga.
Svar: a) mot , tosidig fordi begge avvik er uønsket. b) . c) , forkastes også på 1 %-nivå. d) — 500 ligger utenfor, i tråd med testen.
NB: Intervallet gir i tillegg noe testen ikke gir: en størrelse på avviket. Maskinen fyller trolig mellom 1 og 4 ml for lite. Det er den opplysningen produksjonssjefen trenger for å avgjøre om det haster.
En pakkemaskin skal legge 250 gram i hver pakke. Et utvalg på 40 pakker gir gram og gram. Både under- og overvekt er uønsket.
Sett opp og .
Finn standardfeilen.
Regn ut .
Finn den tosidige p-verdien og konkluder på 5 %-nivå og 1 %-nivå.
Finn 95 %- og 99 %-konfidensintervallene, og vis at de gir samme svar som testene i d).
Et utvalg på 36 målinger gir og .
a) Finn 95 % konfidensintervallet for .
b) Test mot på 5 %-nivå.
c) Test på samme måte.
d) Formuler sammenhengen du ser.
a) Standardfeilen:
b) Med :
forkastes. Og legg merke til: 100 ligger utenfor intervallet i a).
c) Med :
beholdes. Og 101 ligger innenfor intervallet.
d) Sammenhengen er eksakt:
En tosidig test på 5 %-nivå forkaster nøyaktig når ligger utenfor 95 % konfidensintervallet.
Det er ikke to metoder, men to måter å skrive den samme regningen på. Konfidensintervallet er hele mengden av -verdier som ikke ville blitt forkastet.

Konfidensintervallet er mengden av nullhypoteser som ikke forkastes. ligger utenfor, og testen forkaster. og ligger innenfor, og testen beholder. Det er ikke to metoder, men to måter å skrive den samme regningen på.
Svar: a) . b) , — forkast. c) , — behold. d) Tosidig test på nivå og konfidensintervall på nivå gir alltid samme svar.
NB: Sammenhengen gjelder tosidig test. En ensidig test på 5 %-nivå svarer til et ensidig intervall, og der passer ikke 1,96 lenger, men 1,645.
En kommune har lenge hatt en gjennomsnittlig reisetid til jobb på 32 minutter, med kjent standardavvik minutter. Etter at en ny vei åpnet, måler de 45 tilfeldige reiser og finner minutter. De vil vise at reisetiden har gått ned.
Sett opp og .
Regn ut .
Finn p-verdien og konkluder på 5 %-nivå.
Finn forkastningsområdet uttrykt i minutter.
Hva ville konklusjonen blitt hvis testen var tosidig?
Vi bruker tallene fra eksempel 1: , , , .
a) Sett opp regnearket som regner og p-verdien.
b) Gjør det samme i GeoGebra.
c) Hvor stort måtte utvalget vært for at det samme avviket skulle gitt forkastning på 1 %-nivå?
a) Vi legger inn de fire tallene og regner videre på dem:
A1: 1200 (mu0)
A2: 90 (sigma)
A3: 40 (n)
A4: 1168 (xbar)
A5: =A2/ROT(A3) gir 14,2302 (standardfeilen)
A6: =(A4-A1)/A5 gir -2,2487 (z)
A7: =NORM.S.FORDELING.N(A6;SANN) gir 0,01227 (p-verdi, venstresidig)For en høyresidig test bruker vi =1-NORM.S.FORDELING.N(A6;SANN), og for en tosidig =2*(1-NORM.S.FORDELING.N(ABS(A6);SANN)).
b) I GeoGebra kan vi gå direkte på fordelingen til , uten å standardisere:
FordelingNormal(1200, 90/sqrt(40), 1168) gir 0.0123Kommandoen gir når forventningsverdien er 1200 og standardavviket er — altså p-verdien direkte.
c) Vi trenger med samme avvik :
Altså 43 pærer.
Svar: a) =NORM.S.FORDELING.N(z;SANN) gir venstresidig p-verdi. b) FordelingNormal(1200, 90/sqrt(40), 1168). c) 43 pærer.
NB — samme data, sterkere konklusjon. Legg merke til hva c) egentlig sier: avviket på 32 timer er nøyaktig like stort som før. Det som endrer seg med flere målinger, er hvor sikre vi er på at avviket er ekte. Signifikans er ikke et mål på effektens størrelse, men på hvor godt vi har målt den.
En bedrift tester mot med og kjent .
Finn standardfeilen.
Finn forkastningsområdet på 5 %-nivå, uttrykt i .
Utvalget gir . Hva blir konklusjonen?
Finn forkastningsområdet på 1 %-nivå, og avgjør om fortsatt gir forkastning.
Forklar med én setning hvorfor forkastningsområdet blir mindre når blir mindre.
Et utvalg gir 95 % konfidensintervallet for . Bruk sammenhengen mellom intervall og tosidig test.
Ville blitt forkastet på 5 %-nivå?
Ville blitt forkastet?
Ville blitt forkastet?
For hvilke verdier av ville blitt beholdt?
Et 99 %-intervall fra de samme dataene blir . Hvilke av testene i a)–c) ville endret svar på 1 %-nivå?
Oppsummering
- Testobservatoren for et gjennomsnitt:
Den sier hvor mange standardfeil målingen ligger fra den påståtte verdien.
- p-verdien: ved , ved , og ved .
- Kritiske verdier på 5 %-nivå: 1,645 ensidig og 1,96 tosidig. Ved tosidig test deles i to haler.
- Forkastningsområdet i originalenheter: .
- Er ukjent, brukes når .
- En tosidig test på nivå forkaster nøyaktig når ligger utenfor konfidensintervallet på nivå . Intervallet er mengden av nullhypoteser som ikke forkastes.
- Konklusjonen skrives i kontekst, og p-verdien oppgis som tall.
- Samme avvik gir mindre p-verdi når vokser. Signifikans måler hvor godt vi har målt, ikke hvor stor effekten er.
I kapittel 7.6 gjør vi testen for en andel, der vi kan velge mellom eksakt binomisk regning og normaltilnærming.
| 248,6 | 251,2 | 247,9 | 252,4 | 249,8 | 250,6 |
| 246,7 | 253,1 | 249,1 | 251,8 | 248,2 | 252,7 |
| 250,4 | 247,3 | 251,5 | 249,5 | 253,6 | 246,9 |
| 250,8 | 248,9 | 252,1 | 249,2 | 247,6 | 251,1 |
| 250,2 | 248,4 | 252,9 | 249,9 | 247,1 | 251,7 |
| 250,5 | 248,8 | 253,4 | 246,4 | 251,3 | 249,4 |
Test på 5 %-nivå om maskinen fyller riktig. Rund av til to desimaler.
Sett opp hypotesene, og begrunn ensidig eller tosidig.
Finn og med regneark.
Regn ut standardfeilen og .
Finn p-verdien og konkluder i kontekst.
Finn 95 %-intervallet, og forklar hva det legger til utover testen. Hva ville vært konklusjonen hvis kravet var at maskinen skal treffe innenfor 0,2 gram?
Regn ut og tosidig p-verdi for , og .
Hvor stort må være for at avviket på 1,0 skal bli signifikant på 5 %-nivå (tosidig)?
Avviket er 1,0 gram på en pakke som skal veie 250 gram. Er det praktisk viktig?
«Testen var ikke signifikant, så maskinen fyller riktig.» Hva er feilen, og hva burde bedriften se på i stedet?
Bedriften tester hver uke gjennom et helt år på 5 %-nivå, og maskinen er hele tiden riktig innstilt. Hvor mange ganger vil de i gjennomsnitt få «signifikant avvik»?
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.
