2.2 Hypotesetestens rituale: nivå, P-verdi og dualitet
Det komplette test-ritualet sensor krever: H₀/Hₐ med begrunnet retning, testobservator med fordeling under H₀, utledning av at nivået blir α via P(forkast H₀|H₀), P-verdien definert verbalt korrekt, konklusjon i ord, og CI↔test-dualiteten.
- Sjanger E = hypotesetest-oppgaven (full pakke). Sjanger = en fast type deloppgave.
- Det avgjørende: løsningsforslagene skriver ut hele ritualet — særlig utledningen av at nivået blir , og den verbale P-verdi-definisjonen. Å bare «sette inn i formel» gir ikke full uttelling.
Sensorens krav (§4.5): de fem faste trinnene MÅ være med, og P-verdien MÅ defineres i ord korrekt. Å hoppe over nivå-utledningen eller å skrive «P-verdien er sannsynligheten for at er sann» straffes hardt. Prioritet: må sitte perfekt — dette er det tydeligste enkeltkravet i emnet.
Tidsbruk: ~60 min kjernestoff i fem løkker (hypoteser observator nivå-utledning P-verdi konklusjon + dualitet).
Du trenger også regnereglene for forventning og varians av fra STK1100 kap. 1.2 Stokastiske variable, forventning og varians (→ stk1100-1-2) (klartekst — STK1100 er ikke bygget ennå).
Pivoten er den samme størrelsen vi nå bruker som testobservator: setter vi inn en påstått i stedet for den sanne , får vi en observator som forteller hvor langt dataene ligger fra påstanden, målt i standardfeil. Og et tosidig KI og en tosidig test er to sider av samme sak — det er dualiteten.
En hypotesetest svarer på ett spørsmål: er det vi ser i dataene, forenlig med en bestemt påstand — eller så uvanlig at vi forkaster påstanden? Vi setter opp påstanden som en nullhypotese, regner hvor ekstreme dataene er hvis den er sann, og forkaster hvis det er ekstremt nok.
Det sensor tester, er ikke om du får «forkast» eller «ikke forkast» — det er om du kan skrive ut hele ritualet: formulere hypotesene riktig, oppgi observatorens fordeling, utlede at testen har det nivået den skal ha, definere P-verdien i ord, og konkludere i kontekst.
Vi går i fem løkker som er de fem faste trinnene: (1) hypotesene med begrunnet retning, (2) observator og fordeling under , (3) utledning av nivået , (4) P-verdien, (5) konklusjon + dualitet.
Løkke 1 — Trinn 1: hypotesene med begrunnet retning (~10 min)
En produsent hevder at gjennomsnittlig fylling er ml. En kontrollør vil undersøke om maskinen underfyller (gir mindre enn 500 ml).
a) Formuler og .
b) Er testen ensidig eller tosidig, og hvorfor?
Løkke 2 — Trinn 2: testobservator og fordeling under H0 (~10 min)
der er verdien fra . Stor betyr at dataene ligger langt fra påstanden. Observatoren er en stokastisk variabel (stor bokstav) — det er fordelingen dens vi bruker.
Med kjent blir den . Det er denne fordelingen som forteller hva som er «uvanlig store» verdier — og som gir både kritisk verdi og P-verdi. Oppgi ALLTID fordelingen (type OG frihetsgrader).
Du tester med normale observasjoner og ukjent .
a) Skriv opp testobservatoren.
b) Hvilken fordeling har den under ?
Løkke 3 — Trinn 3: utled at nivaet blir alpha (~14 min)
Lavere gir færre falske alarmer, men gjør det vanskeligere å oppdage en reell effekt (mer om det i kap. 2.4).
Ensidig (høyresidig) test. Vi forkaster når . Under er , så
nettopp fordi per definisjon er den verdien som skjærer av arealet i øvre hale.
Intuisjon: vi la forkastningsgrensen akkurat der halen har areal — da blir falsk-alarm-raten .
Tosidig test. Vi forkaster når . Under :
Intuisjon: i hver hale summerer til — derfor -kvantilen tosidig.
Det er denne utregningen sensor vil se — ikke bare «vi bruker 5 %».
1. Hypoteser: og med begrunnet retning.
2. Observator + fordeling under : skriv opp observatoren og oppgi fordelingen (type OG frihetsgrader).
3. Utled nivået: regn eksplisitt.
4. Tallfest: sett inn tallene, sammenlign med kritisk verdi, og oppgi P-verdien (definert i ord).
5. Konkluder i ord i kontekst + kryssjekk mot konfidensintervallet (dualitet).
Hvert trinn teller. De to hyppigst glemte er trinn 3 (nivå-utledningen) og den verbale P-verdi-definisjonen i trinn 4.
En ny prosess skal gi høyere utbytte enn dagens standard på 50 enheter. Fra kjøringer måles og (normale data). Test på 5 %-nivå om den nye prosessen gir høyere forventet utbytte. Bruk .
Trinn 2 — observator + fordeling under : . Under (normale data, ukjent ): .
Trinn 3 — utled nivået: Vi forkaster når . Under :
Så testen har nivå 5 %, som ønsket.
Trinn 4 — tallfest + P-verdi: . Siden , forkaster vi . P-verdien er sannsynligheten under for et minst like ekstremt utfall som det observerte: . Fordi , forkastes .
Trinn 5 — konklusjon i kontekst: På 5 %-nivå har vi belegg for at den nye prosessen gir høyere forventet utbytte enn 50 enheter (P-verdi ).
En behandling skal øke en score over dagens nivå 100. Fra pasienter: , (normale data). Test ensidig på 5 %-nivå. Bruk og opplys at .
Skriv ut alle fem trinn, inkludert nivå-utledningen.
Løkke 4 — Trinn 4: P-verdien, definert korrekt (~12 min)
P-verdien er IKKE «sannsynligheten for at er sann». er ikke stokastisk — den er sann eller usann. P-verdien måler hvor uforenlige dataene er med , ikke sannsynligheten for .
- Kritisk verdi: forkast hvis observatoren er forbi den kritiske verdien ().
- P-verdi: forkast hvis P-verdi .
De gir alltid samme konklusjon, fordi P-verdi er nøyaktig det samme som at observatoren ligger i forkastningsområdet. P-verdien har den fordelen at den også sier hvor klart resultatet er (0,001 er sterkere belegg enn 0,049), mens en ren «forkast/behold» skjuler det.
Formelsamlingen gir kvantiltabeller; P-verdien avgrenses gjerne mellom to tabellverdier («») når du ikke har eksakt programvare.
To studenter tolker en P-verdi på 0,03.
a) Student A sier: «Det er 3 % sannsynlig at er sann.» Hva er galt?
b) Formuler den korrekte tolkningen.
c) Forkastes på 5 %-nivå?
En prosess skal holde forventet mål på mm. Med kjent måles over enheter. Test tosidig på 5 %-nivå om målet har endret seg. Bruk .
2. Kjent , så ; under : .
3. Forkast når . Under : — nivå 5 %.
4. . Siden , forkaster vi ikke. P-verdi (tosidig) — sannsynligheten under for et minst like ekstremt utfall. .
5. På 5 %-nivå har vi ikke belegg for at forventet mål har endret seg fra 100 mm (P-verdi ).
Løkke 5 — Trinn 5: konklusjon og dualiteten (~10 min)
Bruk dette som kryssjekk: har du både regnet et 95 %-KI og gjort en tosidig 5 %-test, må de stemme overens. Ligger inne i intervallet, kan ikke forkastes.
Bruk tallene fra eksempel 2 (, , ). Konstruer det tosidige 95 %-konfidensintervallet for og vis at det gir samme konklusjon som testen av .
Verdien ligger innenfor . Etter dualiteten kan vi da ikke forkaste tosidig på 5 %-nivå — akkurat samme konklusjon som testen i eksempel 2. Kryssjekken stemmer. (At 100 så vidt er inne, svarer til at P-verdien 0,058 så vidt er over 0,05.)
Et 95 % konfidensintervall for er .
a) Kan forkastes tosidig på 5 %-nivå?
b) Kan forkastes tosidig på 5 %-nivå?
- Mistolke P-verdien som «sannsynligheten for at er sann». P-verdien beregnes UNDER og måler hvor ekstreme dataene er — ikke sannsynligheten for hypotesen. (§5.6)
- Feil retning i . Retningen følger av spørsmålet, og bestemmes FØR du ser dataene. Feil retning gir feil kritisk verdi og feil P-verdi.
- Hoppe over nivå-utledningen (trinn 3). Sensor krever at du skriver ut — ikke bare «vi bruker 5 %». (§4.5)
- Konkludere med «forkast » uten kontekst. Siste trinn må oversette til situasjonens språk, med P-verdi og nivå.
- «Beholder » = « er sann». Nei — det betyr bare at vi ikke har nok belegg mot den.
- Feil fordeling/frihetsgrader i trinn 2 (t vs. z, feil df). Oppgi alltid begge.
- Glemme dualiteten som kryssjekk når du allerede har regnet KI-et.
Blandet drill (sjanger E, stigende)
Et mål skal ligge på . Fra normale målinger: , . Test tosidig på 5 %-nivå. Bruk og .
Skriv ut alle fem trinn.
En sensor overvåker en prosess med kjent . Grenseverdien er ; man vil påvise økning. Fra målinger: .
a) Sett opp hypotesene og observatoren med fordeling under .
b) Utled at en ensidig test som forkaster ved har nivå 5 %.
c) Tallfest, angi P-verdien (definer den), og konkluder. Bruk .
(Kald oppgave — fasit som momentliste, ingen hint.) Et 99 % konfidensintervall for forventet ventetid er minutter (fra en tosidig prosedyre). En påstand sier at forventet ventetid er 15 minutter. Avgjør uten videre regning om forkastes tosidig på 1 %-nivå, forklar hvilket prinsipp du bruker, og si hva det tilsvarende for blir.
Begrepsbank
Å forkaste en sann (falsk alarm). Sannsynligheten for type I-feil er signifikansnivået , valgt på forhånd.
Å beholde en falsk (bommet alarm). Sannsynligheten kalles , og er styrken. Utdypes i kap. 2.4.
Grensen for forkastningsområdet. For ensidig t-test ; for tosidig . Valgt slik at forkastningssannsynligheten under blir .
Sannsynligheten under for et minst like ekstremt utfall som det observerte. Forkast når P-verdi . IKKE sannsynligheten for at er sann.
Et resultat er statistisk signifikant på nivå hvis P-verdi (vi forkaster ). Signifikant stor/viktig effekt — med stort kan en liten effekt bli signifikant.
Ensidig: (i retning av ). Tosidig: . Feil valg av sidethet endrer P-verdien med en faktor 2.
Forkast tosidig på nivå ligger utenfor det tosidige -konfidensintervallet. Brukes som kryssjekk.
Å ikke forkaste betyr «ikke tilstrekkelig belegg mot » — ikke at er bevist sann. Fravær av bevis er ikke bevis på fravær.
Styrken er sannsynligheten for å forkaste når er sann — å oppdage en reell effekt. Høyere , større og større effekt gir høyere styrke (kap. 2.4).
Fordelingen til testobservatoren når er sann. Alt (kritisk verdi, P-verdi, nivå) leses av denne. Å oppgi den riktig — type OG frihetsgrader — er trinn 2 i ritualet.
Å vise eksplisitt at . For ensidig: ; for tosidig i hver hale. Det eksplisitte sensorkravet (§4.5).
Kjent : . Ukjent : . Samme logikk, ulik nullfordeling.
Mengden av observatorverdier som gir «forkast ». Høyresidig: ; venstresidig: ; tosidig: .
Statistisk signifikans sier at effekten neppe er tilfeldig; den sier ikke at effekten er stor eller viktig. Rapporter alltid estimatet/effektstørrelsen ved siden av P-verdien.
Å velge en- eller tosidig etter å ha sett observatoren («fiske») ugyldiggjør nivået — den reelle type I-raten blir høyere enn . Retningen bestemmes av spørsmålet, før dataene.
Siste trinn: oversett «forkast/behold» til situasjonens språk, med P-verdi og nivå. «På 5 %-nivå har vi belegg for at …» / «… ikke tilstrekkelig belegg for at …».
Den påståtte parameterverdien i . Den settes inn i observatoren; den sanne er ukjent. I dualiteten er verdien vi sjekker mot KI-et.
For symmetriske nullfordelinger (, ) er tosidig P-verdi . For skjeve nullfordelinger (f.eks. , ) må halene håndteres hver for seg.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.
Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.