2.7 Drill: det komplette test-ritualet (sjanger E)
Ritualet skrevet ut i full detalj, om og om igjen, over alle testtypene — inkludert den eksplisitte utledningen av at nivået blir α og den verbalt korrekte P-verdi-definisjonen sensor krever.
- Sjanger E = hypotesetest-oppgaven i full pakke. Her drilles ALLE underartene: ett-utvalgs t, to-utvalgs pooled t, parvis t, andels-z, Poisson-test, F-test for varianser, ANOVA-F og rangtest.
- Poenget med drillen: samme fem trinn hver gang — bare observatoren og frihetsgradene bytter. Når malen sitter i fingrene, koker enhver testoppgave ned til «hvilken observator, hvilken fordeling, hvilke frihetsgrader?».
Sensorens krav (§4.5): de fem trinnene MÅ være med, nivået MÅ utledes, og P-verdien MÅ defineres i ord. Prioritet: høyeste prioritet — dette er det tydeligste enkeltkravet i emnet.
Tidsbruk: ~80 min. Del gjerne over to økter: én for malen + de fire t-baserte testene, én for andeler/Poisson/F/ANOVA/rang. Anslaget er lesetid; regner du for hånd, gang med ca. 1,5.
Alt du trenger av fordelingsteori er allerede etablert der; her handler alt om å utføre ritualet raskt og fullstendig. Nødvendige kvantiler (, , , ) legges — som på eksamen — rett i oppgaveteksten.
Legg merke til at alle har samme form: (estimat − nullverdi) delt på standardfeil. Det er malen — resten er å velge riktig standardfeil og riktig fordeling.
Løsningsoppskrift: den obligatoriske femtrinnsmalen
Hver eneste testoppgave løses med de samme fem trinnene. Lær dem som en fast kjede — sensor forventer å se alle fem.
Trinn 1 — Hypoteser med begrunnet retning. Skriv (en likhet, «status quo») og . Begrunn om er ensidig eller tosidig: skal du påvise en bestemt retning (øker/synker), er den ensidig; skal du bare påvise endring, er den tosidig. Retningen følger av spørsmålet og bestemmes FØR du ser dataene.
Trinn 2 — Testobservator og fordeling under . Skriv opp observatoren (estimat minus nullverdi, delt på standardfeil) og oppgi fordelingen den har når er sann — riktig type OG riktige frihetsgrader. Dette er der de fleste feilene skjer.
Trinn 3 — Utled at nivået blir . Regn eksplisitt
For en høyresidig test: per definisjon av kvantilen. For tosidig: i hver hale summerer til . Skriv sannsynligheten ut — ikke bare «vi bruker 5 %». Dette er A-kravet (§4.5).
Trinn 4 — Tallfest, sammenlign og oppgi P-verdien. Sett inn tallene, sammenlign observatoren med den kritiske verdien, og oppgi P-verdien. Definer den i ord: «sannsynligheten under for et minst like ekstremt utfall som det observerte.» Forkast når P-verdi .
Trinn 5 — Konkluder i ord i kontekst + dualitet. Oversett «forkast/behold» til situasjonens språk, med P-verdi og nivå. Bruk CI↔test-dualiteten som kryssjekk: en tosidig test forkaster hvis og bare hvis ligger utenfor det -KI-et (for en ensidig test: utenfor det ensidige intervallet).
| Situasjon | Observator | Fordeling under |
|---|---|---|
| Ett utvalg, ukjent | ||
| Ett utvalg, kjent | ||
| To uavhengige utvalg, lik varians | ||
| Parvise data | ( = par) | |
| To andeler | ||
| Poisson-antall (stor ) | (CLT) | |
| To varianser | ||
| gruppers forventning |
Velg raden, og de fire andre trinnene er identiske. Feil frihetsgrader straffes hardt — dobbeltsjekk alltid nevneren.
Et renseanlegg skal holde forventet utslipp under grenseverdien 25 mg/l. Tilsynet mistenker overskridelse og tar uavhengige prøver: mg/l og mg/l (normale data, ukjent ). Test på 5 %-nivå om forventet utslipp overstiger 25 mg/l. Bruk og , og opplys at .
Sensor-margnotat: full uttelling krever at retningen begrunnes ut fra ordet «overskridelse» — ikke velges etter at man har sett at .
Trinn 2 — observator + fordeling under : . Ukjent og normale data gir under :
Sensor-margnotat: her sitter poenget for (ikke ) og for frihetsgrader — feil df koster.
Trinn 3 — utled at nivået blir 5 %: Vi forkaster når . Under er , så
nettopp fordi per definisjon skjærer av arealet 0,05 i øvre hale. Sensor-margnotat: dette trinnet — sannsynligheten skrevet ut — er det hyppigst glemte og et rent A-krav (§4.5).
Trinn 4 — tallfest + P-verdi: Standardfeil .
så vi forkaster. P-verdien er sannsynligheten under for et minst like ekstremt (stort) utfall som det observerte: . Sensor-margnotat: den verbale definisjonen må stå der — «» alene, uten ord, gir ikke full uttelling.
Trinn 5 — konklusjon i kontekst + dualitet: På 5 %-nivå er det belegg for at forventet utslipp overstiger grenseverdien 25 mg/l (P-verdi ). Kryssjekk (ensidig dualitet): det ensidige nedre 95 %-intervallet er . Siden hele intervallet ligger over 25, utelukkes nullverdien 25 — samme konklusjon som testen. Sensor-margnotat: dualiteten som kryssjekk viser modenhet og fanger regnefeil.
Drill: samme mal, alle testtypene
Oppgavene under ruller gjennom hver underart av sjanger E. Skriv ut alle fem trinn hver gang — også når det frister å hoppe over nivå-utledningen. De to siste er merket «(krevende)», og helt sist ligger en kald oppgave uten hint, der fasiten bare er en momentliste (som på eksamen får du ingen ledetråder).
Skriv ut alle fem trinn, inkludert nivå-utledningen.
Df Sum Sq Mean Sq F value Pr(>F)
opplegg 2 96.0 48.00 4.80 0.0176
Residuals 24 240.0 10.00a) Verifiser Mean Sq- og F value-kolonnene.
b) Formuler hypotesene og oppgi observatoren med fordeling under .
c) Konkluder på 5 %-nivå, og forklar hva testen IKKE forteller.
a) Hvorfor er rangtesten å foretrekke her?
b) Hva betyr forskjellen i P-verdi for konklusjonen på 5 %-nivå?
c) En medstudent sier at den høyere P-verdien viser at rangtesten er «dårligere». Har han rett?
a) Blodtrykk hos 18 pasienter, målt før og etter en behandling; påvise endring.
b) Andel fornøyde blant 250 kunder i butikk X mot 300 i butikk Y.
c) Reaksjonstid hos menn (, ) og kvinner (, ), uavhengige normale data, lik varians; påvise forskjell tosidig på 5 %-nivå. Bruk og .
«Jeg tester mot . Observator . . P-verdien 0,18 er sannsynligheten for at er sann; siden den er stor, er bevist. Jeg beholder .»
Pek ut alle feilene og skriv en korrekt kort løsning. Bruk og .
2. P-verdi-mistolkning. P-verdien er sannsynligheten, beregnet under , for et minst like ekstremt utfall som det observerte — aldri «sannsynligheten for at er sann».
3. Feil retning i og feil frihetsgrader. Retningen skal begrunnes fra spørsmålet FØR du ser på tallene; df er , (pooled) eller for differansene ved parvise data.
4. Parvise data behandlet som to uavhengige utvalg. Reduser alltid til differansene først — to-utvalgsformelen er gal her og gir feil varians.
5. Konklusjon uten kontekst. «Forkaster » er et halvt svar; konkluder i oppgavens egne ord (t↔z-forveksling trekker også).
Begrepsbank
Den faste kjeden i enhver hypotesetest: (1) med begrunnet retning; (2) observator + fordeling under ; (3) utled at nivået blir ; (4) tallfest + P-verdi (definert i ord); (5) konkluder i kontekst + dualitet. Bare observatoren og frihetsgradene bytter mellom testtypene.
Å skrive eksplisitt ut at . Ensidig: ; tosidig: i hver hale. Det eksplisitte sensorkravet (§4.5) og det hyppigst glemte trinnet — «vi bruker 5 %» holder ikke.
Sannsynligheten — beregnet UNDER — for et minst like ekstremt utfall som det observerte, målt i retning av . Forkast når P-verdi . IKKE «sannsynligheten for at er sann»: er ikke stokastisk.
Observatoren er (estimat − nullverdi) delt på standardfeil. Nullfordelingen er dens fordeling når er sann; alt — kritisk verdi, P-verdi, nivå — leses av den. Trinn 2 krever både type OG riktige frihetsgrader.
For én forventning med ukjent : under . Med kjent blir den . Frihetsgrader .
For to uavhengige grupper med lik varians: , med . Frihetsgrader .
For koblede data (samme/matchede enheter): reduser til differanser og test som ETT utvalg: , der er antall PAR. Frihetsgrader — ikke . Å behandle parvise data som to uavhengige utvalg er en klassisk felle.
For et Poisson-antall er . Ved stor gir CLT , og observatoren er under . Normaltilnærmingen må nevnes eksplisitt.
For to uavhengige normale utvalg: under (teller-df fra utvalg 1). Store/små taler mot . Brukes til å sjekke lik-varians-antakelsen før en pooled test.
For gruppers forventning: under . Forkast for store . Sier bare AT det finnes en forskjell, ikke HVILKE grupper — les P-verdien fra Pr(>F) i R-utskriften.
Det ikke-parametriske alternativet når QQ-plottet bryter normalitet: bytt tallverdiene med ranger og test på dem. Antar ikke normalitet, robust mot uteliggere; prisen er litt lavere styrke og gjerne en høyere P-verdi når data faktisk er normale.
Ensidig ( eller ) når du skal påvise en BESTEMT retning; tosidig () når du bare vil påvise ENDRING. Retningen følger av spørsmålet og bestemmes FØR dataene ses — å velge etter dataene («fiske») ugyldiggjør nivået.
Ett utvalg / parvis: . Pooled to-utvalg: . F-test varianser: . ANOVA: . Andels-z og Poisson-z: ingen (normaltilnærming). Feil frihetsgrader straffes hardt (§4.6).
En tosidig test på nivå forkaster hvis og bare hvis ligger utenfor det tosidige -KI-et (ensidig test: utenfor det ensidige intervallet). Brukes som kryssjekk i trinn 5 — har du regnet både KI og test, må de stemme.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.
Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.