7.2 Testkatalogen: varians, eksakte tester, to utvalg, parret design og fortegnstest
Ritualet gjenbrukt på hele testfamilien — med parret-vs.-to-utvalg-skillet og den nye fortegnstesten.
- Kjikvadrat-test for varians (Jun23, Aug25, Aug13) — testobservator , asymmetrisk forkastningsområde.
- Eksakt binomisk/Poisson-test for små utvalg (Des25, Mai18) — når normaltilnærmingen ikke holder.
- Parret t-test (Aug20, Mai12, Mai14) — Aug20 bruker en hel deloppgave på skillet parret vs. to utvalg. To uavhengige utvalg samlet i ≈24 % av settene.
- Fortegnstesten (Des24, Mai24) er en ny sjanger fra 2024 — en binomisk test på antall positive differanser, brukt som supplement til t-testen.
Prioritet: kunne — men skillet parret/to-utvalg og fortegnstesten er perfekt-nære gjengangere. Alle testene er varianter av sjanger I (full hypotesetest). Formlene står i formelsamlingen (hjelpemiddelkode C); det du trener her er valget av test, frihetsgradene og forutsetningene.
Sist du var her — det ritualet vi gjenbruker (ferdig oppfrisket): for hver test skal du (1) sette / i parametre med begrunnet retning, (2) skrive testobservatoren og fordelingen under , (3) sjekke forutsetningene, (4) finne forkastningsområde eller p-verdi, (5) tallfeste og (6) konkludere i ord. I dette kapitlet bytter vi bare ut selve observatoren og fordelingen — resten er identisk.
Du trenger å kunne slå opp kvantiler i - og -tabellene og kumulative sannsynligheter i binomisk/Poisson-tabellen.
Vi går gjennom fem løkker, én per testtype: variansen (kjikvadrat, løkke 1), eksakte tester for små utvalg (løkke 2), parret design (løkke 3), to uavhengige utvalg (løkke 4) og den nye fortegnstesten (løkke 5). Hver løkke går teori → eksempel → oppgave, og alle følger samme seksstegs-rituale.
Samlet kjernetid ≈ 65 min. Naturlige pausepunkter er markert mellom løkkene.
Løkke 1 — Testen for variansen (kjikvadrat) (~12 min)
Kjikvadratfordelingen er skjev, så forkastningsområdet er asymmetrisk — man kan ikke bruke ett symmetrisk -tall. Retningene:
- : forkast hvis observatoren (øvre hale);
- : forkast hvis observatoren (nedre hale);
- : forkast hvis observatoren eller .
Legg merke til at normalitetsforutsetningen er viktigere her enn for t-testen for forventningen: kjikvadrat-testen er følsom for avvik fra normalfordelingen.
En produksjonsprosess for turbinblad skal ha varians mm i tykkelsen (altså mm). Femten tilfeldige blad gir empirisk varians mm. Tykkelsene antas normalfordelte. Test på 5 %-nivå om variansen er større enn tillatt.
Steg 2 — testobservator. under .
Steg 3 — forutsetninger. Normalfordelte, uavhengige tykkelser — oppgitt. OK (og kjikvadrat-testen krever normalitet).
Steg 4–5 — forkastningsområde og tallfesting.
Ensidig oppover, 5 %-nivå: forkast hvis observatoren . Siden , forkaster vi .
p-verdi. — samme konklusjon.
Steg 6 — konklusjon i ord. På 5 %-nivå er det grunnlag for å hevde at variansen i tykkelsen er større enn tillatt ( mot kravet ).
> Sensornotat: frihetsgraden er , og for en ensidig oppover-test bruker du den øvre kvantilen . Ved en tosidig test måtte du brukt begge, og .
(Innstegsoppgave.) En prosess skal ha varians . Tjue normalfordelte målinger gir . Test på 5 %-nivå om variansen er for stor (ensidig). Bruk .
a) Sett opp hypotesene og testobservatoren med fordeling under .
b) Regn ut observatoren og konkluder.
Løkke 2 — Eksakte tester for små utvalg (~13 min)
Normaltilnærmingen i andelstesten (kap. 7.1) og i Poisson-tilfeller krever store nok tall — og for andeler, stor for Poisson. Når forutsetningssjekken feiler (lite utvalg, lav rate), bruker vi i stedet fordelingen direkte:
- Eksakt binomisk test: under er antall suksesser . p-verdien er den eksakte halesannsynligheten fra den kumulative binomisk-tabellen, f.eks. for .
- Eksakt Poisson-test: under er antallet ; p-verdien leses fra den kumulative Poisson-tabellen.
Ingen -observator, ingen kvantiltabell — bare den kumulative fordelingen. Regelen er den samme: forkast hvis p-verdien .
En leverandør hevder at defektandelen er høyst . I et lite utvalg på komponenter finnes defekte. Fordi utvalget er lite, brukes en eksakt binomisk test. Test på 5 %-nivå om defektandelen overstiger 0,10.
Steg 2 — modell. Under er (antall defekte).
Steg 3 — hvorfor eksakt? Forventet antall under er , altså — normaltilnærmingen holder ikke, så vi bruker binomisk-fordelingen direkte.
Steg 4–5 — p-verdi. «Minst like ekstremt» oppover betyr :
(Slått opp i den kumulative binomisk-tabellen for , .)
Steg 6 — konklusjon. , så vi forkaster : på 5 %-nivå er det grunnlag for å hevde at defektandelen overstiger 10 %.
> Sensornotat: p-verdien er , altså inkludert det observerte antallet — ikke . Å bruke normaltilnærming her (der ) er nettopp fellen oppgaven tester.
En ny sveiserobot skal ha en feilrate på høyst per skjøt. Blant tilfeldige skjøter finnes feil. Utvalget er lite, så bruk en eksakt binomisk test. Test på 5 %-nivå om feilraten overstiger 0,08. (Oppgitt: for .)
Antall driftsstans i et anlegg antas Poisson-fordelt. Historisk er raten per måned, men en måned registreres . Test på 5 %-nivå om raten har økt, med en eksakt Poisson-test. (Oppgitt: for .)
Løkke 3 — Parret design: differansene som ETT utvalg (~13 min)
Her er gjennomsnittet av differansene og deres empiriske standardavvik. Testen er nøyaktig den vanlige t-testen fra kap. 7.1, brukt på differansene. Kjennetegn på parret design: målingene kommer i naturlige par (før/etter, samme enhet, matchede objekter). Fordelen er at parringen fjerner variasjonen mellom enhetene og gjør testen mer følsom.
pH-verdien i gjæringen måles i tanker før og etter en omlegging av prosessen. For hver tank regnes differansen . Differansene gir og . Test på 5 %-nivå om omleggingen har senket pH.
Steg 1 — hypoteser. «Senket» betyr negativ differanse: mot (ensidig nedover).
Steg 2 — testobservator. under .
Steg 3 — forutsetninger. Differansene antas normalfordelte og uavhengige (én per tank). OK.
Steg 4–5 — tallfesting. Standardfeil . Observator:
Ensidig nedover, frihetsgrader: forkast hvis . Siden , forkaster vi . p-verdi .
Steg 6 — konklusjon. På 5 %-nivå er det grunnlag for å hevde at omleggingen senket pH (i snitt med ).
> Sensornotat: den store fellen (Aug20/Mai24) er å behandle før- og etter-tallene som to uavhengige utvalg. Det er feil — de er parret, og differanse-analysen med er riktig. Vi supplerer med en fortegnstest i løkke 5.
Ti turbinblad testes for slitasje før og etter en ny belegningsmetode. For hvert blad er differansen (positiv = mindre slitasje etter). Differansene gir og (i mikrometer). Test på 5 %-nivå om belegget reduserer slitasjen. Bruk .
a) Begrunn at designet er parret, og sett opp hypotesene.
b) Regn ut observatoren og konkluder.
Løkke 4 — To uavhengige utvalg (pooled t) (~13 min)
Frihetsgraden er (vi har estimert to gjennomsnitt). Antagelsen om lik varians skal oppgis. Merk kontrasten til parret design: her er gruppene uavhengige, og vi kan ikke danne differanser par for par — vi sammenligner gjennomsnittene direkte.
To uavhengige produksjonslinjer måles på bruddstyrke (kN). Linje 1: , , . Linje 2: , , . Anta lik varians og normalfordelte data. Test på 5 %-nivå om linjene har ulik forventet bruddstyrke.
Steg 2 — testobservator. Pooled t: .
Steg 3 — forutsetninger. Uavhengige, normalfordelte, antatt lik varians (oppgitt).
Steg 4–5 — tallfesting. Pooled varians:
så . Standardfeil . Observator:
Tosidig, frihetsgrader: forkast hvis . Siden , forkaster vi ikke . p-verdi .
Steg 6 — konklusjon. På 5 %-nivå er det ikke grunnlag for å hevde at linjene har ulik forventet bruddstyrke — forskjellen ( kN) er ikke statistisk sikker med disse utvalgsstørrelsene.
> Sensornotat: frihetsgraden er , ikke . Og fordi dette er uavhengige utvalg (ikke samme enhet), kan vi ikke bruke parret t-test her.
To leverandører av samme sensor sammenlignes på responstid (ms). Leverandør A: , , . Leverandør B: , , . Anta lik varians og normalfordelte data. Test på 5 %-nivå om leverandørene har ulik forventet responstid. Bruk .
a) Er dette parret eller to uavhengige utvalg? Begrunn.
b) Regn ut pooled varians og observatoren, og konkluder.
Løkke 5 — Fortegnstesten (~13 min)
der er antall par med differanse forskjellig fra null (nuller forkastes). p-verdien er en eksakt binomisk halesannsynlighet. Hvorfor supplere t-testen? Fortegnstesten krever ikke at differansene er normalfordelte, så den er trygg ved skjeve data eller uteliggere. Hvorfor kan svarene sprike? Fortegnstesten kaster bort informasjon (bruker bare fortegn, ikke størrelse) og har derfor lavere styrke — den kan la være å forkaste der t-testen forkaster, særlig når effekten er tydelig i størrelse men fordelt på moderate differanser.
Bruk pH-dataene fra eksempel 3 ( tanker, målt før og etter omlegging). Det viser seg at tanker fikk lavere pH (negativ differanse) og fikk høyere (positiv), ingen uendret. Suppler den parrede t-testen med en fortegnstest på 5 %-nivå, og forklar hvorfor de to testene kan gi ulikt svar.
Steg 2 — modell. Under er . Vi observerte .
Steg 4–5 — p-verdi. «Minst like ekstremt» i retning av (senkning) betyr få positive, altså :
Steg 6 — konklusjon. , så forkast : også fortegnstesten støtter at pH ble senket.
Hvorfor kan de sprike? Her er begge enige. Men fortegnstesten bruker bare antall nedganger (11 av 14), ikke hvor mye pH sank. Den parrede t-testen (p = 0,013) utnytter størrelsen på differansene og har derfor lavere p-verdi — den er mer følsom når differansene faktisk er normalfordelte. Er de derimot skjeve eller har uteliggere, er fortegnstesten mer å stole på. Ved svakere data kan man derfor oppleve at t-testen forkaster mens fortegnstesten ikke gjør det (eller omvendt hvis en uteligger blåser opp ).
> Sensornotat: nuller (uendrede par) forkastes før telles. Og en tosidig fortegnstest ville brukt den doble halen — pass på å ikke regne en ensidig p-verdi der oppgaven er tosidig.
Tolv operatører prøver to tastaturoppsett og rangerer hvilket som gir færrest feil. Med oppsett B fikk operatører færre feil enn med A, fikk flere, ingen likt. Bruk en fortegnstest på 5 %-nivå til å avgjøre om B er bedre. La antall som gjorde flere feil med B.
a) Sett opp modellen for under og formuler hypotesene.
b) Regn p-verdien (bruk at , , , ) og konkluder.
c) Hvorfor kunne man valgt en parret t-test i stedet, og hva ville kreves for det?
- Behandle parrede data som to uavhengige utvalg (Aug20/Mai24 er konstruert for å avsløre nettopp dette). Måles samme enhet før/etter, er designet parret → analyser differansene med .
- Bruke normaltilnærming der eksakt test kreves (lite , , lav Poisson-rate) — og omvendt bruke eksakt der normaltilnærming er greit.
- Feil frihetsgrader i pooled-testen: det er , ikke .
- Symmetrisk forkastningsområde for variansen. Kjikvadratfordelingen er skjev; ensidig bruker én kvantil, tosidig to ulike ( og ).
- Regne tosidig fortegnstest ensidig (eller motsatt), og glemme å forkaste nuller før telles.
- Glemme at eksakt p-verdi inkluderer det observerte utfallet: , ikke .
Begrepsbank
Testfamilien samlet som repetisjonskort.
Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet.
For (normalfordelte data): under . Forkastningsområdet er asymmetrisk: ensidig oppover bruker , nedover , tosidig begge halene.
Kjikvadrat-testen for varians er følsom for avvik fra normalfordelingen — mer enn t-testen for forventningen. Er dataene tydelig ikke-normale, er testen upålitelig, og en mer robust metode bør vurderes. Oppgi normalitetsforutsetningen eksplisitt.
For : . For : . Den observerte verdien inkluderes i halen. Leses fra den kumulative binomisk-/Poisson-tabellen.
Målingene kommer i naturlige par: samme enhet før/etter, samme prøve med to metoder, matchede objekter. Da er seriene avhengige, og vi analyserer differansene . Signalord: «før og etter», «samme», «paret», «hver enhet målt to ganger».
Parring fjerner variasjonen mellom enhetene (hver enhet er sin egen kontroll), så bare selve endringen står igjen. Det gir en mer følsom test (høyere styrke) enn å sammenligne to uavhengige grupper — forutsatt at et parret design faktisk er mulig.
Pooled to-utvalgs-t har frihetsgrader — to trekkes fra fordi to gjennomsnitt er estimert. Ikke , og ikke . Feil frihetsgrad er en klassisk poengtapper her.
Under (ingen effekt) er en differanse like sannsynlig positiv som negativ, så , der er antall par med differanse ulik null. p-verdien er en eksakt binomisk halesannsynlighet.
Fortegnstesten bruker bare fortegnet, ikke størrelsen — derfor er den robust mot ikke-normalitet og uteliggere, men har lavere styrke enn t-testen. Bruk den som supplement når normalitet er tvilsom; stol på t-testen når differansene er normalfordelte.
Par med differanse nøyaktig null gir ingen informasjon om retning og forkastes før telles. Et datasett med 14 par der 2 er uendret, gir altså i binomisk-modellen. Å telle nullene med er en typisk feil.
Fordi fortegnstesten ignorerer størrelsen på differansene, kan den la være å forkaste der den parrede t-testen forkaster (lavere styrke). Motsatt kan en enkelt stor uteligger blåse opp og hindre t-testen i å forkaste, mens fortegnstesten (upåvirket av størrelse) fortsatt gjør det.
Der parret t-test tester om differansenes forventning er null, tester fortegnstesten om differansenes median er null (om opp og ned er like sannsynlig). Ved symmetriske fordelinger faller de to spørsmålene sammen; ved skjeve gjør de ikke det.
«Er variansen for stor?» → , øvre kvantil . «For liten / for jevn?» → , nedre kvantil . «Avviker?» → tosidig, begge kvantiler med .
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.
Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Norges teknisk-naturvitenskapelige universitet. Dette er ikke offisielt studiemateriell. Les mer.