Tilbake
2.6

2.6 Enveis ANOVA og ikke-parametriske alternativer

Enveis variansanalyse (F-test på gruppeforskjeller, koblet til dummy-regresjon), og de robuste alternativene når normalitet svikter: bootstrap-persentilintervall og rang-/Wilcoxon-test.

50 min
10 oppgaver
Enveis ANOVAikke-parametriske alternativer
Din fremgang i kapitlet
0 / 10 oppgaver
Kapitlets plass i kurset
Forkunnskaper: Dette kapitlet utvider to-utvalgssammenligningen i kap. 2.3 fra to til mange grupper, og bruker testritualet fra kap. 2.2 (hypoteser, observator med fordeling, P-verdi, konklusjon). F-fordelingen er den samme som i kap. 2.5.

Koblingen til dummy-regresjon peker framover mot Del 3 (multippel regresjon, kap. 3.3) — her holder det å kjenne sammenhengen.

Sist du var her (fra kap. 2.3 og 2.5 — det du trenger nå):

To grupper: T=Yˉ1Yˉ2Sp1/m+1/ntm+n2;F=S12S22Fν1,ν2.\text{To grupper: } T=\frac{\bar Y_1-\bar Y_2}{S_p\sqrt{1/m+1/n}}\sim t_{m+n-2};\qquad F=\frac{S_1^2}{S_2^2}\sim F_{\nu_1,\nu_2}.

Med to grupper sammenligner vi to gjennomsnitt med en t-test. Med tre eller flere grupper kan vi ikke bare kjøre mange t-tester (det blåser opp type I-raten) — vi trenger én samlet test. Det er nettopp det ANOVA gir, og observatoren er en F-brøk, akkurat som i F-testen for varianser.

Ofte skal vi sammenligne flere enn to grupper: virker tre behandlinger ulikt? Skiller fire jordtyper seg i avling? Å kjøre alle parvise t-tester øker sjansen for minst én falsk alarm kraftig. Enveis ANOVA løser dette med én F-test som spør: er det noen forskjell mellom gruppeforventningene i det hele tatt?

Og når normalitetsantakelsen svikter — QQ-plottet buer — finnes robuste alternativer: bootstrap (la dataene selv gi fordelingen) og rangtester (bruk rekkefølgen, ikke tallverdiene). Alt dette testes på tolknings- og oppsettnivå.

Vi går i tre løkker: (1) enveis ANOVA og F-testen, (2) bootstrap-persentilintervallet, (3) rang-/Wilcoxon-testen.

Løkke 1 — Enveis ANOVA og F-testen (~20 min)

Enveis ANOVA-modellen
Enveis variansanalyse (ANOVA) sammenligner forventningene i kk grupper. Modellen er
Xij=μi+εij,εijN(0,σ2) uavhengige,X_{ij}=\mu_i+\varepsilon_{ij},\qquad \varepsilon_{ij}\sim N(0,\sigma^2)\ \text{uavhengige},
der XijX_{ij} er observasjon jj i gruppe ii, μi\mu_i er gruppe iis forventning, og feilleddene har felles varians σ2\sigma^2. Antakelsene er altså: normalitet, uavhengighet og lik varians på tvers av grupper — de samme som bak den pooled to-utvalgstesten, generalisert til kk grupper.
Nullhypotesen i ANOVA
Nullhypotesen er at alle gruppeforventningene er like:
H0:μ1=μ2==μkmotHa:minst eˊμi skiller seg.H_0:\mu_1=\mu_2=\cdots=\mu_k\quad\text{mot}\quad H_a:\text{minst én } \mu_i\text{ skiller seg}.
Merk at HaH_a ikke sier hvilken eller hvor mange grupper som er ulike — bare at de ikke alle er like. En signifikant ANOVA forteller at det finnes en forskjell et sted, men ikke hvor (det krever oppfølgende kontraster).
Mean square between (MSB)
MSB måler variasjonen mellom gruppene: hvor mye gruppegjennomsnittene Xˉi\bar X_i spriker rundt totalgjennomsnittet. Den er kvadratsummen mellom grupper delt på frihetsgradene k1k-1:
MSB=SSBk1,SSB=i=1kni(XˉiXˉ)2.\text{MSB}=\frac{\text{SSB}}{k-1},\qquad \text{SSB}=\sum_{i=1}^k n_i(\bar X_i-\bar X)^2.
Stor MSB betyr at gruppegjennomsnittene ligger langt fra hverandre — et tegn på reell forskjell.
Mean square within (MSW)
MSW måler variasjonen innen gruppene — den rene støyen σ2\sigma^2. Den er kvadratsummen innen grupper delt på frihetsgradene NkN-k (der NN er totalt antall observasjoner):
MSW=SSWNk,SSW=i=1kj(XijXˉi)2.\text{MSW}=\frac{\text{SSW}}{N-k},\qquad \text{SSW}=\sum_{i=1}^k\sum_{j}(X_{ij}-\bar X_i)^2.
MSW er et forventningsrett anslag på σ2\sigma^2 uansett om H0H_0 er sann eller ikke — den generaliserer den pooled variansen Sp2S_p^2.
F-observatoren i ANOVA
Observatoren er forholdet mellom variasjon mellom og innen grupper:
F=MSBMSW  Fk1,Nk(under H0).F=\frac{\text{MSB}}{\text{MSW}}\ \sim\ F_{k-1,\,N-k}\quad(\text{under } H_0).
Under H0H_0 måler både teller og nevner bare σ2\sigma^2, så F1F\approx 1. Er gruppeforventningene ulike, blåses MSB opp, og FF blir stor. Vi forkaster H0H_0 for store FF (ensidig øvre hale): forkast når F>Fk1,Nk,αF>F_{k-1,\,N-k,\,\alpha}, eller når P-verdien P(Fk1,Nk>Fobs)<αP(F_{k-1,N-k}>F_{\text{obs}})<\alpha.
Å lese ANOVA-tabellen fra en R-utskrift (ren tekst — ingen kode): En enveis ANOVA presenteres som en tabell med én rad for gruppeeffekten og én for residualene:

            Df   Sum Sq   Mean Sq   F value   Pr(>F)
gruppe       2    84.30    42.15      6.72     0.0043
Residuals   27   169.40     6.27

Kolonnene: Df = frihetsgrader (k1=2k-1=2 mellom, Nk=27N-k=27 innen, så k=3k=3 grupper og N=30N=30 observasjoner). Sum Sq = kvadratsummene (SSB, SSW). Mean Sq = MSB =84,30/2=42,15=84{,}30/2=42{,}15 og MSW =169,40/27=6,27=169{,}40/27=6{,}27. F value = MSB/MSW =42,15/6,27=6,72=42{,}15/6{,}27=6{,}72. Pr(>F) = P-verdien =P(F2,27>6,72)=0,0043=P(F_{2,27}>6{,}72)=0{,}0043. Siden 0,0043<0,050{,}0043<0{,}05: forkast H0H_0 — minst én gruppe skiller seg.

✏️Eksempel 1: Enveis ANOVA fra R-utskrift (sjanger M)

Tre behandlinger (A, B, C) testes for effekt på vektøkning, med til sammen N=30N=30 dyr. En enveis ANOVA gir tabellen over (F value =6,72=6{,}72, Pr(>F) =0,0043=0{,}0043). Formuler hypotesene, oppgi observatoren med fordeling under H0H_0, og konkluder på 5 %-nivå.

1. H0:μA=μB=μCH_0:\mu_A=\mu_B=\mu_C mot Ha:H_a: minst én gruppe skiller seg.

2. Observator F=MSB/MSWF=\text{MSB}/\text{MSW}. Under H0H_0: FFk1,Nk=F2,27F\sim F_{k-1,\,N-k}=F_{2,\,27} (3 grupper, 30 observasjoner).

3. Fra utskriften: Fobs=42,15/6,27=6,72F_{\text{obs}}=42{,}15/6{,}27=6{,}72, med P-verdi Pr(>F)=P(F2,27>6,72)=0,0043\text{Pr(>F)}=P(F_{2,27}>6{,}72)=0{,}0043.

4. Siden 0,0043<0,050{,}0043<0{,}05: forkast H0H_0.

5. På 5 %-nivå er det belegg for at minst én av behandlingene gir ulik forventet vektøkning. Merk: ANOVA sier at det finnes en forskjell, ikke hvilke grupper som skiller seg — det krever oppfølgende parvise sammenligninger (kontraster).

📝Oppgave 1

En enveis ANOVA med k=3k=3 grupper og N=24N=24 observasjoner gir SSB =120,6=120{,}6 og SSW =210,0=210{,}0.

a) Regn ut MSB, MSW og F-observatoren.

b) Angi fordelingen under H0H_0 og konkluder på 5 %-nivå. Opplyst: P(F2,21>6,03)0,009P(F_{2,21}>6{,}03)\approx 0{,}009.

Kobling: ANOVA som dummy-regresjon
Enveis ANOVA er en lineær regresjon på indikatorvariabler (dummyer). Med kk grupper koder man k1k-1 dummyer (én gruppe er referanse), og hver regresjonskoeffisient er forskjellen mellom en gruppes forventning og referansens. ANOVAs F-test tilsvarer regresjonens samlede F-test (alle helninger =0=0), og enkeltforskjeller (kontraster) testes med t-tester på koeffisientene. Dette utdypes i Del 3 (kap. 3.3). (Prioritet: kjenne til nå.)

Løkke 2 — Bootstrap-persentilintervallet (~15 min)

Empirisk fordelingsfunksjon
Den empiriske fordelingsfunksjonen er dataenes egen «fordeling»:
F^(x)=1ni=1nI(xix),\hat F(x)=\frac{1}{n}\sum_{i=1}^n I(x_i\le x),
altså andelen observasjoner som er x\le x. Den legger like stor sannsynlighet 1/n1/n på hvert datapunkt. Bootstrap bruker F^\hat F som en erstatning for den ukjente sanne fordelingen FF — vi later som dataene er populasjonen.
Bootstrap (persentilmetoden)
Bootstrap anslår usikkerheten i en estimator uten å anta en bestemt fordeling. Idéen (konseptuelt — ingen kode): trekk et nytt utvalg av størrelse nn med tilbakelegging fra de opprinnelige dataene, regn ut estimatoren på dette gjenutvalget, og gjenta BB ganger (f.eks. B=2000B=2000). De BB estimatene danner en bootstrap-fordeling som etterligner estimatorens virkelige variasjon. Metoden krever bare svake antakelser.
Bootstrap-persentilintervall
Et (1α)(1-\alpha) persentilintervall leses direkte av bootstrap-fordelingen: sorter de BB estimatene og ta α/2\alpha/2- og (1α/2)(1-\alpha/2)-persentilene som nedre og øvre grense. For 95 % er det 2,5- og 97,5-persentilene. Når bootstrap-histogrammet er tilnærmet normalt og symmetrisk, ligner persentilintervallet på det vanlige θ^±zα/2se\hat\theta\pm z_{\alpha/2}\,se-intervallet — men persentilmetoden fanger også skjevhet.
✏️Eksempel 2: Bootstrap-persentilintervall (sjanger O)

En analytiker vil ha et 95 % konfidensintervall for medianen levetid, men fordelingen er tydelig skjev, så en normaltilnærming er tvilsom. Hun trekker B=2000B=2000 gjenutvalg med tilbakelegging, regner medianen i hvert, og finner at 2,5-persentilen av de 2000 medianene er 12,4 og 97,5-persentilen er 18,1. Angi persentilintervallet og tolk det, og kommentér forholdet til et normaltilnærmet intervall.

Persentilintervallet leses direkte av bootstrap-fordelingen:
95 % persentil-KI=[12,4, 18,1].\text{95 \% persentil-KI} = [12{,}4,\ 18{,}1].

Tolkning: vi er 95 % konfidente på at den sanne medianlevetiden ligger mellom 12,4 og 18,1 — uten å ha antatt noen bestemt fordeling. Intervallet er bygget fra dataenes egen variasjon (via F^\hat F).

Kommentar: hadde fordelingen vært tilnærmet normal og symmetrisk, ville persentilintervallet ligget nær et θ^±1,96se\hat\theta\pm 1{,}96\,se-intervall. Her er dataene skjeve, så persentilmetoden — som ikke tvinger fram symmetri — er mer pålitelig. Å blande de to (f.eks. bruke bootstrap-sese i en symmetrisk normalformel og kalle det persentilintervall) er en klassisk feil (§5.14).

📝Oppgave 2

Et bootstrap med B=1000B=1000 gjenutvalg gir en fordeling for et gjennomsnitt der 2,5-persentilen er 48,0 og 97,5-persentilen er 55,0.

a) Skriv opp 95 % bootstrap-persentilintervallet.

b) Punktestimatet er xˉ=51,0\bar x=51{,}0. Er intervallet symmetrisk om estimatet, og hva forteller det deg?

Løkke 3 — Rang-/Wilcoxon-testen (~15 min)

QQ-plott og normalitet
Et QQ-plott tegner de sorterte observasjonene mot forventede normalkvantiler. Ligger punktene på en tilnærmet rett linje, er normalantakelsen rimelig. Systematisk kurvatur eller tydelig S-form (tunge haler, skjevhet) tyder på ikke-normalitet. Da er t-testen — som antar normale data — mindre pålitelig, særlig ved små utvalg, og en rangbasert test er å foretrekke.
Rang-/Wilcoxon-test
Rangtester bytter tallverdiene med deres ranger (rekkefølge) og tester på rangene i stedet. Wilcoxons rangsumtest (også kalt Mann–Whitney) er det ikke-parametriske alternativet til to-utvalgs t-test; Wilcoxons signed-rank er alternativet til den parvise t-testen. De antar ikke normalitet — bare at fordelingene har lik form — og er robuste mot uteliggere. Prisen er litt lavere styrke når dataene faktisk er normale. På eksamen kreves bare oppsett og tolkning, ikke manuell utregning av rangsummer.
✏️Eksempel 3: Rangtest når normalitet svikter (sjanger O)

To metoder skal sammenlignes på n=12n=12 små, skjeve målinger. QQ-plottet buer tydelig (tunge haler). En to-utvalgs t-test gir P-verdi 0,03, mens en Wilcoxon rangsumtest gir «W = 62, p-value = 0,078». Forklar hvorfor rangtesten er å foretrekke her, og hva forskjellen i P-verdi betyr for konklusjonen.

Hvorfor rangtest: QQ-plottet viser klart brudd på normalitet, og med bare 12 observasjoner kan ikke sentralgrenseteoremet redde t-testen. Rangtesten antar ikke normalitet og er robust mot de tunge halene — dens forutsetninger er oppfylt, t-testens er ikke.

Forskjellen i P-verdi: t-testens 0,03 (signifikant på 5 %) hviler på en antakelse som ikke holder, så den kan være for optimistisk. Rangtestens 0,078 bygger på svakere, oppfylte antakelser og gir ikke signifikans på 5 %. Med svakere antakelser får man gjerne en høyere/svakere P-verdi — prisen for robusthet.

Konklusjon: vi bør stole på rangtesten: på 5 %-nivå er det ikke tilstrekkelig belegg for en forskjell mellom metodene. Å rapportere t-testens 0,03 som «signifikant» ville vært misvisende her.

📝Oppgave 3

En forsker har n=9n=9 observasjoner med et QQ-plott som viser en tydelig S-form.

a) Hva antyder S-formen om dataene?

b) Bør hun bruke en t-test eller en rangtest, og hvorfor?

c) Hvis rangtesten gir en høyere P-verdi enn t-testen, betyr det at rangtesten er «dårligere»?

Blandet drill (sjanger M + O, stigende)

📝Oppgave 4

En enveis ANOVA med k=4k=4 grupper og N=40N=40 observasjoner gir følgende R-utskrift:

            Df   Sum Sq   Mean Sq   F value   Pr(>F)
gruppe       3    54.0     18.00     1.80     0.165
Residuals   36   360.0     10.00

a) Verifiser Mean Sq- og F value-kolonnene.

b) Konkluder på 5 %-nivå.

c) En medstudent skriver «ANOVA viser at alle fire gruppene har lik forventning». Er det en korrekt konklusjon?

📝Oppgave 5

(Krevende.) Forklar konseptuelt, uten kode, hvordan du ville bygget et 90 % bootstrap-persentilintervall for standardavviket σ\sigma i et lite, skjevt datasett med n=15n=15 observasjoner. Angi hvilke persentiler du leser av.

📝Oppgave 6

(Kald oppgave — fasit som momentliste, ingen hint.) En enveis ANOVA på k=3k=3 grupper med N=18N=18 gir MSB =24,0=24{,}0 og MSW =4,0=4{,}0. Angi observatoren med fordeling under H0H_0, tallfest F, og forklar hva du trenger for å konkludere. Deretter: QQ-plottet av residualene buer tydelig — hva bør du gjøre?

Begrepsbank

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet. Korte, navngitte definisjoner for eksamensrepetisjon.
ANOVA-tabellen (les fra R-utskrift)

Rader: gruppe (mellom) og Residuals (innen). Kolonner: Df (k1k-1 og NkN-k), Sum Sq (SSB, SSW), Mean Sq (MSB, MSW), F value (MSB/MSW), Pr(>F) (P-verdien). Alt leses direkte; ingen kode kreves.

Parametrisk mot ikke-parametrisk

Parametriske tester (t, F, ANOVA) antar en bestemt fordeling (normal). Ikke-parametriske (rang, bootstrap) krever svakere antakelser og er robuste mot uteliggere/skjevhet, mot litt lavere styrke når normalitet faktisk holder.

Ikke-signifikant ANOVA

Å ikke forkaste H0H_0 i ANOVA betyr «ikke belegg for forskjell» — IKKE at gruppene er like. En signifikant ANOVA sier bare at én forskjell finnes, ikke hvilke grupper som skiller seg.

Kontraster

Etter en signifikant ANOVA testes enkeltforskjeller mellom grupper med kontraster — i praksis t-tester på koeffisientene i den tilsvarende dummy-regresjonen. De sier hvilke grupper som skiller seg (utdypes i kap. 3.3).

Symbol- og formelliste
Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.