Tilbake
7.1

7.1 Testritualet: hypoteser, testobservator, p-verdi og konklusjon i ord

Den obligatoriske seksstegs-liturgien for z- og t-tester — slik løsningsforslagene faktisk skriver den.

65 min
10 oppgaver
Testritualethypotesertestobservatorp-verdikonklusjon i ord
Din fremgang i kapitlet
0 / 10 oppgaver
Forkunnskaper: Dette kapitlet bygger direkte på konfidensintervallene i kap. 6.1 (samme kvantiler og samme fordelinger, snudd til en beslutning), standardiseringen og kvantilnotasjonen fra kap. 3.1, gjennomsnittets fordeling fra kap. 3.2 og sentralgrenseteoremet med gyldighetssjekken fra kap. 3.3.

Sist du var her — de tre resultatene vi bygger testene på (ferdig oppfrisket):

1. Standardisering: for XN(μ,σ2)X \sim N(\mu, \sigma^2) er Z=XμσN(0,1)\displaystyle Z = \frac{X-\mu}{\sigma} \sim N(0,1), og zαz_\alpha er tallet med øvre haleareal α\alpha: P(Z>zα)=αP(Z > z_\alpha) = \alpha (så z0,05=1,645z_{0{,}05}=1{,}645, z0,025=1,96z_{0{,}025}=1{,}96).
2. Gjennomsnittets fordeling: for uavhengige, identisk fordelte normale observasjoner er
XˉN ⁣(μ,σ2n),sa˚Xˉμσ/nN(0,1).\bar{X} \sim N\!\left(\mu, \frac{\sigma^2}{n}\right), \qquad \text{så} \qquad \frac{\bar{X}-\mu}{\sigma/\sqrt{n}} \sim N(0,1).
3. t-formen ved ukjent σ\sigma: når vi bytter σ\sigma mot den empiriske ss, er XˉμS/ntn1\displaystyle \frac{\bar{X}-\mu}{S/\sqrt{n}} \sim t_{n-1} (n1n-1 frihetsgrader) — nøyaktig samme byttet som ga t-intervallet i kap. 6.1.

Du trenger ikke ny matematikk. En hypotesetest er egentlig bare et konfidensintervall snudd til et ja/nei-spørsmål: er den påståtte parameterverdien forenlig med dataene, eller ikke?

Vi går gjennom fem løkker. Først ritualet — de seks stegene som hver eneste test følger, med hypoteser, testobservator og de sentrale begrepene (løkke 1). Så de tre testene du møter oftest: z-test når σ\sigma er kjent (løkke 2), t-test når σ\sigma er ukjent (løkke 3), og en grundig gjennomgang av p-verdien med de faste feiltolkningene (løkke 4). Til slutt testen for en andel, sammen med type I/II-feil, signifikansnivået og dualiteten mot konfidensintervallet (løkke 5). Hver løkke går teori \to eksempel \to oppgave.

Samlet kjernetid ≈ 65 min. Naturlige pausepunkter er markert mellom løkkene — dette er kjernekapitlet i hele boka; ta det gjerne i to økter.

Løkke 1 — Testritualet: de seks stegene (~14 min)

En hypotesetest er en fast prosedyre — nesten en liturgi. Løsningsforslagene skriver den alltid i de samme seks stegene, og sensor gir poeng steg for steg. Lær rekkefølgen utenat, så du aldri mister et delpunkt under tidspress.

En kort begrepsavklaring før stegene: en hypotese er en påstand om en ukjent parameter (for eksempel «forventningen er 200»). En testobservator (også kalt testStatistikk) er et tall vi regner ut fra dataene, og som har en kjent fordeling dersom nullhypotesen er sann — det er den kjente fordelingen som lar oss måle hvor overraskende dataene er.

De seks stegene:

1. Formuler H0H_0 og H1H_1 i parametre. Nullhypotesen H0H_0 er «ingen endring / påstanden stemmer»; alternativhypotesen H1H_1 er det du vil påvise. Retningen på H1H_1 (<<, >> eller \ne) følger av situasjonen — hva ønsker vi å vise?
2. Velg testobservator og oppgi fordelingen under H0H_0. For eksempel Z=Xˉμ0σ/nN(0,1)\displaystyle Z = \frac{\bar{X}-\mu_0}{\sigma/\sqrt{n}} \sim N(0,1) eller T=Xˉμ0S/ntn1\displaystyle T = \frac{\bar{X}-\mu_0}{S/\sqrt{n}} \sim t_{n-1}. Å skrive fordelingen eksplisitt er et eget poeng.
3. Sjekk forutsetningene. Normalitet, uavhengige observasjoner, og for andeler np05np_0 \ge 5 og n(1p0)5n(1-p_0) \ge 5.
4. Finn forkastningsområdet ved gitt α\alpha ELLER regn p-verdien. De to veiene gir alltid samme konklusjon — vi viser begge, og fører den ene komplett.
5. Tallfest. Sett inn tallene og regn ut observatoren.
6. Konkluder i ord, i kontekst. «Det er (ikke) grunnlag for å hevde at ...» — knyttet til den opprinnelige situasjonen.

Intuisjon: vi later som om H0H_0 er sann, regner ut hvor langt ute i halen dataene havner, og forkaster H0H_0 bare dersom de er så ekstreme at det ville vært usannsynlig ren tilfeldighet.

Nullhypotese H0H_0 og alternativhypotese H1H_1

En nullhypotese H0H_0 er en presis påstand om en parameter — utgangspunktet vi tester mot, som regel «status quo» eller «leverandøren har rett» (f.eks. H0:μ=200H_0: \mu = 200). Alternativhypotesen H1H_1 er det vi ønsker å påvise, og den bestemmer testens retning:

- H1:μ>μ0H_1: \mu > \mu_0 (ensidig oppover) — vi vil vise at parameteren er større;
- H1:μ<μ0H_1: \mu < \mu_0 (ensidig nedover) — at den er mindre;
- H1:μμ0H_1: \mu \ne \mu_0 (tosidig) — at den bare er forskjellig.

Tommelfingerregel: det du blir bedt om å påvise (eller det som ville vært bekymringsfullt), settes som H1H_1. Bevisbyrden ligger på H1H_1 — vi forkaster H0H_0 bare hvis dataene taler klart imot den.

Oppskriftskort: testritualet i seks steg

Enhver test: (1) H0H_0 og H1H_1 i parametre, retning på H1H_1 begrunnet; (2) testobservator med fordeling under H0H_0; (3) forutsetningssjekk (normalitet, uavhengighet, evt. np0,n(1p0)5np_0, n(1-p_0) \ge 5); (4) forkastningsområde ved α\alpha eller p-verdi; (5) tallfest; (6) konkluder i ord i kontekst. De seks stegene gir poeng hver for seg — hopp aldri over steg 2 eller 6.

✏️Eksempel 1: Sett opp hypotesene med riktig retning

For hver situasjon, sett opp H0H_0 og H1H_1 i parametre, og begrunn retningen.

a) En turbinbladprodusent skal ha gjennomsnittlig tykkelse nøyaktig μ0=12,00\mu_0 = 12{,}00 mm. Kvalitetskontrollen vil oppdage ethvert avvik.

b) En leverandør hevder at gjennomsnittlig responstid er høyst 200 ms. En kunde mistenker at den i virkeligheten er lengre.

a) Kvalitetskontrollen bryr seg om avvik i begge retninger (for tykk eller for tynn er begge dårlig), så testen er tosidig:
H0:μ=12,00motH1:μ12,00.H_0: \mu = 12{,}00 \qquad \text{mot} \qquad H_1: \mu \ne 12{,}00.

b) Kunden vil påvise at responstiden er lengre enn påstått, så det bekymringsfulle utfallet settes som H1H_1 (ensidig oppover):
H0:μ=200motH1:μ>200.H_0: \mu = 200 \qquad \text{mot} \qquad H_1: \mu > 200.
(Vi skriver H0H_0 med likhet μ=200\mu = 200; det er «verste tillatte tilfelle» av påstanden μ200\mu \le 200, og testen utføres ved grensen.)

> Sensornotat: retningen på H1H_1 er ikke en smakssak — den følger av hva som skal påvises, og den styrer både kritisk verdi og p-verdi. Feil retning gir feil svar.

📝Oppgave 1

(Innstegsoppgave — bare oppsett, ingen regning.) Sett opp H0H_0 og H1H_1 i parametre for hver situasjon, og oppgi om testen er ensidig eller tosidig.

a) Et vannrenseanlegg skal holde gjennomsnittlig turbiditet under grenseverdien 2,02{,}0 NTU. Vi vil påvise at nivået overstiger grensen.

b) En maskin skal fylle poser med forventet vekt 500500 g; avvik i begge retninger er uønsket.

Løkke 2 — z-testen når σ\sigma er kjent (~12 min)

Testobservator og fordeling under H0H_0: z-testen
Når standardavviket σ\sigma er kjent (oppgitt fra lang produksjonshistorikk e.l.), bruker vi z-testen for forventningen. Testobservatoren er den standardiserte avstanden mellom observert gjennomsnitt og den påståtte verdien μ0\mu_0:

Z=Xˉμ0σ/n,under H0: ZN(0,1).Z = \frac{\bar{X} - \mu_0}{\sigma/\sqrt{n}}, \qquad \text{under } H_0:\ Z \sim N(0,1).

Setningen «under H0H_0 er ZN(0,1)Z \sim N(0,1)» er hele poenget: hvis μ\mu virkelig er μ0\mu_0, er ZZ standardnormal, og da vet vi nøyaktig hvor overraskende en gitt verdi er. Beslutningen tas på én av to likeverdige måter:

- Forkastningsområde: forkast H0H_0 ved nivå α\alpha hvis Z>zα/2|Z| > z_{\alpha/2} (tosidig), Z>zαZ > z_\alpha (ensidig oppover) eller Z<zαZ < -z_\alpha (ensidig nedover).
- p-verdi: regn sannsynligheten for et minst like ekstremt utfall (løkke 4) og forkast hvis p<αp < \alpha.

✏️Eksempel 2: z-test for turbinbladtykkelse (tosidig)

Tykkelsen på turbinblad er normalfordelt med kjent standardavvik σ=0,15\sigma = 0{,}15 mm fra lang produksjonshistorikk. Måltykkelsen er μ0=12,00\mu_0 = 12{,}00 mm. Et utvalg på n=25n = 25 blad gir xˉ=12,07\bar{x} = 12{,}07 mm. Test på 5 %-nivå om tykkelsen avviker fra målet. Vis både forkastningsområde og p-verdi.

Steg 1 — hypoteser. Avvik begge veier er uønsket, så testen er tosidig: H0:μ=12,00H_0: \mu = 12{,}00 mot H1:μ12,00H_1: \mu \ne 12{,}00.

Steg 2 — testobservator. σ\sigma er kjent, så Z=Xˉμ0σ/nN(0,1)\displaystyle Z = \frac{\bar{X}-\mu_0}{\sigma/\sqrt{n}} \sim N(0,1) under H0H_0.

Steg 3 — forutsetninger. Tykkelsene antas normalfordelte og uavhengige (tilfeldig uttrekk fra produksjonen). OK.

Steg 4–5 — forkastningsområde og tallfesting. Standardfeil σ/n=0,15/25=0,15/5=0,03\sigma/\sqrt{n} = 0{,}15/\sqrt{25} = 0{,}15/5 = 0{,}03. Observatoren:
Z=12,0712,000,03=0,070,03=2,333.Z = \frac{12{,}07 - 12{,}00}{0{,}03} = \frac{0{,}07}{0{,}03} = 2{,}333.
Tosidig 5 %-nivå: forkast hvis Z>z0,025=1,96|Z| > z_{0{,}025} = 1{,}96. Siden 2,333>1,962{,}333 > 1{,}96, forkaster vi H0H_0.

p-verdi (samme konklusjon). Tosidig: p=2P(Z>2,333)=20,0098=0,0196p = 2\,P(Z > 2{,}333) = 2 \cdot 0{,}0098 = 0{,}0196. Siden p=0,0196<0,05p = 0{,}0196 < 0{,}05, forkaster vi — akkurat som over.

Steg 6 — konklusjon i ord. På 5 %-nivå er det grunnlag for å hevde at gjennomsnittlig tykkelse avviker fra måltykkelsen 12,00 mm (den ligger for høyt, xˉ=12,07\bar{x} = 12{,}07).

> Sensornotat: oppgi tabelloppslaget (z0,025=1,96z_{0{,}025}=1{,}96), standardfeilen (0,030{,}03) og fordelingen under H0H_0. Ved tosidig test dobles halesannsynligheten i p-verdien.

📝Oppgave 2

En batteritype skal ha forventet kapasitet μ0=3,5\mu_0 = 3{,}5 Ah, med kjent standardavvik σ=0,20\sigma = 0{,}20 Ah. Et utvalg på n=30n = 30 celler gir xˉ=3,58\bar{x} = 3{,}58 Ah. Test på 5 %-nivå om kapasiteten avviker fra 3,53{,}5 (tosidig).

a) Sett opp hypotesene og testobservatoren med fordeling under H0H_0.

b) Regn ut observatoren og konkluder både via forkastningsområde og p-verdi.

Løkke 3 — t-testen når σ\sigma er ukjent (~13 min)

t-testen for ett utvalg
I praksis kjenner vi nesten aldri den sanne σ\sigma. Da estimerer vi den med det empiriske standardavviket ss, og — akkurat som for konfidensintervallet i kap. 6.1 — koster det ekstra usikkerhet: vi bytter normalfordelingen ut med t-fordelingen med n1n-1 frihetsgrader. Testobservatoren er:

T=Xˉμ0S/n,under H0: Ttn1.T = \frac{\bar{X} - \mu_0}{S/\sqrt{n}}, \qquad \text{under } H_0:\ T \sim t_{n-1}.

Alt annet i ritualet er som for z-testen, men kritisk verdi hentes fra t-tabellen: forkast hvis T>tn1,α/2|T| > t_{n-1,\,\alpha/2} (tosidig) eller T>tn1,αT > t_{n-1,\,\alpha} / T<tn1,αT < -t_{n-1,\,\alpha} (ensidig). Fordi t-fordelingen har tyngre haler enn normalfordelingen, er tn1,α>zαt_{n-1,\alpha} > z_\alpha — det skal litt mer til for å forkaste når vi også må estimere spredningen. Dette er den hyppigste testtypen på eksamen.

✏️Eksempel 3: t-test for responstid (ensidig)

En leverandør hevder at gjennomsnittlig responstid i et alarmsystem er høyst 200 ms. Tolv uavhengige målinger gir xˉ=214\bar{x} = 214 ms og s=21s = 21 ms; standardavviket er ukjent, og responstidene antas normalfordelte. Test påstanden på 5 %-nivå.

Steg 1 — hypoteser. Vi vil påvise at responstiden er lengre enn påstått, så: H0:μ=200H_0: \mu = 200 mot H1:μ>200H_1: \mu > 200 (ensidig oppover).

Steg 2 — testobservator. σ\sigma ukjent → T=Xˉμ0S/ntn1=t11\displaystyle T = \frac{\bar{X}-\mu_0}{S/\sqrt{n}} \sim t_{n-1} = t_{11} under H0H_0.

Steg 3 — forutsetninger. Normalfordelte, uavhengige målinger — oppgitt. OK.

Steg 4–5 — forkastningsområde og tallfesting. Standardfeil s/n=21/12=6,062s/\sqrt{n} = 21/\sqrt{12} = 6{,}062. Observatoren:
T=2142006,062=146,062=2,309.T = \frac{214 - 200}{6{,}062} = \frac{14}{6{,}062} = 2{,}309.
Ensidig 5 %-nivå, n1=11n-1 = 11 frihetsgrader: forkast hvis T>t11;0,05=1,796T > t_{11;\,0{,}05} = 1{,}796. Siden 2,309>1,7962{,}309 > 1{,}796, forkaster vi H0H_0.

p-verdi. p=P(T11>2,309)=0,021p = P(T_{11} > 2{,}309) = 0{,}021. Siden 0,021<0,050{,}021 < 0{,}05, forkast — samme konklusjon.

Steg 6 — konklusjon i ord. På 5 %-nivå er det grunnlag for å hevde at gjennomsnittlig responstid overstiger 200 ms — leverandørens påstand svekkes av dataene.

> Sensornotat: den klassiske fellen er zz i stedet for tt her. Med ukjent σ\sigma skal det være t11t_{11}, og frihetsgraden er n1=11n-1 = 11, ikke 1212. Merk at ensidig test bruker t11;0,05t_{11;\,0{,}05} (hele 5 % i én hale), ikke t11;0,025t_{11;\,0{,}025}.

📝Oppgave 3

pH-verdien i en gjæringstank skal holdes på μ0=7,00\mu_0 = 7{,}00. Ni målinger gir xˉ=7,13\bar{x} = 7{,}13 og s=0,15s = 0{,}15; standardavviket er ukjent, og målingene antas normalfordelte. Test på 5 %-nivå om pH avviker fra 7,007{,}00 (tosidig). Bruk t8;0,025=2,306t_{8;\,0{,}025} = 2{,}306.

a) Begrunn valget av t framfor z.

b) Regn ut testobservatoren og konkluder i ord.

Løkke 4 — p-verdien, presist (~13 min)

p-verdien
p-verdien er sannsynligheten, beregnet under forutsetning av at H0H_0 er sann, for å få et utfall minst like ekstremt som det observerte — der «ekstremt» betyr «i retning av H1H_1».

- Ensidig oppover (H1:μ>μ0H_1: \mu > \mu_0): p=P(observatorobservert verdiH0)p = P(\text{observator} \ge \text{observert verdi} \mid H_0), altså den øvre halen.
- Ensidig nedover: den nedre halen.
- Tosidig (H1:μμ0H_1: \mu \ne \mu_0): begge haler, altså det dobbelte av den ene halen: p=2P(observatorobservertH0)p = 2\,P(\text{observator} \ge |\text{observert}| \mid H_0).

Beslutningsregel: forkast H0H_0 hvis p<αp < \alpha; behold ellers. p-verdien er «hvor overraskende dataene er dersom H0H_0 stemmer» — en liten p-verdi betyr at dataene passer dårlig med H0H_0. Den er ikke sannsynligheten for at H0H_0 er sann (se antisvar under).

✏️Eksempel 4: Regn og tolk p-verdien

En ingeniør tester om gjennomsnittlig sykluslevetid til et relé overstiger μ0=50000\mu_0 = 50\,000 sykluser. En t-test med n=16n = 16 gir observatoren T=1,98T = 1{,}98 (t15t_{15} under H0H_0), og testen er ensidig oppover.

a) Regn p-verdien (bruk P(T15>1,98)=0,033P(T_{15} > 1{,}98) = 0{,}033).

b) Konkluder på 5 %- og på 1 %-nivå.

c) En kollega sier: «p-verdien 0,033 betyr at det er 3,3 % sannsynlighet for at H0H_0 er sann.» Er det riktig?

a) Ensidig oppover, så p-verdien er den øvre halen: p=P(T15>1,98)=0,033p = P(T_{15} > 1{,}98) = 0{,}033.

b) På 5 %-nivå: p=0,033<0,05p = 0{,}033 < 0{,}05forkast H0H_0; det er grunnlag for å hevde at levetiden overstiger 50 000. På 1 %-nivå: p=0,033>0,01p = 0{,}033 > 0{,}01forkast ikke; på det strengere nivået er ikke beviset sterkt nok. Samme data kan altså gi ulik konklusjon avhengig av α\alpha — derfor skal alltid nivået oppgis.

c) Nei. p-verdien er sannsynligheten for et minst like ekstremt datautfall gitt at H0H_0 er sann — ikke sannsynligheten for at H0H_0 er sann. H0H_0 er ikke tilfeldig; det er dataene (og dermed TT) som er det.

> Sensornotat: å knytte p-verdien til «sannsynligheten for at H0H_0 stemmer» er den vanligste feilen sensor ser — og en fast distraktor i flervalget.

📝Oppgave 4

En tosidig z-test gir observator Z=1,75Z = 1{,}75.

a) Regn den tosidige p-verdien (bruk P(Z>1,75)=0,0401P(Z > 1{,}75) = 0{,}0401).

b) Konkluder på 5 %-nivå.

c) Forklar med én setning hvorfor p-verdien for en tosidig test dobles i forhold til den ensidige.

Løkke 5 — Andelstest, feiltyper og dualiteten mot KI (~13 min)

Testen for en andel
Når vi teller hvor mange av nn enheter som har en egenskap, tester vi den ukjente andelen pp. Under H0:p=p0H_0: p = p_0 er p^=X/n\hat{p} = X/n tilnærmet normalfordelt (sentralgrenseteoremet), og testobservatoren er:

Z=p^p0p0(1p0)/n,under H0: ZN(0,1).Z = \frac{\hat{p} - p_0}{\sqrt{p_0(1-p_0)/n}}, \qquad \text{under } H_0:\ Z \approx N(0,1).

Merk: standardfeilen i nevneren bruker p0p_0 (den påståtte verdien under H0H_0), ikke p^\hat{p} — det er forskjellen fra konfidensintervallet, som bruker p^\hat{p}. Forutsetningssjekk (obligatorisk): normaltilnærmingen krever np05np_0 \ge 5 og n(1p0)5n(1-p_0) \ge 5. Beslutning som ellers: forkast hvis ZZ faller i halen(e) bestemt av H1H_1 og α\alpha.

✏️Eksempel 5: z-test for en andel (falske alarmer)

En produsent hevder at andelen falske alarmer i et system er høyst p0=0,05p_0 = 0{,}05. I n=200n = 200 uavhengige testkjøringer registreres 1616 falske alarmer. Test påstanden på 5 %-nivå.

Steg 1 — hypoteser. Vi vil påvise at andelen er høyere enn påstått: H0:p=0,05H_0: p = 0{,}05 mot H1:p>0,05H_1: p > 0{,}05 (ensidig oppover).

Steg 2 — testobservator. Z=p^p0p0(1p0)/nN(0,1)\displaystyle Z = \frac{\hat{p}-p_0}{\sqrt{p_0(1-p_0)/n}} \approx N(0,1) under H0H_0.

Steg 3 — forutsetninger. np0=2000,05=105np_0 = 200 \cdot 0{,}05 = 10 \ge 5 og n(1p0)=1905n(1-p_0) = 190 \ge 5 — normaltilnærmingen er gyldig.

Steg 4–5 — tallfesting. p^=16/200=0,08\hat{p} = 16/200 = 0{,}08. Standardfeil 0,050,95/200=0,0002375=0,01541\sqrt{0{,}05 \cdot 0{,}95/200} = \sqrt{0{,}0002375} = 0{,}01541. Observator:
Z=0,080,050,01541=1,947.Z = \frac{0{,}08 - 0{,}05}{0{,}01541} = 1{,}947.
Ensidig 5 %-nivå: forkast hvis Z>z0,05=1,645Z > z_{0{,}05} = 1{,}645. Siden 1,947>1,6451{,}947 > 1{,}645, forkaster vi. p-verdi =P(Z>1,947)=0,026<0,05= P(Z > 1{,}947) = 0{,}026 < 0{,}05 — samme konklusjon.

Steg 6 — konklusjon i ord. På 5 %-nivå er det grunnlag for å hevde at andelen falske alarmer overstiger 5 % — påstanden svekkes.

> Sensornotat: bruk p0=0,05p_0 = 0{,}05 i standardfeilen, ikke p^=0,08\hat{p} = 0{,}08. Og skriv forutsetningssjekken np0,n(1p0)5np_0, n(1-p_0) \ge 5 eksplisitt.

📝Oppgave 5

En innkjøpssjef har fått lovnad om at minst 80 % av leverte ventiler tåler trykktesten (altså feilandel p0,20p \le 0{,}20). I et utvalg på n=150n = 150 ventiler feiler 2424. Test på 5 %-nivå om feilandelen er lavere enn 0,200{,}20 (altså at leverandøren er bedre enn lovet).

a) Sett opp hypotesene og sjekk forutsetningene.

b) Regn ut observatoren og konkluder.

Signifikansnivå α\alpha og type I-feil
En test kan bomme på to måter. En type I-feil er å forkaste H0H_0 når den faktisk er sann (falsk alarm). Signifikansnivået α\alpha er nettopp den sannsynligheten vi tillater for dette:

α=P(forkaste H0H0 sann).\alpha = P(\text{forkaste } H_0 \mid H_0 \text{ sann}).

Derfor velger vi α\alpha på forhånd (typisk 0,05 eller 0,01) — det er prisen vi er villige til å betale i falske alarmer. En type II-feil er den motsatte: å beholde H0H_0 når H1H_1 faktisk er sann (en oversett effekt). Sannsynligheten for det kalles type II-sannsynligheten, og 11 minus den er testens styrke — hele kapittel 7.3 handler om den.

Type II-feil og styrke (forvarsel til kap. 7.3)

En type II-feil er å beholde H0H_0 selv om H1H_1 er sann — å overse en reell effekt. Sannsynligheten kalles type II-sannsynligheten (vi unngår med vilje symbolet β\beta her, for å ikke forveksle den med eksponensialfordelingens forventning). Testens styrke er 11 minus type II-sannsynligheten — sjansen for å oppdage en effekt som virkelig er der. En viktig konsekvens: at vi «ikke forkaster H0H_0» betyr ikke at H0H_0 er sann — det kan like gjerne bety at testen hadde for lav styrke (for lite data). Utregning og dimensjonering kommer i kap. 7.3.

Dualiteten mellom test og konfidensintervall

En tosidig test på nivå α\alpha og et (1α)(1-\alpha)-konfidensintervall er to sider av samme sak: H0:μ=μ0H_0: \mu = \mu_0 forkastes på nivå α\alpha hvis og bare hvis μ0\mu_0 ligger utenfor (1α)(1-\alpha)-konfidensintervallet. Ligger den påståtte verdien innenfor intervallet av rimelige verdier, er den forenlig med dataene (forkast ikke); ligger den utenfor, forkaster vi. Det gir en nyttig kryssjekk: regner du både KI og test på samme data, må de være enige. (For ensidige tester svarer det til ensidige intervaller.)

📝Oppgave 6

En turbinleverandør oppgir at slitasjen etter 1000 driftstimer i snitt er μ0=0,30\mu_0 = 0{,}30 mm. En kunde har n=16n = 16 uavhengige, normalfordelte målinger med xˉ=0,345\bar{x} = 0{,}345 mm og s=0,060s = 0{,}060 mm, og vil påvise at slitasjen er høyere enn oppgitt.

a) Gjennomfør hele testritualet på 5 %-nivå (bruk t15;0,05=1,753t_{15;\,0{,}05} = 1{,}753).

b) Regn p-verdien (bruk P(T15>2,333)=0,017P(T_{15} > 2{,}333) = 0{,}017) og konkluder i ord.

c) Ville et 90 % tosidig konfidensintervall for μ\mu inneholde verdien 0,30? Forklar via dualiteten, uten å regne intervallet.

Begrepsbank

De sentrale begrepene i testritualet, samlet som repetisjonskort.

Flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet.

Testobservator (testStatistikk)

En testobservator er et tall regnet ut fra dataene som har en kjent fordeling dersom H0H_0 er sann. Standardformen er «(estimat - påstått verdi) delt på standardfeil», f.eks. Z=(Xˉμ0)/(σ/n)Z = (\bar{X}-\mu_0)/(\sigma/\sqrt{n}). Den måler hvor mange standardfeil observasjonen ligger fra H0H_0-verdien.

Forkastningsområde
Forkastningsområdet er de verdiene av testobservatoren som får oss til å forkaste H0H_0 på nivå α\alpha. Tosidig: Z>zα/2|Z| > z_{\alpha/2}. Ensidig oppover: Z>zαZ > z_\alpha. Ensidig nedover: Z<zαZ < -z_\alpha. Grenseverdien kalles den kritiske verdien.
Kritisk verdi

Den kritiske verdien er grensen for forkastningsområdet — kvantilen som skiller «forkast» fra «forkast ikke». For en tosidig 5 %-z-test er den z0,025=1,96z_{0{,}025} = 1{,}96; for en ensidig z0,05=1,645z_{0{,}05} = 1{,}645. Hentes fra Φ\Phi-, tt- eller χ2\chi^2-tabellen med riktige frihetsgrader.

Beslutningsregel: p-verdi vs. α\alpha

To likeverdige veier til samme konklusjon: (1) sammenlign observatoren med kritisk verdi (forkast hvis i forkastningsområdet); (2) sammenlign p-verdien med α\alpha (forkast hvis p<αp < \alpha). De gir alltid samme svar — velg den oppgaven ber om, eller vis begge.

Beslutningskort: z eller t?
Kjent σ\sigma (oppgitt) → z-test, ZN(0,1)Z \sim N(0,1). Ukjent σ\sigma (estimert med ss) → t-test, Ttn1T \sim t_{n-1}. Andel → z-test med p0(1p0)/n\sqrt{p_0(1-p_0)/n}. Er nn liten og fordelingen ikke-normal, kreves en eksakt test (kap. 7.2).
Ensidig vs. tosidig test
Ensidig (H1:μ>μ0H_1: \mu > \mu_0 eller μ<μ0\mu < \mu_0): hele α\alpha i én hale, kritisk verdi zαz_\alpha, p-verdi = én hale. Tosidig (H1:μμ0H_1: \mu \ne \mu_0): α/2\alpha/2 i hver hale, kritisk verdi zα/2z_{\alpha/2}, p-verdi = dobbel hale. Retningen bestemmes av hva som skal påvises, ikke av dataene.
Forutsetningssjekk

Før du stoler på en test: normalitet (av observasjonene, eller stor nok nn til CLT), uavhengige observasjoner, og for andelstesten np05np_0 \ge 5, n(1p0)5n(1-p_0) \ge 5. Sensor forventer at forutsetningene nevnes der de brukes (sensorkrav 2).

Konklusjon i ord

Steg 6: oversett tallresultatet til situasjonen. Forkast: «det er grunnlag for å hevde at ...». Forkast ikke: «det er ikke grunnlag for å hevde at ...». Et rent tall (eller «H0H_0 forkastes») uten kobling til konteksten gir ikke full uttelling.

«Ikke forkaste» \ne «akseptere»

Å ikke forkaste H0H_0 betyr at dataene er forenlige med H0H_0 — ikke at H0H_0 er bevist sann. Mangel på belegg mot en påstand er ikke belegg for den. Skriv derfor «ikke grunnlag for å forkaste», aldri «H0H_0 er sann» eller «vi aksepterer H0H_0».

Statistisk vs. praktisk betydning

En liten p-verdi betyr at effekten er statistisk sikker, ikke at den er stor. Med svært stor nn kan et ubetydelig avvik bli «signifikant». Skille alltid mellom «vi kan slå fast at det er en forskjell» og «forskjellen er praktisk viktig» — de er ikke det samme.

Signifikansnivået α\alpha
α\alpha er sannsynligheten for type I-feil — å forkaste en sann H0H_0 — og velges før dataene ses (typisk 0,05 eller 0,01). Lavere α\alpha gir færre falske alarmer, men gjør det vanskeligere å oppdage en reell effekt (lavere styrke). Det er en avveining.
Standardfeil i testobservatoren

Nevneren i observatoren er estimatorens standardfeil: σ/n\sigma/\sqrt{n} (kjent σ\sigma), s/ns/\sqrt{n} (ukjent σ\sigma) eller p0(1p0)/n\sqrt{p_0(1-p_0)/n} (andel, med p0p_0 fra H0H_0). Den krymper som 1/n1/\sqrt{n} — mer data gir en mer følsom test.

Hva en liten/stor p-verdi betyr
Liten p (under α\alpha): dataene passer dårlig med H0H_0 → forkast. Stor p (over α\alpha): dataene er forenlige med H0H_0 → forkast ikke. p-verdien rangerer hvor overraskende dataene er hvis H0H_0 stemmer — den sier ingenting om sannsynligheten for at H0H_0 er sann.
Tosidig p-verdi (doblingen)

For en tosidig test teller utfall like ekstreme i begge haler. Da er p=2P(observatorobservertH0)p = 2\,P(\text{observator} \ge |\text{observert}| \mid H_0) — det dobbelte av den ene halen. Å glemme faktoren 2 er en klassisk feil som halverer p-verdien og kan snu konklusjonen.

Fordelingen under H0H_0 (nullfordelingen)

Hele testen hviler på at testobservatoren har en kjent fordeling når H0H_0 er sannN(0,1)N(0,1), tn1t_{n-1}, χn12\chi^2_{n-1} osv. Det er denne «nullfordelingen» vi måler ekstremitet mot. Å oppgi den (steg 2) er ikke pynt; det er selve grunnlaget for både kritisk verdi og p-verdi.

Den påståtte verdien μ0\mu_0 (og p0p_0)
μ0\mu_0 (eller p0p_0) er tallet fra nullhypotesen — den påståtte parameterverdien vi tester mot, ikke et estimat fra dataene. Den settes inn i observatorens teller og, for andelstesten, i standardfeilen p0(1p0)/n\sqrt{p_0(1-p_0)/n}. Ikke bland den med estimatet xˉ\bar{x} eller p^\hat{p}.
Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver
Symbol- og formelliste

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Norges teknisk-naturvitenskapelige universitet. Dette er ikke offisielt studiemateriell. Les mer.