Tilbake
1.3

1.3 Reliabilitet og testvaliditet

Måleteoriens to spørsmål — måler testen stabilt, og måler den det den skal? — og skillet mot slutningsvaliditet som koster karakterer å blande.

60 min
6 oppgaver
Reliabilitettestvaliditet
Din fremgang i kapitlet
0 / 6 oppgaver
Kapitlets plass i kurset
Forkunnskaper. Dette kapitlet bygger på variabel- og operasjonaliseringsbegrepene i kap. 1.2 — en test er jo en operasjonalisering av et abstrakt begrep, og spørsmålet er om den operasjonaliseringen er stabil og treffsikker. Kjenner du operasjonalisering, er du klar. Skillet testvaliditet/slutningsvaliditet peker framover mot indre og ytre validitet i kap. 2.1.
Symbol- og formelliste

Løkke 1 — Reliabilitet: måler testen stabilt? (~20 min)

Tenk deg en badevekt som viser 70 kg, så 74 kg, så 68 kg når du stiger på tre ganger etter hverandre. Vekta er ubrukelig — ikke fordi den viser feil tall (kanskje snittet stemmer), men fordi den er ustabil. Det samme gjelder psykologiske tester: en test som gir sprikende resultater fra gang til gang, kan vi ikke stole på. Måleteorien stiller to spørsmål, og reliabilitet er det første: måler testen stabilt?

📝Oppgave 1

(Lett innstegsoppgave.) En badevekt viser tre ulike tall når du veier deg tre ganger på rappen. Er problemet med denne vekta reliabilitet eller validitet? Forklar kort.

Definisjonsboksene under er også flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet.

Reliabilitet

En tests stabilitet og konsistens — gir den samme resultat under like forhold? Reliabilitet er en forutsetning for validitet: en test som spretter tilfeldig, kan ikke måle noe presist. Men reliabilitet alene holder ikke — en stabil test kan måle konsekvent feil ting (se validitet). Kontrast: reliabilitet = stabilt; validitet = riktig. Se matrisen under: blinkskive-analogien deler opp de fire mulige kombinasjonene av stabil/ustabil og riktig/feil.

Test-retest-reliabilitet

Man gir samme test til samme personer på to tidspunkter og ser om resultatene henger sammen. Forutsetter at egenskapen som måles er stabil over tid — passer for personlighetstrekk, ikke for humør som svinger fra dag til dag. Kontrast til intern konsistens (som ser på leddene innad, ikke over tid).

Parallelle former

To ulike, men likeverdige versjoner av samme test gis til samme personer; høy samsvar = god reliabilitet. Løser test-retests problem med at folk husker svarene fra første gang. Kostnaden: å lage to genuint likeverdige tester er vanskelig.

Split-half-reliabilitet

Man deler testen i to halvdeler (f.eks. partalls- og oddetallsledd) og sjekker om de to halvdelene gir samsvarende skårer. En form for intern konsistens. Forutsetter en homogen test — at alle ledd måler det samme.

Intern konsistens (Cronbachs alfa)

Måler hvor samstemte leddene i en test er — svarer folk konsistent på tvers av spørsmål som skal måle det samme? Tallfestes med Cronbachs alfa (α\alpha), fra 0 til 1: rundt 0,70+ regnes gjerne som akseptabelt, 0,80+ som godt. NB: «høyere er bedre» har et tak — svært høy α\alpha kan bety at leddene er nesten identiske og dermed overflødige. α\alpha tolkes, regnes aldri for hånd på eksamen.

Interrater-reliabilitet

Enighet mellom ulike bedømmere som vurderer det samme — f.eks. to psykologer som skårer de samme intervjuene. Måles enkelt som prosent enighet, eller mer presist med Cohens kappa (KK), som korrigerer for enighet man ville fått ved ren tilfeldighet.

✏️Eksempel: velg reliabilitetsmetode med begrunnelse

En forsker har laget en ny skala for prokrastinering (utsettelsesatferd) med 20 ledd. Foreslå to reliabilitetsmetoder som passer, og begrunn valgene. Hvorfor kan test-retest være problematisk her?

Intern konsistens (Cronbachs alfa): naturlig valg for en flerleddsskala — sjekker at de 20 leddene måler det samme underliggende (prokrastinering) og henger sammen. Krever bare én testing.

Split-half: samme logikk — del skalaen i to og se om halvdelene samsvarer. Passer fordi leddene skal være homogene.

Hvorfor test-retest er problematisk: test-retest forutsetter at egenskapen er stabil mellom de to testingene. Prokrastinering kan svinge med semesterfase, arbeidsmengde og humør, så lav test-retest-korrelasjon kunne skyldes ekte endring i personen, ikke dårlig test. Da måler man ustabilitet i fenomenet, ikke i instrumentet.

Legg merke til at hvert valg står med begrunnelse — det er det som gir uttelling.

📝Oppgave 2
T5

En forsker har en kort test som skal måle et stabilt personlighetstrekk.

a) Hvilken reliabilitetsmetode passer for å sjekke stabilitet over tid?

b) Hva er én ulempe med den metoden?

📝Oppgave 3
T5

En skala rapporterer Cronbachs alfa = 0,82.

a) Hva forteller dette tallet?

b) Betyr «jo høyere, jo bedre» at α=0,98\alpha = 0{,}98 alltid er ideelt? Forklar.

Løkke 2 — Testvaliditet: måler testen det den skal? (~20 min)

— naturlig pausepunkt —

Reliabilitet er nødvendig, men ikke nok. En badevekt som konsekvent viser 3 kg for mye er helt stabil (reliabel) — men den måler feil. Det er validitetsspørsmålet: måler testen faktisk det den skal måle? Her er den klassiske innsikten: en test kan være reliabel uten å være valid, men ikke omvendt — en test som spretter tilfeldig, kan ikke treffe presist.

Testvaliditet

Om en test faktisk måler det den er ment å måle. En intelligenstest som egentlig måler lesehastighet, er reliabel men ikke valid. Testvaliditet handler om instrumentet — ikke å forveksle med slutningsvaliditet (om konklusjoner fra en studie er holdbare, se kap. 2.1).

Face-validitet (overflatevaliditet)

Om testen ser ut til å måle det den skal, ved en overflatevurdering. En stresskala med spørsmål om stress har høy face-validitet. Dobbeltrolle: høy face-validitet motiverer deltakere og virker troverdig — men gjør også testen lett å gjennomskue og manipulere. Svakeste validitetsform (bygger bare på inntrykk).

Innholdsvaliditet

Om testens innhold dekker hele bredden av begrepet det skal måle. En matematikkprøve som bare tester addisjon, har dårlig innholdsvaliditet for «matematikkferdighet». Vurderes typisk av fageksperter mot en definisjon av området.

Kriterievaliditet

Om testens skårer henger sammen med et utenforstående kriterium vi bryr oss om. To varianter: samtidig validitet (testen samsvarer med et kriterium målt samtidig, f.eks. en ny angstskala mot en etablert) og prediktiv validitet (testen forutsier et fremtidig utfall, f.eks. opptaksprøve som forutsier studieresultater).

Begrepsvaliditet

Den mest overordnede formen: om testen faktisk fanger det teoretiske begrepet (konstruktet) den påstår å måle. Bygges opp over tid ved at testen oppfører seg som teorien forutsier — korrelerer med det den bør, og ikke med det den ikke bør.

✏️Eksempel: reliabel uten å være valid

Forklar med et eget eksempel hvordan en test kan være reliabel uten å være valid — og hvorfor det motsatte (valid uten reliabel) er umulig.

Reliabel uten valid: Tenk deg en klokke som konsekvent går ti minutter for fort. Hver gang du sjekker den, gir den et stabilt svar (den er reliabel — to avlesninger rett etter hverandre samsvarer perfekt), men svaret er systematisk feil (den er ikke valid som mål på riktig tid). En psykologisk test kan på samme vis måle noe stabilt og konsekvent — men konsekvent feil ting.

Hvorfor valid-uten-reliabel er umulig: Validitet krever presisjon — at testen treffer riktig. Men hvis testen spretter tilfeldig fra gang til gang (lav reliabilitet), kan den ikke treffe konsistent. En upålitelig test bommer ulikt hver gang og kan derfor ikke være valid. Derfor er reliabilitet en forutsetning for validitet, men ikke omvendt.

📝Oppgave 4
T5

En forsker vil validere en ny skala for eksamensstress.

a) Beskriv hvordan hun kan undersøke samtidig kriterievaliditet.

b) Beskriv hvordan hun kan undersøke prediktiv validitet.

Løkke 3 — Den kritiske forvekslingen + interrater-enighet (~20 min)

— naturlig pausepunkt —

Nå kommer differensieringsleddet. Testvaliditet (denne løkka handler om) gjelder tester og instrumenter: måler skalaen det den skal? Slutningsvaliditet — som deles inn i indre og ytre validitet (kap. 2.1) — gjelder noe helt annet: kan vi trekke holdbare konklusjoner fra en studie? Indre validitet spør om årsakssammenhengen er sikker; ytre om funnet kan generaliseres. Disse gjelder slutninger, ikke tester.

Når en oppgave ber deg vurdere om en test er god, er svaret testvaliditet (face, innhold, kriterium, begrep) — ikke indre/ytre validitet. Å svare «indre og ytre validitet» på et testspørsmål er feilkode #5, og sensor fanger den hvert år.

Slutningsvaliditet (kontrast til testvaliditet)

Om konklusjonene fra en studie er holdbare — deles i indre validitet (er årsakssammenhengen sikker?) og ytre validitet (kan funnet generaliseres?). Gjelder slutninger fra studier, ikke tester. Å forveksle dette med testvaliditet (face/innhold/kriterium/begrep) er feilkode #5 — bokas mest påpekte målefeil. Detaljene om indre/ytre validitet kommer i kap. 2.1.

Cohens kappa

Et mål på enighet mellom to bedømmere som korrigerer for tilfeldig enighet. Formel (oppgis alltid): K=PoPc1Pc\displaystyle K = \frac{P_o - P_c}{1 - P_c}, der PoP_o er observert enighet og PcP_c er forventet enighet ved ren tilfeldighet. K=1K = 1 er perfekt, K=0K = 0 betyr enighet bare på tilfeldighetsnivå. Poenget: to bedømmere som gjetter tilfeldig, vil av og til være enige ved flaks — kappa trekker fra den flaksen. Perifert stoff (mer i kap. 7.2).

✏️Eksempel: regn og tolk Cohens kappa

To psykologer vurderer uavhengig 40 barn som «engstelig» eller «ikke engstelig». De er enige på 36 av 40 (begge sa «engstelig» for 18, begge «ikke engstelig» for 18; de var uenige om 4). Ved ren tilfeldighet ville de vært enige i 50 % av tilfellene (Pc=0,50P_c = 0{,}50). Regn ut Cohens kappa med formelen K=PoPc1Pc\displaystyle K = \frac{P_o - P_c}{1 - P_c} og tolk resultatet.

Steg 1 — observert enighet PoP_o: de er enige på 36 av 40, så
Po=3640=0,90.P_o = \frac{36}{40} = 0{,}90.
Intuisjon: rå enighet er 90 % — ser høyt ut, men noe av det er flaks.

Steg 2 — forventet tilfeldig enighet: oppgitt, Pc=0,50P_c = 0{,}50.

Steg 3 — sett inn i formelen:
K=PoPc1Pc=0,900,5010,50=0,400,50=0,80.K = \frac{P_o - P_c}{1 - P_c} = \frac{0{,}90 - 0{,}50}{1 - 0{,}50} = \frac{0{,}40}{0{,}50} = 0{,}80.

Prosatolkning (obligatorisk siste steg): K=0,80K = 0{,}80 betyr at bedømmerne er enige langt utover det tilfeldigheten alene skulle tilsi — av det «rommet» som var igjen etter at vi trakk fra flaks-enigheten, dekker de 80 %. Interrater-reliabiliteten er altså god: de to psykologene bruker kriteriene likt. Merk at rå enighet (90 %) overdriver samstemtheten — kappa (0,80) gir det ærligere bildet fordi den korrigerer for tilfeldig enighet.

📝Oppgave 5
T5

To lærere vurderer 50 tekster som «bestått» eller «ikke bestått». De er enige på 44 av 50. Forventet tilfeldig enighet er Pc=0,60P_c = 0{,}60. Bruk K=PoPc1Pc\displaystyle K = \frac{P_o - P_c}{1 - P_c}.

a) Regn ut observert enighet PoP_o.

b) Regn ut kappa.

c) Tolk resultatet i én setning.

Hvilken metode passer hvilket instrument?

Det er ikke ett riktig reliabilitetsmål for alle tester. Test-retest forutsetter et stabilt fenomen — bra for personlighet, dårlig for humør. Split-half og intern konsistens forutsetter en homogen test der alle ledd måler det samme — meningsløst for en test som med vilje dekker flere ulike delområder. Interrater trengs når skåringen krever skjønn (intervjuer, observasjoner), ikke ved rene flervalgstester.

Og face-validitetens dobbeltrolle er verdt å merke: den motiverer deltakere og gir troverdighet, men gjør testen lett å gjennomskue — noen ganger vil man bevisst ha lav face-validitet (f.eks. i tester der man ikke ønsker at folk skal kunne pynte på svarene).

📝Oppgave 6
T5, A-nivå

En eksamensoppgave lyder: «En forsker har utviklet en ny skala for sosial angst. Diskuter hvordan skalaens validitet kan vurderes.» En medstudent svarer med å drøfte indre og ytre validitet.

a) Hva er galt med medstudentens svar?

b) Hvilke validitetsformer burde svaret handlet om, og hvordan?

Typologiene i kortform

Rene repetisjonskort — hopp trygt over ved førstegangslesing. Kortene under samler reliabilitets- og validitetstypologiene som par (metode ↔ hva den fanger). Dette er flashcard-gullet i kapitlet.

Reliabilitet = stabilitet

Kjernekontrasten å ha klar: reliabilitet = stabilt (samme svar hver gang), validitet = riktig (måler det den skal). En test kan være reliabel uten å være valid, men ikke omvendt.

Reliabilitet før validitet

Reliabilitet er en forutsetning for validitet: en test som spretter tilfeldig kan ikke treffe presist. Derfor sjekkes reliabilitet typisk først. Men høy reliabilitet garanterer ikke validitet (klokka som går ti minutter for fort).

Test-retest ↔ stabilt fenomen

Passer når egenskapen er stabil over tid (personlighet). Svakhet: hukommelseseffekt — folk husker svarene sine. Løses med parallelle former.

Parallelle former ↔ hukommelsesproblemet

To likeverdige testversjoner unngår at deltakerne husker svarene. Kostnaden: det er vanskelig å lage to genuint likeverdige tester.

Split-half ↔ homogen test

Deler testen i to halvdeler og sjekker samsvar. Forutsetter at leddene måler det samme (homogen test).

Cronbachs alfa ↔ intern konsistens

Tallfester hvor samstemte leddene er (0–1). ~0,70+ akseptabelt, 0,80+ godt. Tak: svært høy alfa kan bety redundante ledd. Tolkes, regnes aldri for hånd.

Interrater ↔ skjønnsbasert skåring

Trengs når skåring krever skjønn (intervjuer, observasjoner). Måles som prosent enighet eller Cohens kappa (korrigert for tilfeldighet).

Face-validitet ↔ ser riktig ut

Om testen ser ut til å måle det den skal (overflatevurdering). Dobbeltrolle: motiverer, men lett å gjennomskue. Svakeste validitetsform.

Innholdsvaliditet ↔ dekker bredden

Om testen dekker hele begrepets bredde. En matteprøve med bare addisjon har dårlig innholdsvaliditet for «matteferdighet».

Samtidig validitet ↔ kriterium nå

Testen samsvarer med et kriterium målt samtidig (ny angstskala mot etablert skala). En undertype kriterievaliditet.

Prediktiv validitet ↔ kriterium senere

Testen forutsier et fremtidig utfall (opptaksprøve forutsier studieresultat). Den andre undertypen kriterievaliditet.

Begrepsvaliditet ↔ fanger konstruktet

Den mest overordnede formen: om testen faktisk fanger det teoretiske begrepet. Bygges over tid ved at testen oppfører seg som teorien forutsier.

Testvaliditet ↔ slutningsvaliditet

Testvaliditet gjelder instrumenter (face/innhold/kriterium/begrep); slutningsvaliditet gjelder studieslutninger (indre/ytre). Å blande dem er feil #5.

Observert enighet (PoP_o)

Andelen tilfeller der to bedømmere faktisk er enige. Rå enighet — overvurderer samstemthet fordi noe skyldes flaks. Derav behovet for kappa.

Tilfeldig enighet (PcP_c)

Enigheten man ville ventet ved ren gjetting. Trekkes fra i kappa-formelen slik at bare enighet utover flaks teller.

Kappa = enighet utover tilfeldighet
K=(PoPc)/(1Pc)K = (P_o - P_c)/(1 - P_c). K=1K = 1 perfekt, K=0K = 0 bare tilfeldighetsnivå. Gir et ærligere bilde enn rå prosent enighet.
To ulike alfaer

Cronbachs α\alpha (reliabilitet, 0–1) er ikke signifikansnivået α\alpha fra hypotesetesting (kap. 4.1). Samme bokstav, helt ulik betydning — en klassisk forvekslingsfelle.

Pensumkart og repetisjon

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Innholdet er læringsstoff, ikke helse- eller medisinske råd. Les mer.