5.6 Statistisk prosjektarbeid
Planlegging, hypoteseformulering, datainnsamling, GDPR og rapportering.
Den statistiske syklusen
Statistisk prosjektarbeid følgjer ein syklus med fem fasar:
1. Problem: Formuler ei klar, avgrensa problemstilling. Ei god problemstilling er:
- Spesifikk og målbar
- Gjennomførbar med tilgjengelege ressursar
- Statistisk interessant (det er genuint uvisse involvert)
2. Plan: Vel datainnsamlingsmetode, utvalsmetode og statistisk analysemetode.
3. Data: Samle inn data systematisk og dokumenter prosessen.
4. Analyse: Bruk relevante statistiske metodar: deskriptiv statistikk, konfidensintervall, hypotesetestar, korrelasjon, regresjon.
5. Konklusjon: Tolk resultata, svar på problemstillinga, og diskuter avgrensingar og uvisse.
Nullhypotesen : Det vi testar mot. Vanlegvis ein «ingen effekt»-påstand.
Alternativhypotesen : Det vi ønskjer å påvise (har gjerne ei fagleg grunngjeving).
Eksempel på problemstillingar og tilhøyrande hypotesar:
Problemstilling: Er gjennomsnittleg søvntid for VG2-elevar kortare enn 8 timar?
Problemstilling: Har gutar og jenter sine karakterar ulik varians?
Problemstilling: Er det samanheng mellom talet på øvingstimar og karakter?
Signifikansnivået (typisk 0,05) angir terskelen for å forkaste .
Datainnsamlingsmetodar
Val av datainnsamlingsmetode har stor betydning for gyldigheita av konklusjonane.
Spørjeundersøking (Survey)
- Fordelar: Kan nå mange, relativt billig, kan anonymiserast enkelt
- Ulemper: Låg svarprosent, svar kan vere unøyaktige (respons-bias), kan ikkje kontrollere andre variablar
- Utvalsmetodar: Tilfeldig utval (gullstandard), kvoteutval, kvardagsutval
- Feilkjelder: Spørsmålsformulering kan leie svar, manglande svar (bortfall)
Eksperiment
- Fordelar: Kan etablere kausalitet (årsak-verknad), kontroll over variablar
- Ulemper: Dyrt, tidkrevjande, etiske avgrensingar
- Viktig: Randomisering til behandlings- og kontrollgruppe eliminerer systematisk skeivskap
Observasjonsstudie
- Fordelar: Studerer røyndommen utan inngrep
- Ulemper: Kan berre påvise korrelasjon, ikkje kausalitet; konfunderande variablar
Sekundærdata (t.d. SSB, WHO, Folkehelseinstituttet)
- Fordelar: Tilgjengeleg, stort omfang, ferdig samla
- Ulemper: Ikkje skreddarsydd til problemstillinga, mogleg feil i data
Grunnleggjande krav ved innsamling av persondata:
1. Lovleg grunnlag: Vanlegvis informert samtykke frå deltakarane
2. Formålsavgrensing: Data blir berre samla inn til det spesifiserte formålet
3. Dataminimering: Samle inn berre det som er nødvendig
4. Lagringstid: Data skal slettast når dei ikkje lenger trengst
5. Informasjonsplikt: Deltakarane skal informerast om kven som behandlar dataa og til kva
I praksis for skuleprosjekt:
- Bruk anonyme spørjeskjema der det er mogleg (unngå namn, e-post, personnummer)
- Dersom du brukar namn: hent inn skriftleg samtykke
- Vurder om det er mogleg å bruke aggregerte offentlege data (SSB, NSD) i staden - då unngår du GDPR-problematikk
- Slett rådata etter at analysen er ferdig
Sårbare grupper: Ekstra forsiktigheit ved data om mindreårige eller sensitive kategoriar (helse, etnisitet, religion).
Analyse og rapportering
Val av statistisk metode
| Problemstilling | Data | Metode |
|---|---|---|
| Gjennomsnitt ukjent | Numerisk, éi gruppe | Konfidensintervall for , -test |
| Samanlikne to gjennomsnitt | Numerisk, to grupper | To-utvals -test |
| Del ukjent | Kategorisk | Konfidensintervall for , -test |
| Samanheng mellom to variablar | Numerisk × numerisk | Korrelasjonskoeffisient , regresjon |
| Fordeling lik ei gitt? | Kategorisk | -test |
Kritisk tolking av resultat
- Statistisk signifikans praktisk betydning: Ei svært stor studie kan gi signifikant for ein effekt som er praktisk uvesentleg.
- Korrelasjon kausalitet: Ein sterk mellom og kan skuldast ein konfunderande variabel .
- Konfidensintervall gir meir informasjon enn -verdiar: Eit smalt KI seier noko om presisjonen i estimatet.
- Bortfallsanalyse: Kven svarte ikkje? Kan dei som ikkje svarte systematisk skilje seg frå dei som svarte?
Struktur i ein statistisk rapport
1. Innleiing: Problemstilling og bakgrunn
2. Metode: Datainnsamling, utval, analysemetodar
3. Resultat: Tabellar, figurar, utrekningar med tolkingar
4. Diskusjon: Avgrensingar, konfunderande variablar, generaliserbarheit
5. Konklusjon: Svar på problemstillinga
Ei gruppe elevar ønskjer å undersøkje om det er forskjell i gjennomsnittleg tid brukt på lekser per veke mellom elevar på VG1 og VG3. Beskriv alle fasane i prosjektet.
Problemstilling: «Er gjennomsnittleg vekentleg leksetid forskjellig for VG1- og VG3-elevar ved vår skule?»
Hypotesar: mot (tosidig, )
Plan:
Spørjeundersøking via anonymt elektronisk skjema. Tilfeldig utval av 40 elevar frå kvart trinn (totalt 80). Variabel: talet på timar lekser per veke (numerisk). Metode: To-utvals -test.
Data:
Innsamla via anonymt Google Forms-skjema i éi veke. GDPR: ingen personopplysningar samla inn; berre trinn og timar.
Analyse:
Deskriptiv statistikk: t, t; t, t.
To-utvals -test: , .
Konklusjon:
Vi forkastar . Det er statistisk signifikant meir leksetid for VG3-elevar enn VG1-elevar ved vår skule. Studien gjeld berre vår skule og kan ikkje generaliserast til alle norske skular. Mogleg konfunderande variabel: ulike fag på dei to trinna.
Løys oppgåvene:
Ei undersøking viser korrelasjon mellom talet på is-butikkar på stranda og talet på drukna per dag. Kan vi konkludere med at is-sal forårsakar drukning? Forklar.
Forklar forskjellen mellom eit eksperiment og ein observasjonsstudie. Gi eitt eksempel på kva slags konklusjonar ein kan trekkje frå kvar.
Løys oppgåvene:
Du vil undersøkje om gjennomsnittleg pendlartid er forskjellig mellom Oslo og Bergen. Formuler problemstilling og statistisk hypotesetest, og beskriv kva utval og kva metode du ville brukt.
Beskriv tre konkrete tiltak du ville gjort for å overhalde GDPR i spørjeundersøkinga frå a).
Eit konfidensintervall for differansen er minutt med 95 % konfidensgrad. Tolk dette resultatet.
Gjennomfør eit miniprosjekt:
Gå til SSB (ssb.no) og finn eit datasett med to numeriske variablar for norske kommunar eller fylke (t.d. inntekt og del med høgare utdanning). Beskriv datasettet: variabeltypar, talet på observasjonar og kjelde.
Rekn ut korrelasjonskoeffisienten og gjennomfør ein enkel lineær regresjon. Tolk , stigingskoeffisienten og gi eit 95 % konfidensintervall for gjennomsnittet i ein vald kommune dersom du brukar SSB-data.
Skriv ein konklusjon på 4-6 setningar med kritisk vurdering. Diskuter kausalitet, konfunderande variablar og generalisering.
Oppsummering
Den statistiske syklusen: Problem → Plan → Data → Analyse → Konklusjon
Ei god problemstilling er spesifikk, målbar og statistisk interessant.
Metodeval avheng av datatype og problemstilling:
- Numeriske data, éi gruppe → -test, konfidensintervall for
- Numeriske data, to grupper → to-utvals -test
- Kategoriske data → KI for , -test
- Samanheng → korrelasjon , lineær regresjon
GDPR: Anonymiser data, hent informert samtykke, slett rådata etter bruk.
Viktige prinsipp:
- Korrelasjon kausalitet - vurder alltid konfunderande variablar
- Statistisk signifikans praktisk betydning
- Ver ærleg om avgrensingar, bortfall og generaliserbarheit
Tips til eksamen: Statistisk prosjektarbeid kan kome som vurdering av eit opplegg, tolking av resultat, eller identifisering av feilkjelder. Øv deg på å skilje mellom korrelasjon og kausalitet, og på å foreslå konfunderande variablar.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.