Tilbake
1.4

1.4 Deskriptiv statistikk og grafisk tolkning

Gjennomsnitt, median, empirisk varians og kunsten å lese boksplott, histogram, spredningsplott og Q-Q-plott slik sensor krever.

40 min
8 oppgaver
Deskriptiv statistikkgrafisk tolkning
Din fremgang i kapitlet
0 / 8 oppgaver
Kapitlets plass i kurset
Forkunnskaper: Dette kapitlet kan leses uten forkunnskaper — det bruker bare summetegn og vanlig regning. Én formel peker fremover: den empiriske variansen deler på n1n-1, og hvorfor det (forventningsretthet) forklares fullt ut i kap. 5.1 senere i boka. Her tar vi det som en regneregel og en advarsel mot å dele på nn.

Boksplott, histogram og Q-Q-plott herfra dukker opp igjen når vi tolker residualer i regresjonsdelen.

Før vi modellerer et datasett, må vi se det. Deskriptiv statistikk er de få tallene og figurene som oppsummerer en tallmengde: hvor ligger tyngdepunktet, hvor spredt er dataene, og hvilken form har fordelingen? Dette er ferdigheten bak «kommenter datasettet»-oppgavene — og grunnlaget for å vurdere om en normalfordelingsantakelse er rimelig.

Løkke 1 handler om tall: gjennomsnitt, median, kvartiler og empirisk varians. Løkke 2 handler om figurer: boksplott, histogram og Q-Q-plott — og kunsten å lese dem slik sensor krever, forankret i konkrete mønstre.

⏱️ Løkke 1 (~15 min): sentralmål og spredning. Løkke 2 (~20 min): grafisk tolkning.

Løkke 1 — Sentralmål og spredning (~15 min)

Gjennomsnitt (aritmetisk middel)
Tyngdepunktet i dataene — summen av alle observasjoner delt på antallet:

xˉ=1ni=1nxi.\bar{x} = \frac{1}{n}\sum_{i=1}^{n} x_i.

Gjennomsnittet bruker alle verdiene og trekkes derfor mot ekstreme observasjoner (uteliggere). I en høyreskjev fordeling ligger gjennomsnittet til høyre for medianen.

Median
Den midterste verdien når dataene er sortert — verdien som deler datasettet i to like store halvdeler. Med nn sorterte observasjoner:

median={x((n+1)/2)n oddetall12(x(n/2)+x(n/2+1))n partall\text{median} = \begin{cases} x_{((n+1)/2)} & n \text{ oddetall}\\ \tfrac{1}{2}\big(x_{(n/2)} + x_{(n/2+1)}\big) & n \text{ partall}\end{cases}

Medianen er robust: den påvirkes ikke av hvor ekstreme ytterverdiene er, bare av hvor mange de er. Derfor foretrekkes den for skjeve fordelinger (inntekt, levetider).

Kvartiler

Kvartilene deler de sorterte dataene i fire like store deler. Nedre kvartil Q1Q_1 har 25 % av dataene under seg, medianen Q2Q_2 har 50 %, og øvre kvartil Q3Q_3 har 75 %. Q1Q_1 og Q3Q_3 finnes som medianen av henholdsvis nedre og øvre halvdel av datasettet. Kvartilene er byggeklossene i boksplottet.

Interkvartilbredde (IQR)
Et robust spredningsmål: avstanden mellom øvre og nedre kvartil,

IQR=Q3Q1.\text{IQR} = Q_3 - Q_1.

IQR dekker den midterste halvparten av dataene og påvirkes ikke av uteliggere. Den brukes til å definere uteliggere (verdier lenger enn 1,5IQR1{,}5 \cdot \text{IQR} utenfor kvartilene) og er «boksens lengde» i et boksplott.

Empirisk varians (divisor n1n-1)
Det vanligste spredningsmålet — gjennomsnittlig kvadratisk avvik fra xˉ\bar{x}, men med divisor n1n-1, ikke nn:

s2=1n1i=1n(xixˉ)2.s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2.

Hvorfor n1n-1? Fordi vi allerede har «brukt opp» én informasjonsbit på å estimere xˉ\bar{x} fra de samme dataene; å dele på n1n-1 (antall frihetsgrader) gjør estimatoren forventningsrett — den treffer riktig i snitt. Den fulle begrunnelsen kommer i kap. 5.1. Å dele på nn er den vanligste feilen i hele kapitlet.

Empirisk standardavvik
Kvadratroten av den empiriske variansen:

s=s2=1n1i=1n(xixˉ)2.s = \sqrt{s^2} = \sqrt{\frac{1}{n-1}\sum_{i=1}^{n}(x_i - \bar{x})^2}.

Fordelen framfor variansen er at ss har samme enhet som dataene (timer, mm, kroner), så den kan tolkes som en typisk avstand fra gjennomsnittet. En observasjon som ligger flere ss fra xˉ\bar{x}, er uvanlig.

✏️Eksempel 1: Sentralmål og spredning for hånd

Åtte målinger av bruddstyrke (i N) er sortert: 42, 47, 51, 53, 58, 61, 64, 70. Finn gjennomsnitt, median, kvartiler og empirisk standardavvik.

n=8n = 8.

Gjennomsnitt: xˉ=42+47+51+53+58+61+64+708=4468=55,75\bar{x} = \dfrac{42+47+51+53+58+61+64+70}{8} = \dfrac{446}{8} = 55{,}75.

Median (nn partall, snitt av 4. og 5. verdi): 53+582=55,5\dfrac{53+58}{2} = 55{,}5.

Kvartiler: Nedre halvdel {42,47,51,53}\{42,47,51,53\} har median Q1=47+512=49Q_1 = \dfrac{47+51}{2} = 49. Øvre halvdel {58,61,64,70}\{58,61,64,70\} har median Q3=61+642=62,5Q_3 = \dfrac{61+64}{2} = 62{,}5. Da er IQR =62,549=13,5= 62{,}5 - 49 = 13{,}5.

Empirisk varians: kvadratsummen (xixˉ)2=599,5\sum (x_i - \bar{x})^2 = 599{,}5 (regn hvert avvik fra 55,7555{,}75, kvadrer, summer). Da

s2=599,581=599,5785,64,s=85,649,25 N.s^2 = \frac{599{,}5}{8-1} = \frac{599{,}5}{7} \approx 85{,}64, \qquad s = \sqrt{85{,}64} \approx 9{,}25 \text{ N}.

Merk divisor 7, ikke 8. Hadde vi delt på 8, ville vi fått s274,9s^2 \approx 74{,}9 — for lavt.

📝Oppgave 1

(Innstegsoppgave.) Fem responstider (i ms) er målt: 12, 15, 15, 18, 20.

a) Finn gjennomsnittet.

b) Finn medianen.

📝Oppgave 2

Seks levetider (i tusen timer) er: 8, 10, 10, 12, 15, 21.

a) Finn gjennomsnitt og median, og forklar hvorfor de er ulike.

b) Regn ut den empiriske variansen s2s^2 og standardavviket ss.

Løkke 2 — Grafisk tolkning (~20 min)

Boksplott (boks-med-værhår)

En figur som viser fem-tallssammendraget: boksen går fra Q1Q_1 til Q3Q_3 (lengde = IQR) med en strek ved medianen; værhårene («whiskers») strekker seg til de mest ekstreme observasjonene innenfor 1,5IQR1{,}5 \cdot \text{IQR} fra boksen, og punkter utenfor markeres som uteliggere. Boksplottet viser beliggenhet (medianens plassering), spredning (boksens og værhårenes lengde) og skjevhet (asymmetri mellom over- og underdel) på én gang — ideelt for å sammenligne grupper.

✏️Eksempel 2: Sammenlign grupper med boksplott

Boksplottene over viser målt kapasitet (mAh) for tre batteriprodusenter A, B og C. Ranger produsentene etter median og etter spredning, og pek på hva som tyder på høyreskjevhet hos én av dem.

Median (beliggenhet): Produsent C har høyest median (strek ved ≈ 2720), deretter A (≈ 2450), så B (≈ 2400). Ranger etter typisk kapasitet: C > A > B.

Spredning: Produsent B har klart lengst boks (IQR ≈ 650) og lengst samlet utstrekning — størst spredning. C har smalest boks (IQR ≈ 170) — mest ensartet. Ranger etter spredning: B > A > C.

Høyreskjevhet: Hos B er avstanden fra medianen opp til Q3Q_3 (og det øvre værhåret) mye lengre enn ned til Q1Q_1. Denne asymmetrien — lang hale oppover — tyder på høyreskjev fordeling: noen få batterier har uvanlig høy kapasitet. (Merk formuleringen: vi peker på det konkrete mønsteret, ikke bare «B ser rar ut».)

Uteligger

En observasjon som ligger uvanlig langt fra resten. En vanlig regel: verdier lenger enn 1,5IQR1{,}5 \cdot \text{IQR} utenfor Q1Q_1 eller Q3Q_3 markeres som uteliggere i boksplottet (egne punkter utenfor værhårene). Uteliggere kan være reelle ekstremverdier eller målefeil — de skal undersøkes, ikke automatisk fjernes, og de påvirker gjennomsnitt og standardavvik mye mer enn median og IQR.

Histogram

En figur der dataene deles i intervaller (klasser), og søylehøyden viser hvor mange observasjoner som faller i hvert intervall. Histogrammet avslører fordelingens beliggenhet (hvor tyngdepunktet er), spredning (hvor bredt søylene strekker seg), skjevhet (hvilken hale som er lengst) og modalitet (antall topper). Det er den mest direkte visningen av fordelingens form.

Skjevhet (høyre-/venstreskjev)

En fordeling er høyreskjev (positivt skjev) hvis den har en lang hale mot høyre — noen få store verdier. Da er xˉ>median\bar{x} > \text{median}. Den er venstreskjev hvis halen peker mot venstre og xˉ<median\bar{x} < \text{median}. Huskeregel: halen peker i «skjevhetens retning», og gjennomsnittet trekkes mot halen. Levetider og inntekter er typisk høyreskjeve.

📝Oppgave 3

Histogrammet over viser levetider (i timer) for 100 enheter.

a) Er fordelingen symmetrisk, høyreskjev eller venstreskjev? Begrunn med et konkret mønster.

b) Vil gjennomsnittet ligge over eller under medianen?

Q-Q-plott (mot normalfordeling)

Et Q-Q-plott («kvantil-kvantil») setter datasettets sorterte verdier (observerte kvantiler) opp mot de tilsvarende teoretiske kvantilene fra en normalfordeling. Ligger punktene tilnærmet på en rett linje, er dataene forenlige med en normalfordeling. Systematisk krumming eller avvik i halene tyder på ikke-normalitet: en oppadbøyd øvre hale betyr tyngre høyrehale enn normalt (høyreskjevhet).

📝Oppgave 4

Q-Q-plottet over viser målte verdier mot teoretiske normalkvantiler.

a) Hva ville et perfekt normalfordelt datasett gitt i et Q-Q-plott?

b) Hvilket konkret mønster ser du her, og hva forteller det om fordelingen?

c) En medstudent konkluderer «dataene er normalfordelte fordi de fleste punktene ligger på linja». Kommenter.

Begrepsbank til eksamen

Kjernebegrepene i kortform.

Begrepsbanken er flashcard-/repetisjonsstoff — den gjentar det du nettopp har lest. Hopp trygt over ved førstegangslesing; tidsanslaget gjelder kjernestoffet.

Modalitet (unimodal / bimodal)

Antall tydelige topper i fordelingen. Én topp = unimodal (det vanlige). To topper = bimodal, som ofte tyder på at dataene består av to blandede grupper (for eksempel to maskiner med ulik innstilling). Modalitet ses lettest i histogrammet, og en bimodal form er et signal om at man kanskje bør analysere gruppene hver for seg.

Spredningsplott

En figur som plotter par (xi,yi)(x_i, y_i) som punkter — brukes til å se sammenhengen mellom to variabler. Man vurderer på øyemål om det er en trend (stigende/synkende), hvor sterk og hvor lineær den er, og om spredningen er jevn. Spredningsplottet er inngangen til korrelasjon og regresjon (kap. 8 senere i boka).

Empirisk korrelasjon (vurdert på øyemål)

Et mål (mellom 1-1 og 11) på hvor sterkt og i hvilken retning to variabler henger lineært sammen. Positiv korrelasjon: punktene stiger; negativ: de synker; nær 0: ingen lineær trend. Advarsel: korrelasjon fanger bare lineær sammenheng — en tydelig krum sammenheng kan ha korrelasjon nær 0. Vurder alltid mot spredningsplottet, ikke bare tallet.

Persentil / empirisk kvantil

Den pp-te persentilen er verdien som har pp prosent av dataene under seg. Kvartilene er 25-, 50- og 75-persentilene. Persentiler brukes til å beskrive posisjon («måleverdien ligger på 90-persentilen») og er robuste posisjonsmål på linje med medianen.

Repetisjonsoppgaver
Din fremgang
0 / 4 oppgaver
Symbol- og formelliste

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.

Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Norges teknisk-naturvitenskapelige universitet. Dette er ikke offisielt studiemateriell. Les mer.