Tilbake
10.1
Spredningsmål i praksis

10.1 Spredningsmål i praksis

Kvartiler, IQR og boksplott for å beskrive datasett.

50 min
7 oppgaver
KvartilerIQRBoksplottSpredningsmål
Du leser den lesevennlige versjonen
Din fremgang i kapitlet
0 / 7 oppgaver

Gjennomsnittet lyver (nesten)

Tenk deg to fotballag. Begge har gjennomsnittlig 1,51{,}5 mål per kamp i sesongen. Men det ene laget scorer konsekvent 11 eller 22 mål hver kamp, mens det andre laget veksler mellom 00 og 66 mål. De har likt gjennomsnitt, men opplevelsen av å se kampene er vilt forskjellig!

Det er dette spredningsmål handler om. Mens sentralmål (gjennomsnitt, median, typetall) forteller oss hvor «midten» av dataene ligger, forteller spredningsmål oss hvor spredt dataene er rundt midten. Er verdiene samlet tett sammen, eller er de vidt spredt?

I dette kapittelet lærer vi om tre viktige verktøy:
- Kvartiler -- som deler dataene i fire like store deler
- Interkvartilbredde (IQR) -- som måler spredningen til de midterste 50 %
- Boksplott -- som gir en visuell oversikt over hele fordelingen

Kvartiler -- å dele dataene i fire

Tenk deg at du sorterer alle elevene i klassen etter høyde, fra kortest til høyest. Medianen deler gruppen i to halvdeler. Men vi kan dele videre: medianen av den nedre halvdelen gir første kvartil (Q1Q_1), og medianen av den øvre halvdelen gir tredje kvartil (Q3Q_3).

Nå har vi fire grupper:
- De 25 % laveste verdiene (under Q1Q_1)
- De neste 25 % (mellom Q1Q_1 og medianen)
- De neste 25 % (mellom medianen og Q3Q_3)
- De 25 % høyeste verdiene (over Q3Q_3)

Slik finner du kvartilene:
1. Sorter dataene fra minst til størst.
2. Finn medianen (Q2Q_2) -- den deler datasettet i to halvdeler.
3. Finn medianen av den nedre halvdelen (Q1Q_1).
4. Finn medianen av den øvre halvdelen (Q3Q_3).

Viktig: Hvis medianen er ett av datapunktene (odde antall verdier), tas den ikke med i noen av halvdelene.

Et eksempel: Resultatene til 1111 elever på en prøve (allerede sortert): 7,8,9,10,11,12,13,14,15,16,187, 8, 9, 10, 11, 12, 13, 14, 15, 16, 18. Medianen (Q2Q_2) er verdi nummer 66: Q2=12Q_2 = 12. Nedre halvdel er 7,8,9,10,117, 8, 9, 10, 11 med median Q1=9Q_1 = 9. Øvre halvdel er 13,14,15,16,1813, 14, 15, 16, 18 med median Q3=15Q_3 = 15.

📝Oppgave Quiz 1

Boksplott og uteliggere

Et boksplott er en grafisk fremstilling som viser fem nøkkeltall -- den såkalte femtallsoversikten: minimum, Q1Q_1, median (Q2Q_2), Q3Q_3 og maksimum.

Selve «boksen» strekker seg fra Q1Q_1 til Q3Q_3, med en linje i midten for medianen. «Whiskers» (streker) strekker seg ut til minimum og maksimum. Boksplott er fantastiske for å sammenligne to datasett visuelt -- du kan med ett blikk se hvilken gruppe som har størst spredning og om en gruppe har et høyere sentralpunkt.

Men hva med verdier som er veldig langt unna resten? De kalles uteliggere, og de markeres som enkeltpunkter utenfor whiskers. En verdi er en uteligger hvis den ligger mer enn 1,5IQR1{,}5 \cdot \text{IQR} utenfor Q1Q_1 eller Q3Q_3:

- Nedre grense: Q11,5IQRQ_1 - 1{,}5 \cdot \text{IQR}
- Øvre grense: Q3+1,5IQRQ_3 + 1{,}5 \cdot \text{IQR}

Verdier utenfor disse grensene er uteliggere. Whiskers strekker seg da bare til den siste verdien som ikke er en uteligger.

Et eksempel: Antall sjokoladebiter 1313 elever spiste i en uke: 2,3,5,6,7,7,8,9,10,11,12,14,252, 3, 5, 6, 7, 7, 8, 9, 10, 11, 12, 14, 25. Her er Q1=5,5Q_1 = 5{,}5, Q2=8Q_2 = 8, Q3=11,5Q_3 = 11{,}5 og IQR=6\text{IQR} = 6. Den øvre grensen er 11,5+9=20,511{,}5 + 9 = 20{,}5. Verdien 2525 er over denne grensen og er altså en uteligger -- kanskje noen hadde en veldig god (eller dårlig?) sjokoladeuke!

📝Oppgave Quiz 2

Standardavvik -- den gjennomsnittlige avstanden fra gjennomsnittet

Mens IQR bare ser på de midterste 50%50\%, finnes det et spredningsmål som tar hensyn til alle datapunktene: standardavviket. Det måler den gjennomsnittlige avstanden fra gjennomsnittet.

Formelen ser litt skremmende ut, men ideen er enkel:

s=i=1n(xixˉ)2n1s = \sqrt{\frac{\sum_{i=1}^{n} (x_i - \bar{x})^2}{n - 1}}

Steg for steg:
1. Finn gjennomsnittet xˉ\bar{x}.
2. For hvert datapunkt: finn avviket fra gjennomsnittet (xixˉx_i - \bar{x}).
3. Kvadrer hvert avvik (for å unngå at positive og negative avvik nuller hverandre ut).
4. Finn gjennomsnittet av de kvadrerte avvikene (del på n1n - 1).
5. Ta kvadratroten.

Et eksempel: Fem venner har 12,15,18,20,2512, 15, 18, 20, 25 apper. Gjennomsnittet er xˉ=18\bar{x} = 18. Kvadrerte avvik: 36+9+0+4+49=9836 + 9 + 0 + 4 + 49 = 98. Standardavvik: s=984=24,54,95\displaystyle s = \sqrt{\frac{98}{4}} = \sqrt{24{,}5} \approx 4{,}95. Verdiene avviker altså i gjennomsnitt ca. 55 apper fra gjennomsnittet.

En viktig ting: standardavviket er følsomt for uteliggere, akkurat som gjennomsnittet. Én ekstremt høy eller lav verdi kan blåse opp standardavviket dramatisk. Derfor er median og IQR ofte bedre valg for skjeve datasett.

📝Oppgave Quiz 3

Oppsummering

Sentralmål alene forteller ikke hele historien -- vi trenger spredningsmål for å forstå hvor spredt dataene er.

BegrepHva det målerRobust mot uteliggere?
Variasjonsbredde (maks - min)Total spredningNei
IQR (Q3Q1Q_3 - Q_1)Spredning for midterste 50%50\%Ja
Standardavvik (ss)Gjennomsnittlig avvik fra gjennomsnittetNei

- Kvartiler deler dataene i fire like store deler: Q1Q_1 (25 %), Q2Q_2 = median (50 %), Q3Q_3 (75 %)
- Boksplott viser femtallsoversikten visuelt og markerer uteliggere
- Uteliggere er verdier mer enn 1,5IQR1{,}5 \cdot \text{IQR} fra Q1Q_1 eller Q3Q_3
- Velg IQR/median for skjeve data med uteliggere, og standardavvik/gjennomsnitt for symmetriske data

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.