Sentralmål, spredningsmål og variasjonsbredde.
Tall som forteller historier
Tenk deg at du er fotballtrener og vil vite hvordan laget presterer. Du har resultatene fra de siste ti kampene: mål per kamp. Men hva sier egentlig disse tallene? Er laget bra? Jevnt? Uforutsigbart?
Statistiske mål er verktøy som hjelper oss å oppsummere og forstå store mengder data med bare noen få tall. I stedet for å lese gjennom alle resultatene, kan du si: «Vi scorer i gjennomsnitt mål per kamp.» Det gir et raskt og nyttig bilde.
Vi deler statistiske mål i to grupper: sentralmål (som beskriver hva som er «typisk») og spredningsmål (som beskriver hvor mye dataene varierer).
Sentralmål: Gjennomsnitt, median og typetall
De tre viktigste sentralmålene er gjennomsnitt, median og typetall.
Gjennomsnitt (middelverdi)
Gjennomsnittet er det de fleste tenker på når de hører «gjennomsnitt». Du summerer alle verdiene og deler på antallet:
Med fotballeksempelet: mål.
Gjennomsnittet er lett å beregne og bruker alle dataene. Men det har en svakhet: det påvirkes sterkt av ekstremverdier. Hvis laget scorer mål i en kamp (kanskje mot et veldig svakt lag), hopper gjennomsnittet opp til , selv om de fleste kampene fortsatt har -- mål.
Median
Medianen er den midterste verdien når dataene er sortert. Sortert: . Med et partall observasjoner ( stykker) er medianen gjennomsnittet av de to midterste: .
Medianen er mer robust mot ekstremverdier. Selv om en kamp har mål, forblir medianen .
Typetall (modus)
Typetallet er den verdien som forekommer oftest. I vårt datasett forekommer hele fire ganger, så typetallet er . Et datasett kan ha flere typetall (hvis to verdier forekommer like ofte) eller ingen (hvis alle verdier er unike).
Spredningsmål: Variasjonsbredde og kvartiler
Sentralmål forteller oss hva som er «typisk», men de sier ingenting om hvor mye dataene varierer. To klasser kan ha samme gjennomsnittskarakter, men i den ene klassen ligger alle rundt , mens i den andre varierer det fra til . Spredningsmål fanger opp denne forskjellen.
Variasjonsbredde
Det enkleste spredningsmålet er variasjonsbredden -- forskjellen mellom største og minste verdi:
I fotballeksempelet: mål. Variasjonsbredden er enkel, men sårbar for ekstremverdier -- én uvanlig kamp kan gi et misvisende bilde.
Kvartiler og IQR
For et mer robust spredningsmål bruker vi kvartiler. De deler det sorterte datasettet i fire like deler:
- (nedre kvartil) -- medianen av den nedre halvdelen
- -- medianen (deler datasettet i to halvdeler)
- (øvre kvartil) -- medianen av den øvre halvdelen
Interkvartilbredden (IQR) er avstanden mellom og :
IQR forteller oss hvor stor spredning de midterste av dataene har. Den påvirkes ikke av ekstremverdier.
La oss bruke fotballtallene: .
Nedre halvdel: .
Øvre halvdel: .
IQR .
Det betyr at mesteparten av kampene har mellom og mål.
Hvilket mål skal du velge?
Ulike situasjoner krever ulike mål. Her er noen tommelfingerregler:
| Situasjon | Beste sentralmål | Hvorfor |
|---|---|---|
| Symmetriske data uten ekstremverdier | Gjennomsnitt | Bruker all informasjonen |
| Data med ekstremverdier (f.eks. lønn) | Median | Ikke påvirket av de rikeste/fattigste |
| Kategoridata (f.eks. favorittfarge) | Typetall | Eneste mål som fungerer for kategorier |
For eksempel: Hvis ti ansatte i en bedrift tjener -- kr, men sjefen tjener kr, er gjennomsnittslønnen misvisende høy. Medianlønnen gir et mye bedre bilde av hva en «typisk» ansatt tjener.
Spredningsmål supplerer sentralmålene. Variasjonsbredden er rask å beregne men sårbar, mens IQR er mer robust og gir et bedre bilde av den «normale» spredningen.
Oppsummering
Sentralmål beskriver hva som er typisk:
- Gjennomsnitt (): Summen delt på antall. Bruker alle data, men påvirkes av ekstremverdier.
- Median: Den midterste verdien i sorterte data. Robust mot ekstremverdier.
- Typetall: Den mest frekvente verdien. Eneste mål som fungerer for kategoridata.
Spredningsmål beskriver variasjon:
- Variasjonsbredde: . Enkel, men sårbar for ekstremverdier.
- Kvartiler: og deler datasettet i fire deler.
- IQR (interkvartilbredde): . Robust mål for spredning i de midterste .
Velg mål etter kontekst: gjennomsnitt for symmetriske data, median for skjeve data med ekstremverdier, typetall for kategorier.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.