UtkastBoka ble skrevet det første døgnet etter at læreplanen kom, og kvalitetssikres nå kapittel for kapittel gjennom høsten 2026. Kapitler merket «Kvalitetssikret» er gjennomgått; resten er utkast du gjerne må lese og melde fra om.
Fant du en feil, eller savner du noe i dette kapittelet?Alt leses, og feil rettes fortløpende.
Tilbake
2.2
Korrelasjonskoeffisienten

2.2 Korrelasjonskoeffisienten

Pearsons r: utregning, tolkning og fallgruver.

45 min
6 oppgaver
KorrelasjonskoeffisientPearsons r
Din fremgang i kapitlet
0 / 6 oppgaver

Fra skjønn til tall

I kapittel 2.1 leste vi spredningsplott med øynene og sa «sterk», «moderat» og
«svak». Nå skal vi regne ut tallet som sier det samme — Pearsons
korrelasjonskoeffisient
rr — og se hvor det kommer fra.

Tanken bak rr er enkel, og den er verdt å forstå før formelen kommer: vi ser
ikke på hvor stor xx og yy er, men på hvor langt fra sitt eget gjennomsnitt
hver av dem ligger
.

Ideen: avvik ganget med avvik

Tegn to hjelpelinjer i spredningsplottet: en loddrett linje ved xˉ\bar{x} og en
vannrett linje ved yˉ\bar{y}. De deler figuren i fire felt.

For hvert punkt regner vi ut de to avvikene xixˉx_i - \bar{x} og yiyˉy_i - \bar{y},
og ganger dem sammen. Fortegnet på produktet forteller hvilket felt punktet
ligger i:

Punktet liggerxixˉx_i - \bar{x}yiyˉy_i - \bar{y}Produktet
oppe til høyre++++++
nede til venstre--++
oppe til venstre-++-
nede til høyre++--

Her ser vi at punkter som «følger» en stigende sammenheng — begge verdiene
over snittet, eller begge under — gir positive produkter. Punkter som går
motsatt vei, gir negative.
Summerer vi alle produktene, får vi et tall som er stort og positivt når
punktene stiger, stort og negativt når de faller, og nær null når feltene

opphever hverandre.
Ett problem gjenstår: summen vokser både med antall punkter og med
måleenhetene. Bytter vi kroner mot tusen kroner, blir summen tusen ganger

mindre — uten at figuren har endret form. Derfor deler vi summen på noe som
vokser like fort, og da står vi igjen med et rent tall mellom 1-1 og 11.

📜Korrelasjonskoeffisienten rr
For nn tallpar (x1,y1),(x2,y2),,(xn,yn)(x_1, y_1), (x_2, y_2), \ldots, (x_n, y_n) er

r=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \cdot \sum (y_i - \bar{y})^2}}

Telleren er summen av produktene fra forrige avsnitt — den bestemmer
fortegnet.

Nevneren er så stor som telleren i det hele tatt kan bli. Derfor er

1r1-1 \le r \le 1

alltid oppfylt, og r=±1r = \pm 1 bare når alle punktene ligger nøyaktig på én rett
linje.

Samme formel, skrevet med standardavvik. Deler vi både over og under
brøkstreken på n1n - 1, får vi

r=sxysxsyr = \frac{s_{xy}}{s_x \cdot s_y}

der sxs_x og sys_y er utvalgsstandardavvikene fra kapittel 1.3, og
sxy=1n1(xixˉ)(yiyˉ)\displaystyle s_{xy} = \frac{1}{n-1}\sum (x_i - \bar{x})(y_i - \bar{y}) kalles
kovariansen.

NB: Faktoren n1n - 1 står både over og under brøkstreken og forkorter bort.
Derfor spiller det ingen rolle for rr om vi regner med σ\sigma (deler på nn)
eller med ss (deler på n1n - 1) — rr blir det samme tallet.

✏️Eksempel 1 – $r$ for hånd, med avvikstabell

En kjede har åtte butikker. Tabellen viser antall ansatte og omsetningen i fjor.

Ansatte xx246810121416
Omsetning yy (mill. kr)354769810

Regn ut korrelasjonskoeffisienten for hånd.

Steg 1 — gjennomsnittene. Alt i formelen måles fra gjennomsnittene, så de
må vi ha først.

xˉ=2+4+6+8+10+12+14+168=728=9\bar{x} = \frac{2 + 4 + 6 + 8 + 10 + 12 + 14 + 16}{8} = \frac{72}{8} = 9

yˉ=3+5+4+7+6+9+8+108=528=6,5\bar{y} = \frac{3 + 5 + 4 + 7 + 6 + 9 + 8 + 10}{8} = \frac{52}{8} = 6{,}5

Vi deler på 88 fordi det er 88 butikker.

Steg 2 — avvikstabellen. Én rad per butikk, og vi fyller kolonne for
kolonne. Tre nye kolonner: produktet, og de to kvadratene.

xix_iyiy_ixixˉx_i - \bar{x}yiyˉy_i - \bar{y}(xixˉ)(yiyˉ)(x_i-\bar{x})(y_i-\bar{y})(xixˉ)2(x_i-\bar{x})^2(yiyˉ)2(y_i-\bar{y})^2
237-73,5-3{,}524,524{,}5494912,2512{,}25
455-51,5-1{,}57,57{,}525252,252{,}25
643-32,5-2{,}57,57{,}5996,256{,}25
871-10,50{,}50,5-0{,}5110,250{,}25
106110,5-0{,}50,5-0{,}5110,250{,}25
129332,52{,}57,57{,}5996,256{,}25
148551,51{,}57,57{,}525252,252{,}25
1610773,53{,}524,524{,}5494912,2512{,}25
Sum007816842

(Kontroll som har et poeng: de to avvikskolonnene skal begge summere til 00.
Gjør de ikke det, er gjennomsnittet eller et avvik regnet feil — og da er det
ingen vits i å gå videre.)

Legg merke til de to radene med negativt produkt: butikkene med 88 og 1010
ansatte er de to punktene som ligger i minus-feltene i figuren over.
Steg 3 — sett inn i formelen. Først formelen tom:
r=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2r = \frac{\sum (x_i - \bar{x})(y_i - \bar{y})}{\sqrt{\sum (x_i - \bar{x})^2 \cdot \sum (y_i - \bar{y})^2}}
Så med tallene fra sumraden:
r=7816842=787056=7884r = \frac{78}{\sqrt{168 \cdot 42}} = \frac{78}{\sqrt{7056}} = \frac{78}{84}
r=7884=1314=0,92850,929r = \frac{78}{84} = \frac{13}{14} = 0{,}9285\ldots \approx 0{,}929

Svar: r0,929r \approx 0{,}929. Det er en sterk positiv lineær sammenheng mellom
antall ansatte og omsetning.
Tolkning: Butikker med flere ansatte omsetter for mer — men ikke helt

regelmessig. To av de åtte butikkene bryter mønsteret (den med 88 ansatte
omsetter mer enn den med 1010), og det er nettopp derfor rr ikke er 11.

NB: Det er uvanlig at 16842\sqrt{168 \cdot 42} går opp i et helt tall. Gjør

den ikke det, regner vi bare videre med desimaler — svaret skal uansett rundes

av til to eller tre desimaler.

📝Oppgave 1
Del 1 (uten hjelpemidler). Fem personer har oppgitt hvor mange
treningsøkter de har i uka, og hvilepulsen sin.

Treningsøkter xx12345
Hvilepuls yy7274706866
a

Finn xˉ\bar{x} og yˉ\bar{y}.

b

Sett opp avvikstabellen og finn (xixˉ)(yiyˉ)\sum (x_i-\bar{x})(y_i-\bar{y}).

c

Finn (xixˉ)2\sum (x_i-\bar{x})^2 og (yiyˉ)2\sum (y_i-\bar{y})^2.

d

Regn ut rr.

e

Tolk svaret. Kan vi si at trening senker hvilepulsen?

Løs oppgaven
✏️Eksempel 2 – Kovarians, standardavvik og måleenhet
Vi bruker butikktallene fra eksempel 1, der vi fant

(xixˉ)(yiyˉ)=78,(xixˉ)2=168,(yiyˉ)2=42\sum (x_i-\bar{x})(y_i-\bar{y}) = 78, \qquad \sum (x_i-\bar{x})^2 = 168, \qquad \sum (y_i-\bar{y})^2 = 42

a) Finn kovariansen sxys_{xy} og standardavvikene sxs_x og sys_y, og vis at
r=sxysxsyr = \dfrac{s_{xy}}{s_x \cdot s_y} gir det samme svaret som før.

b) Omsetningen føres om fra millioner kroner til kroner. Hva skjer med
sxys_{xy}, og hva skjer med rr?

a) Alle tre størrelsene deles på n1=7n - 1 = 7, siden de åtte butikkene er et
utvalg (kapittel 1.3).

Kovariansen — formelen tom, så med tall:

sxy=1n1(xixˉ)(yiyˉ)=787=11,142s_{xy} = \frac{1}{n-1}\sum (x_i-\bar{x})(y_i-\bar{y}) = \frac{78}{7} = 11{,}142\ldots

Standardavvikene:

sx=1687=24=4,898s_x = \sqrt{\frac{168}{7}} = \sqrt{24} = 4{,}898\ldots

sy=427=6=2,449s_y = \sqrt{\frac{42}{7}} = \sqrt{6} = 2{,}449\ldots

Produktet av de to blir et helt tall, fordi 246=14424 \cdot 6 = 144:

sxsy=246=144=12s_x \cdot s_y = \sqrt{24} \cdot \sqrt{6} = \sqrt{144} = 12

Nå setter vi inn:

r=sxysxsy=78/712=7884=0,92850,929r = \frac{s_{xy}}{s_x \cdot s_y} = \frac{78/7}{12} = \frac{78}{84} = 0{,}9285\ldots \approx 0{,}929

Svar a): sxy=78711,14\displaystyle s_{xy} = \frac{78}{7} \approx 11{,}14, sx=244,90s_x = \sqrt{24} \approx 4{,}90 og sy=62,45s_y = \sqrt{6} \approx 2{,}45 — og r0,929r \approx 0{,}929,
nøyaktig som i eksempel 1.

b) Én million kroner er 10000001\,000\,000 kroner, så hver yy-verdi ganges med
10610^6. Da ganges hvert avvik yiyˉy_i - \bar{y} med 10610^6 også.

Kovariansen inneholder avviket én gang, så den ganges med 10610^6:

sxy=11,14210611142857s_{xy} = 11{,}142\ldots \cdot 10^6 \approx 11\,142\,857

Standardavviket sys_y inneholder avviket én gang under rottegnet etter
kvadreringen, så også det ganges med 10610^6:

sy=2,449106s_y = 2{,}449\ldots \cdot 10^6

sxs_x er uendret — vi har ikke rørt antall ansatte.

Korrelasjonen har 10610^6 både i telleren og i nevneren:

r=11,1421064,8982,449106=11,142120,929r = \frac{11{,}142\ldots \cdot 10^6}{4{,}898\ldots \cdot 2{,}449\ldots \cdot 10^6} = \frac{11{,}142\ldots}{12} \approx 0{,}929

Svar b): Kovariansen blir en million ganger større, mens rr er nøyaktig
det samme.

Her ser vi at kovariansen ikke kan brukes til å sammenligne to ulike
materialer — den avhenger av hvilken enhet vi måler i. Det er nettopp derfor vi
deler på sxsys_x \cdot s_y: divisjonen gjør tallet enhetsløst, og dermed
sammenlignbart.

📝Oppgave 2

Vurder hver av påstandene. Er de riktige? Begrunn.

a

«r=0,62r = 0{,}62 betyr at 62 %62\ \% av punktene ligger på linja.»

b

«r=0,95r = -0{,}95 er en svakere sammenheng enn r=0,80r = 0{,}80, siden 0,95<0,80-0{,}95 < 0{,}80

c

«rr endrer seg hvis vi bytter om hva som står på førsteaksen og andreaksen.»

d

«r=1,2r = 1{,}2 betyr en ekstra sterk sammenheng.»

e

«Er rr nær 00, finnes det ingen sammenheng mellom variablene.»

✏️Eksempel 3 – Én uteligger snur konklusjonen

En nettbutikk har registrert hvor mange ganger hver kunde besøkte nettsiden i
løpet av en måned, og hvor mye kunden handlet for.

Besøk2334455667
Beløp (kr)520410640350700480610390560450

Så legges en ellevte kunde inn: en bedriftskunde med 2828 besøk og
31003\,100 kroner.

a) Hva er rr uten bedriftskunden, og hva er rr med?
b) Hvilken konklusjon ville en som bare så på rr, trekke?

c) Hva bør butikken gjøre?

a) Vi legger tallene i regnearket og bruker =KORRELASJON(...) på de to
utvalgene.

Uten bedriftskunden (n=10n = 10):

r=0,18550,186r = -0{,}1855\ldots \approx -0{,}186

Med bedriftskunden (n=11n = 11):

r=0,96350,964r = 0{,}9635\ldots \approx 0{,}964

Svar a): rr går fra 0,186-0{,}186 til 0,9640{,}964 når ett punkt legges til.

b) En som bare leste tallet 0,9640{,}964, ville konkludert: «Sterk positiv
sammenheng — kunder som besøker siden ofte, handler for mye mer. Vi bør få folk
til å besøke siden oftere.»

Ser vi på figuren, holder ikke konklusjonen. De ti vanlige kundene viser ingen
sammenheng i det hele tatt; punktskyen er en klump. Hele korrelasjonen kommer
fra den ene bedriftskunden, som både besøker siden ofte og handler mye —
fordi det er en bedrift, ikke fordi besøkene fører til kjøp.

Svar b): At flere besøk gir større kjøp — en konklusjon som bygger på ett
eneste punkt.

c) Butikken bør gjøre tre ting, i denne rekkefølgen:

1. Se på figuren. Da oppdages uteliggeren med én gang.
2. Finne ut hva punktet er. Er det en tastefeil, skal det rettes. Er det en
ekte, men annerledes kunde, hører den ikke hjemme i samme materiale.
3. Rapportere begge tallene hvis kunden beholdes: «r=0,96r = 0{,}96 for alle
1111 kundene, men r=0,19r = -0{,}19 for de 1010 privatkundene.»

Svar c): Skille bedriftskunder fra privatkunder og analysere gruppene hver
for seg.

Andre muligheter: Uteliggeren kan også håndteres ved å bruke en metode som
er robust mot enkeltpunkter, eller ved å samle inn flere bedriftskunder — én
enhet kan uansett aldri bære en konklusjon alene.

📝Oppgave 3
Del 2 (digitale verktøy). Tolv kommuner har oppgitt andelen av de voksne
som har fagbrev, og arbeidsledigheten.

Fagbrev (%)18,219,520,121,422,022,823,524,125,026,227,428,6
Ledighet (%)3,83,53,63,23,32,93,02,72,62,42,22,0
a

Lag et spredningsplott og finn rr. Rund av til tre desimaler.

b

Beskriv sammenhengen med ord.

c

En trettende kommune legges til: 34,5 %34{,}5\ \% fagbrev og 4,6 %4{,}6\ \% ledighet. Hva blir rr nå?

d

Forklar hvorfor ett punkt kan endre rr så mye.

e

Hva ville du gjort med den trettende kommunen?

Løs oppgaven
✏️Eksempel 4 – Samme $r$, ulik virkelighet
a) To modeller gir tallparene

A:(1; 10,5), (2; 11), (3; 11,5), (4; 12), (5; 12,5)A: (1;\ 10{,}5),\ (2;\ 11),\ (3;\ 11{,}5),\ (4;\ 12),\ (5;\ 12{,}5)
B:(1; 15), (2; 20), (3; 25), (4; 30), (5; 35)B: (1;\ 15),\ (2;\ 20),\ (3;\ 25),\ (4;\ 30),\ (5;\ 35)

Finn rr i begge og forklar hva det viser.

b) Boligmaterialet fra kapittel 2.1 hadde r=0,971r = 0{,}971 for alle ti boligene.
Hva blir rr hvis vi bare ser på de fem boligene mellom 6464 og
92 m292\ \text{m}^2 — altså (64; 3,2)(64;\ 3{,}2), (70; 3,9)(70;\ 3{,}9), (78; 3,8)(78;\ 3{,}8),
(85; 4,5)(85;\ 4{,}5) og (92; 4,3)(92;\ 4{,}3)?

a) I begge tilfellene ligger punktene nøyaktig på en rett linje: i A øker
yy med 0,50{,}5 hver gang xx øker med 11, i B øker yy med 55.

rA=1ogrB=1r_A = 1 \qquad \text{og} \qquad r_B = 1

Svar a): Begge har r=1r = 1, selv om linja i B er ti ganger så bratt.

Her ser vi at rr måler hvor godt punktene følger linja, ikke hvor mye yy
endrer seg. Skal vi si noe om hvor mye yy endrer seg per enhet xx, trenger vi
stigningstallet — og det finner vi i kapittel 2.3.

b) Vi regner med regneark:

r=0,86890,869r = 0{,}8689\ldots \approx 0{,}869

Spredningsplott over bruksareal og pris for ti boliger. Den vannrette aksen viser bruksareal i kvadratmeter fra 0 til 120, den loddrette pris i millioner kroner fra 0 til 6. Et gult loddrett bånd dekker arealene fra 64 til 92 kvadratmeter. De fem boligene inne i båndet — (64; 3,2), (70; 3,9), (78; 3,8), (85; 4,5) og (92; 4,3) — er tegnet som store blå punkter, mens de fem utenfor — (45; 2,7), (52; 2,8), (58; 3,4), (100; 5,1) og (112; 5,2) — er nedtonet i grått. I figuren står tallene r = 0,971 for alle ti og r = 0,869 for de fem i båndet, og at x-området krymper fra 67 til 28 kvadratmeter.

Ingen tallverdi er endret — bare hvor bredt x spenner. Når materialet begrenses til de fem midterste boligene, faller r fra 0,971 til 0,869.

Svar b): rr faller fra 0,9710{,}971 til 0,8690{,}869 når vi bare beholder de fem
midterste boligene.

Hvorfor? Punktene ligger like langt fra linja som før — vi har ikke endret
ett eneste tall. Men xx-verdiene spenner nå bare over 28 m228\ \text{m}^2 i
stedet for 6767. Da blir avvikene xixˉx_i - \bar{x} små, mens den tilfeldige
variasjonen i pris er den samme. Støyen utgjør en større del av det vi måler,
og rr synker.

Slik leser du kritisk: En lav rr kan skyldes at utvalget dekker et for
smalt område, ikke at sammenhengen er svak. Spør alltid hvilket område
xx-verdiene dekker.

📝Oppgave 4
Del 1 (uten hjelpemidler). For hvert tilfelle: bestem rr, eller forklar
hvorfor rr ikke kan bestemmes.
a
x=1,2,3,4,5x = 1, 2, 3, 4, 5 og y=3x2y = 3x - 2.
b
x=1,2,3,4,5x = 1, 2, 3, 4, 5 og y=0,2x+9y = -0{,}2x + 9.
c
x=1,2,3,4,5x = 1, 2, 3, 4, 5 og y=4y = 4 for alle.
d

To materialer har r1=0,9r_1 = 0{,}9 og r2=0,9r_2 = -0{,}9. Hvilket har den sterkeste lineære sammenhengen?

e

Et materiale har r=0,95r = 0{,}95. Hvor mye øker yy når xx øker med 11?

Løs oppgaven
📝Oppgave 5
Del 2 (digitale verktøy). En by har talt sykkelturer og registrert
sykkelskader i ni år.

Sykkelturer (tusen)120135148160178195210232255
Registrerte skader424447465154556063
a

Finn korrelasjonen mellom antall turer og antall skader.

b

En avis skriver: «Sykling er blitt farligere — skadene øker år for år.» Er slutningen holdbar?

c

Lag en ny kolonne med skader per 100000100\,000 turer, og finn korrelasjonen mellom antall turer og denne raten.

d

Hva er nå konklusjonen, og hvorfor er den motsatt av avisens?

e

Hvilke forbehold må stå i en slik analyse?

Løs oppgaven
📝Oppgave 6
UndersøkelsesoppgaveDenne oppgaven krever at du undersøker kilder utenfor læreboka
Drøftingsoppgave. En elev skriver i en rapport: «Vi fant r=0,87r = 0{,}87
mellom antall timer lest og karakter. Sammenhengen er sterk, så lesing virker.»
a

Hvilke opplysninger mangler før rr-verdien kan vurderes?

b

Sett opp tre ulike forklaringer på et slikt funn, der bare den ene er «lesing virker».

c

Elevens materiale har n=8n = 8. Hvilken betydning har det?

d

Foreslå hvordan undersøkelsen kunne vært lagt opp for å si noe om årsak.

e

Skriv om elevens setning slik at den er dekkende for det som faktisk er målt.

Oppsummering

I dette kapittelet har du lært:

BegrepFormel eller regel
Korrelasjonskoeffisientenr=(xixˉ)(yiyˉ)(xixˉ)2(yiyˉ)2r = \dfrac{\sum (x_i-\bar{x})(y_i-\bar{y})}{\sqrt{\sum (x_i-\bar{x})^2 \cdot \sum (y_i-\bar{y})^2}}
Med standardavvikr=sxysxsyr = \dfrac{s_{xy}}{s_x \cdot s_y}
Verdiområde1r1-1 \le r \le 1
RetningFortegnet til rr
StyrkeTallverdien r\lvert r \rvert
Regneark=KORRELASJON(A2:A9;B2:B9)
GeoGebraKorrelasjonskoeffisient(L1, L2)

Framgangsmåte for hånd


1. Regn ut xˉ\bar{x} og yˉ\bar{y}.
2. Sett opp avvikstabellen med kolonnene xixˉx_i-\bar{x}, yiyˉy_i-\bar{y},
produktet og de to kvadratene.
3. Kontroller at begge avvikskolonnene summerer til 00.
4. Sett sumradens tre tall inn i formelen.

Husk


- n1n - 1 forkortes bort, så σ\sigma eller ss gir samme rr.

- rr er symmetrisk: det spiller ingen rolle hvilken variabel som kalles xx.
- rr er uten benevning og endres ikke av måleenhet.
- Én uteligger kan snu rr helt. Ett smalt xx-område kan senke rr uten at
sammenhengen er svakere.
- Se alltid på spredningsplottet.

Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.