8.2 Betinget forventning, prediksjon og MSE-minimering
Hvorfor forventningen minimerer forventet kvadratisk avvik, og hvorfor E(Y|X=x₀) er beste prediksjon når X og Y henger sammen.
Sensor vil se to ting: (1) at du kan vise at forventningen er den konstanten som minimerer forventet kvadratisk avvik (en aktiv utledning), og (2) at du forstår hvorfor er den beste prediksjonen av etter å ha observert . For binormale data faller dette sammen med den lineære regresjonslinjen fra kap. 8.1.
MSE-utledningen (variansdekomponeringen) må kunne gjøres aktivt — den står ikke i formelsamlingen. Selve normalfordelingens betingede uttrykk leses av formelsamlingen.
Sist du var her (fra kap. 8.1): for en binormal er den betingede fordelingen normal, med
Vi trenger også regneformelen fra kap. 1.2. I dette kapitlet spør vi: hvorfor er nettopp forventningen det beste gjettet, og hva menes med «best»?
Å predikere er å gjette en verdi vi ikke har observert. Men hvilket gjett er best? Svaret avhenger av hvordan vi straffer bommen. Standardvalget i statistikken er kvadratisk tap — vi straffer med kvadratet av avviket — og da har spørsmålet ett rent svar: det beste konstante gjettet er forventningen, og det beste gjettet gitt data er den betingede forventningen.
Kapitlet har to læringsløkker. Løkke 1 (~24 min) viser at minimerer , med den nyttige variansdekomponeringen. Løkke 2 (~24 min) løfter dette til prediksjon gitt data: er beste prediksjon, og for binormale data er det regresjonslinjen fra 8.1. Hver løkke går teori → eksempel → oppgave.
Løkke 1 — Hvorfor forventningen minimerer forventet kvadratisk avvik (~24 min)
MSE står for «mean squared error» (gjennomsnittlig kvadratisk feil). Vi kvadrerer avviket slik at positive og negative bom ikke utligner hverandre, og slik at store bom straffes hardere enn små. Målet er å velge den som gjør MSE minst mulig.
Utledningen: variansdekomponeringen
Vi skriver om ved å legge til og trekke fra forventningen :
Intuisjon: vi splitter avviket i to biter — hvor langt gjettet vårt ligger fra sannheten , og hvor langt selv svinger rundt .
Ganger vi ut kvadratet, får vi tre ledd:
Intuisjon: det midterste leddet inneholder — en variabel svinger per definisjon symmetrisk rundt sin egen forventning — så krysseleddet forsvinner.
Da står vi igjen med
Intuisjon: siste ledd er spredningen i og avhenger ikke av gjettet vårt. Bare det første leddet kan vi styre, og det er minst mulig (lik null) når .
Siden ikke avhenger av , minimeres uttrykket ved å nulle ut , altså ved . Minimumsverdien er da — forventningen kan aldri gjette bedre enn variansen tillater.
Merk at «best» her betyr minst forventet kvadratisk avvik. Straffer vi i stedet med absoluttverdi , blir det beste gjettet medianen, ikke forventningen. Valget av tapsfunksjon avgjør hvilket sentralmål som er optimalt.
En variabel har og .
a) Skriv som funksjon av og finn den som minimerer den.
b) Hva blir forventet kvadratisk avvik om vi i stedet gjetter ?
Dette er en parabel i med bunnpunkt der , altså . Minsteverdien er .
b) Med :
Å bomme enheter på forventningen koster ekstra utover den uunngåelige variansen på .
(Innstegsoppgave.) En variabel har og . Hvilken konstant minimerer , og hva er minsteverdien?
En variabel har og .
a) Finn for og for .
b) Hvor mye koster det ekstra å bomme med enheter?
Vis at minimerer ved å bruke variansdekomponeringen, og forklar i én setning hvorfor det midterste leddet i utregningen forsvinner.
— naturlig pausepunkt —
Du har vist at forventningen er beste konstante gjett. Neste løkke bruker samme logikk når vi har informasjon: hva er beste gjett på når vi har observert ?
Løkke 2 — Beste prediksjon gitt data (~24 min)
Anta at er det vi vil forutsi, og at vi først får observere en samvarierende variabel . Nå er gjettet ikke lenger en fast konstant, men kan avhenge av den observerte -verdien: vi leter etter en funksjon som gjør forventet kvadratisk prediksjonsfeil minst mulig. Svaret er den betingede forventningen.
Begrunnelsen er den samme dekomponeringen som i løkke 1, men anvendt betinget: for hver fast er den konstanten som minimerer . Å velge dette gjettet for hver minimerer også helheten. kalles regresjonsfunksjonen.
For en binormal slipper vi integralet: den betingede fordelingen er kjent å være normal, så vi leser bare av forventningen direkte.
Usikkerheten rundt denne prediksjonen er den betingede variansen , som er mindre enn den marginale (så lenge ). I den standardiserte binormalen er beste prediksjon rett og slett . Dette er nettopp regresjonsmodellen som estimeres fra data i kap. 8.3.
a) Hva er den beste prediksjonen av i kvadratisk forstand?
b) Hvor stor er usikkerheten (variansen) rundt prediksjonen, og hvordan står den mot den marginale usikkerheten om ?
b) Usikkerheten er den betingede variansen:
Marginalt er . Å kjenne reduserer usikkerheten om fra til — nesten en halvering, fordi korrelasjonen er ganske sterk ( forklares).
a) Skriv opp beste prediksjon .
b) Regn ut prediksjonen og den tilhørende betingede variansen for .
a) Vis at minimerer (uten data), og at minsteverdien er .
b) Vis at det beste gjettet på etter å ha observert er , og forklar hvorfor forventet kvadratisk prediksjonsfeil da synker til .
En konsentrasjonsmåling gir binormale med , , , og . Et laboratorium måler og vil forutsi .
a) Hva er beste prediksjon av , og hvorfor er den lavere enn ?
b) Hvor stor er den forventede kvadratiske prediksjonsfeilen, og hvor mange prosent av variansen i «forklares» av ?
- Minimere feil størrelse. Med kvadratisk tap er beste gjett forventningen; bruker man absoluttverdi , er det medianen som er optimal. Blander man tapsfunksjonene, får man feil svar.
- Forveksle betinget og marginal forventning. avhenger av den observerte ; er gjennomsnittet over alle utfall. De er like bare når og er uavhengige ().
- Glemme at prediksjonsfeilen krymper til . Å bruke som usikkerhet etter at er observert, overser reduksjonen med faktoren .
- Droppe krysseleddet i utledningen uten begrunnelse. Leddet forsvinner fordi — dette bør stå eksplisitt for full uttelling.
- Tro at beste prediksjon alltid er lineær. Den generelle beste prediksjonen er , som er lineær fordi fordelingen er binormal; for andre fordelinger kan regresjonsfunksjonen være krum.
Begrepsbank til eksamen
Begrepsbanken er flashcard-/repetisjonsstoff — hopp trygt over ved førstegangslesing; tidsanslaget for kapitlet gjelder kjernestoffet.
Å måle bommen med kvadratet av avviket, . Kvadreringen gjør at store bom straffes uforholdsmessig hardt og at positive og negative avvik ikke utligner hverandre. Med kvadratisk tap er det optimale punktestimatet forventningen; med absoluttverditap er det medianen.
Funksjonen som gir beste prediksjon av for hver verdi av . For binormale data er den lineær, ; for andre fordelinger kan den være krum.
Bytter vi kvadratisk tap med absoluttverditap , blir det optimale konstante gjettet medianen, ikke forventningen. Dette viser at «beste prediksjon» avhenger av hvordan bommen straffes; STK1100 bruker gjennomgående kvadratisk tap.
Andelen av variansen i som fjernes ved å kjenne : prediksjonsfeilen faller fra (uten data) til (med data), en reduksjon på . Ved hjelper ingenting; ved bestemmes eksakt.
Er og uavhengige (for binormale: ), er for alle : beste gjett er marginalforventningen uansett hva ble. Observasjonen av tilfører da ingen informasjon om .
Når og forenkles beste prediksjon til , og prediksjonsfeilen til . Den enkleste formen å regne og argumentere i — mange oppgaver standardiserer derfor først.
«Beste prediksjon» er alltid relativt til en tapsfunksjon. I STK1100 menes minst forventet kvadratisk feil; da er svaret forventningen (konstant) eller den betingede forventningen (med data). Skift av tapsfunksjon ville gitt et annet optimalt gjett.
Dette kapitlet er skrevet av Anthropics toppmodeller (Claude Opus og Claude Fable) og er foreløpig ikke manuelt gjennomgått — kvalitetskontrollen gjøres av uavhengige KI-agenter, og innmeldte feil rettes fortløpende. Funnet en feil? Meld fra, så retter vi den. Les mer om hvordan innholdet lages.
Skolesaga er en uavhengig læringsressurs og er ikke tilknyttet eller godkjent av Universitetet i Oslo. Dette er ikke offisielt studiemateriell. Les mer.