Statistiske begreber (R², regression)
Geografi · 10. klasse · Kommunikation
Statistiske begreber for geografi
Geografi er datadrevet — du arbejder med tabeller, tidsserier, sammenligninger. Statistisk forståelse er nødvendig for at undgå fejl og kommunikere troværdigt.
Centrale begreber
Gennemsnit (middelværdi)
- Sum af alle værdier ÷ antal
- Følsom for outliers
Median
- Midt-værdien når sorteret
- Mere robust end gennemsnit
- Bruges fx for lønninger (få høje løn-modtagere skævvrider gennemsnittet)
Standardafvigelse
- Hvor "spredt" er data?
- Lille SD = data tæt om gennemsnittet
- Stor SD = stor variation
Percentiler
- 50%-percentilen = medianen
- 90%-percentilen = grænsen hvor 90% af data ligger under
- Bruges fx i økonomisk ulighed
Regression — lineær sammenhæng
Y = a + b·X
- a = skæring (Y når X = 0)
- b = hældning (hvor meget Y stiger pr. enhed X)
Eksempel: Sammenhæng mellem indkomst og forventet levetid:
- Levetid = 65 + 0,000003 × BNP-pr-indb
- Hver $10.000 ekstra BNP → 0,03 år ekstra levetid
R² (forklaringsgrad)
R² = mellem 0 og 1. Hvor stor andel af variationen i Y forklares af X?
- R² = 0: ingen sammenhæng
- R² = 0,5: X forklarer 50% af variationen
- R² = 0,9: X forklarer 90% (meget stærk)
- R² = 1: perfekt sammenhæng (sjældent i virkeligheden)
Geografisk eksempel: BNP vs. forventet levetid har R² ≈ 0,7 — stærk men ikke perfekt sammenhæng.
Korrelation
Korrelation måler styrken af sammenhæng mellem 2 variable: -1 til +1.
- +1 = perfekt positiv (X stiger → Y stiger)
- 0 = ingen sammenhæng
- -1 = perfekt negativ (X stiger → Y falder)
KORRELATION ≠ KAUSALITET!
Det vigtigste statistiske princip:
Eksempel: Iskremsalg og drukneulykker er korrelerede. Men iskrem forårsager ikke drukneulykker — den konfunderende variabel er sommertemperatur.
Geografi-eksempler på korrelation uden kausalitet:
- Lande med flere storker har flere fødsler (begge korrelerer med rurale-områder)
- Andel af storedigede har korrelation med BNP (begge stiger med tid)
Konfidensintervaller
Når vi siger "Danmarks BNP-vækst i 2024 var 1,5% ± 0,3%" — det er et konfidensinterval.
- 95% CI betyder: vi er 95% sikre på at den sande værdi ligger i intervallet
- Bredt interval = stor usikkerhed
- Smalt interval = mere præcis
P-værdi (signifikans)
P < 0,05 = statistisk signifikant
- Sandsynligheden for at observere så ekstreme resultater hvis der ikke er nogen sammenhæng
- Lav P → resultatet er sandsynligvis ægte
- Høj P → kunne være tilfældigt
Excel-værktøjer
- =GENNEMSNIT() = mean
- =MEDIAN() = median
- =STDAFV.S() = standardafvigelse
- =KORRELATION() = korrelation
- =PEARSON() = også korrelation
- Indsæt → Diagram → Tilføj trendlinje → Vis R² = lineær regression
Pas på dette
Lyver IKKE med statistik. Vælg klassedeling, akse-skala, etc., for at vise data fair. Tegn manipulerede grafer er en form for uærlighed.
Læringsmål
- Beregne gennemsnit, median, standardafvigelse
- Forstå og fortolke R² i regression
- Skelne mellem korrelation og kausalitet
- Identificere konfunderende variable
- Bruge Excel til simple statistiske analyser
- Læse statistiske resultater kritisk
Projekt: Lav en regression-analyse
Vælg to geografiske variable du tror hænger sammen (fx BNP-pr-indb. vs. forventet levetid; eller CO₂-udledning vs. BNP). Hent data fra Verdensbanken for fx 30 lande.
Indsæt i Excel:
1. Lav et scatterplot (X-Y-diagram)
2. Tilføj trendlinje (lineær)
3. Vis R²-værdi
4. Tolk: hvor stærk sammenhæng?
5. Diskutér: er det kausal eller bare korrelation?
Diskussions-opgave: "Lande med flere McDonald's har højere BNP." Sandt? Hvad er korrelationen, hvad er kausaliteten?
Cool faldgruber: Læs "How to Lie with Statistics" af Darrell Huff (1954, stadig relevant). Lærer at se igennem manipulerede statistikker.
Brobygning: Statistik er fundament i samfundsvidenskab, økonomi, datajournalistik, alt naturvidenskabeligt.
Øv dette emne med AI — quizzer, forklaringer og feedback tilpasset dit niveau.
Prøv Fagportalen gratis