26 Avvikelse, varians och standardavvikelse
26.0.1 Begrepp
- Absolut avvikelse: För variabel \(x\) population: \(\frac{1}{n}\sum\left\| x_{i} - \overline{x} \right\|\).
- Varians: För en variabel \(x\) har vi: \(var(x) = \left( \frac{1}{n} \right)\sum_{i}^{n}\left( x_{i} - \overline{x} \right)^{2}\).
- Standardavvikelse: För variabel \(x\) har vi: \(s_{x} = + \sqrt{var(x)} = \left( \frac{\sum_{i}^{n}\left( x_{i} - \overline{x} \right)^{2}}{n} \right)^{\frac{1}{2}}\)
- Bessels korrigering: För att undvika att vi underskattar populationsvärden kan vi dividera estimatorerna med \(n - 1\) i stället för \(n\).
26.0.2 Teori
I föregående avsnitt beskrev vi hur vi med urvalsdata kan uppskatta populationens medelvärde.
Vi såg även exempel på hur vi kan beskriva spridning i en samling värden. I detta avsnitt ska vi nu introducera andra vanliga statistiska metoder för att studera spridning.
26.0.2.1 Absolut avvikelse
Ett sätt att mäta avvikelser från medelvärdet är att uppskatta genomsnittlig absolut avvikelse (engelska mean absolute deviation):
\[\frac{1}{n}\sum\left\| x_{i} - \overline{x} \right\| \tag{1}\]
Vi kan även byta ut medelvärdet \(\overline{x}\) mot annat genomsnittsmått som median eller typvärde.
26.0.2.2 Varians
Ett annat sätt att summera avvikelser från medelvärdet till ett positivt värde är att kvadrera avvikelserna: \(\left( x_{i} - \overline{x} \right)^{2}\).
Dividerar vi summan av de kvadrerade differenserna med antal observationer \(n\) får vi variansen för variabel x:
\[var(x) = \left( \frac{1}{n} \right)\sum_{i}^{n}\left( x_{i} - \overline{x} \right)^{2} \tag{2}\]
Parentesen \(\left( x_{i} - \overline{x} \right)^{2}\) ska beräknas för varje observation och summeras:
\[\sum_{i}^{n}{\left( x_{i} - \overline{x} \right)^{2} =}\left( x_{i} - \overline{x} \right)^{2} + \left( x_{i} - \overline{x} \right)^{2} + \ldots + \left( x_{i} - \overline{x} \right)^{2} \tag{3}\]
På samma sätt som att medelvärdet \(\overline{x}\) är en uppskattning av populationens \(\mu_{x}\) är \(var(x)\) en uppskattning av variansen i populationen. Variansen i populationen för variabeln \(x\) betecknas ofta med den grekiska bokstaven lilla sigma i kvadrat, \(\sigma_{x}^{2}\).
26.0.2.3 Standardavvikelse
Standardavvikelse för en samling observationer är positiva kvadratroten av variansen. För population betecknas ofta standardavvikelse \(\sigma_{x}\).
Uppskattad standardavvikelse för variabel \(x\) kan skrivas \({\widehat{\sigma}}_{x}\), \(sd_{x}\) eller \(s_{x}\):
\[s_{x} = + \sqrt{var(x)} = \left( \frac{\sum_{i}^{n}\left( x_{i} - \overline{x} \right)^{2}}{n} \right)^{\frac{1}{2}} \tag{4}\]
26.0.2.4 Bessels korrigering
När vi estimerar medelvärdet med urvalsdata (\(\overline{x}\)) avviker ofta detta från populationens medelvärde (\(\mu_{x}\)). Denna avvikelse tenderar att leda till att vår uppskattning av populationens varians blir för liten.
För att justera för detta när vi estimerar varians (ekvation 2) dividera med \(n - 1\) i stället för \(n\). Detta kallas för korrigerad varians eller urvalsvarians (engelska sample variance):
\[var(x) = \left( \frac{1}{n - 1} \right)\sum_{i}^{n}\left( x_{i} - \overline{x} \right)^{2} \tag{5}\]
Division med \(n - 1\) kallas för Bessels korrigering och medför ofta att den uppskattade variansen hamnar närmare populationens varians. Många datorprogram har färdiga kommandon för att estimera (beräkna) varians och använder då Bessels korrigering, som i ekvation 5. Även för standardavvikelse kan vi använda Bessels korrigering:
\[s_{x} = \left( \frac{\sum_{i}^{n}\left( x_{i} - \overline{x} \right)^{2}}{n - 1} \right)^{\frac{1}{2}} \tag{6}\]
26.0.2.5 Varians och standardavvikelse med konstant
Om vi har en konstant \(a\), ett valfritt värde, är variansen för denna \(var(a) = 0\). Detta eftersom ett enskilt värde inte har någon spridning.
Om \(a\) är multiplicerad med en variabel \(x\) är variansen för \(ax\) lika med \(a^{2}var(x)\). Detta kan vi se genom att ta:
\[\begin{align} var(ax) &= \left( \frac{1}{n} \right)\sum_{i}^{}\left( {ax}_{i} - a\overline{x} \right)^{2} \tag{7}\\ &= \left( \frac{1}{n} \right)\sum_{i}^{}\left( {a^{2}x}_{i}^{2} - 2a^{2}\overline{x} + a^{2}{\overline{x}}^{2} \right) \end{align}\]
Eftersom \(a\) inte påverkas av summeringen kan vi flytta ut alla \(a^{2}\): \[\begin{align} var(ax) &= a^{2}\left( \frac{1}{n} \right)\sum\left( x_{i}^{2} - 2\overline{x} + {\overline{x}}^{2} \right) \tag{8}\\ &= a^{2}\left( \frac{1}{n} \right)\sum\left( x_{i} - \overline{x} \right)^{2} \\ &= a^{2}var(x) \end{align}\] För standardavvikelse får vi:
\[\begin{align} s_{x}(ax) &= \left( \frac{1}{n}\sum_{i}^{n}\left( {ax}_{i} - a\overline{x} \right)^{2} \right)^{\frac{1}{2}} \tag{9}\\ &= \left( \frac{1}{n}\sum_{i}^{}\left( {a^{2}x}_{i}^{2} - 2a^{2}\overline{x} + a^{2}{\overline{x}}^{2} \right) \right)^{\frac{1}{2}} \\ &= \left( a^{2} \right)^{\frac{1}{2}}\left( \frac{1}{n}\sum\left( x_{i} - \overline{x} \right)^{2} \right)^{\frac{1}{2}} \\ &= \|a\|s_{x} \end{align}\] där \(\|a\|\) är absolutbeloppet av konstanten \(a\).
26.0.2.6 Ett exempel
Nu ska vi beräkna (skatta) variansen med fyra observationer för två variabler: \(x\) och \(y\). Variabel \(x\) har värdena 3, 4, 6 och 7. Variabeln \(y\) har värdena 3, 2, 5 och 4. Tabell 1 sammanfattar beräkningarna vi behöver.
Tabell 1: Några beräkningar för variablerna \(\mathbf{x}\) och \(\mathbf{y}\)
| Observation | \(x_{i}\) | \(y_{i}\) | \(x_{i} - \overline{x}\) | \(y_{i} - \overline{y}\) | \(\left( x_{i} - \overline{x} \right)^{2}\) | \(\left( y_{i} - \overline{y} \right)^{2}\) |
|---|---|---|---|---|---|---|
| \(1\) | \(3\) | \(3\) | \(-2\) | \(-0{,}5\) | \(4\) | \(0{,}25\) |
| \(2\) | \(4\) | \(2\) | \(-1\) | \(-1{,}5\) | \(1\) | \(2{,}25\) |
| \(3\) | \(6\) | \(5\) | \(1\) | \(1{,}5\) | \(1\) | \(2{,}25\) |
| \(4\) | \(7\) | \(4\) | \(2\) | \(0{,}5\) | \(4\) | \(0{,}25\) |
| Medelvärde | \(5\) | \(3{,}5\) | ||||
| Summa | \(20\) | \(14\) | \(10\) | \(5\) |
Vi använder ekvation 5 för att skatta varians:
\[var(x) = \frac{\sum_{i}^{}\left( x_{i} - \overline{x} \right)^{2}}{n - 1} = \frac{10}{3} \tag{10}\]
\[var(y) = \frac{\sum_{i}^{}\left( y_{i} - \overline{y} \right)^{2}}{n - 1} = \frac{5}{3}\]
Variansen för variabel \(x\) är större än variansen i variabel \(y\). Detta indikerar att värdena i \(x\) är mer utspridda från medelvärdet jämfört med spridningen i variabel \(y\). För att beräkna standardavvikelse för variablerna \(x\) och \(y\) tar vi positiva kvadratroten av variansen:
\[s_{x} = \sqrt{\frac{\sum_{i}^{n}\left( x_{i} - \overline{x} \right)^{2}}{n - 1}} = + \sqrt{\frac{10}{3}} \approx 1{,}826 \tag{11}\]
\[s_{y} = + \sqrt{\frac{5}{3}} \approx 1{,}291\]
Övningar