Statystyka rozszerzona - korelacja, regresja i rozkład normalny
Tablica wzorów do statystyki rozszerzonej: korelacja Pearsona, regresja liniowa, Z-score, standaryzacja, rozkład normalny, interpretacja wyników i zadania z możliwością sprawdzenia odpowiedzi.
Do czego służy ta tablica statystyki rozszerzonej?
Ta strona zbiera wzory, które pojawiają się w zadaniach typu: jak obliczyć korelację Pearsona, jak wyznaczyć prostą regresji, jak policzyć Z-score, jak odczytać prawdopodobieństwo z rozkładu normalnego oraz jak interpretować R². To naturalne rozszerzenie po podstawowej statystyce, czyli średniej, medianie, wariancji i odchyleniu standardowym.
Do szybkich obliczeń możesz użyć kalkulatora korelacji Pearsona, kalkulatora regresji liniowej, kalkulatora Z-score i standaryzacji oraz kalkulatora rozkładu normalnego. Jeżeli chcesz wrócić do podstaw, sprawdź też tablicę średniej, mediany i odchylenia standardowego.
Najważniejsze pojęcia w statystyce rozszerzonej
| Pojęcie | Co oznacza? | Kiedy używać? | Typowy wynik |
|---|---|---|---|
| Korelacja Pearsona r | Mierzy siłę i kierunek zależności liniowej między x i y. | Gdy masz pary danych, np. godziny nauki i wynik testu. | od -1 do 1 |
| R² | Współczynnik determinacji. Pokazuje, jaka część zmienności y jest wyjaśniana przez model liniowy. | Przy korelacji i regresji liniowej. | od 0 do 1 albo 0% do 100% |
| Regresja liniowa | Dopasowanie prostej y = ax + b do danych. | Gdy chcesz przewidzieć y dla podanego x. | równanie prostej |
| Z-score | Informuje, ile odchyleń standardowych wynik leży od średniej. | Gdy porównujesz wynik z całym zbiorem danych. | np. z = 1,25 |
| Rozkład normalny | Model danych skupionych wokół średniej w kształcie dzwonu. | Gdy liczysz prawdopodobieństwo lub percentyl dla danych zbliżonych do normalnych. | P(X≤x), P(a≤X≤b) |
Korelacja Pearsona - wzory i interpretacja
Współczynnik r
Wartość blisko 1 oznacza silną zależność dodatnią, a blisko -1 silną zależność ujemną.
Współczynnik R²
Dla prostej regresji R² mówi, jak dobrze zależność liniowa opisuje dane.
Brak korelacji liniowej
Wynik bliski zera oznacza brak wyraźnej zależności liniowej, ale nie wyklucza zależności nieliniowej.
Przykład: jeżeli r = 0,82, to zależność liniowa jest silna i dodatnia. Jeżeli r = -0,76, większe wartości x zwykle idą z mniejszymi wartościami y. Jeżeli r = 0,08, zależność liniowa jest bardzo słaba.
Regresja liniowa - równanie prostej
| Element | Wzór | Jak czytać? | Przykład interpretacji |
|---|---|---|---|
| Model regresji | y = ax + b | Prosta najlepiej dopasowana do punktów. | Prognoza wyniku y dla podanego x. |
| Nachylenie a | a = Σ((xᵢ-x̄)(yᵢ-ȳ)) / Σ(xᵢ-x̄)² | O ile średnio zmienia się y, gdy x rośnie o 1. | a = 2 oznacza wzrost y o około 2 jednostki. |
| Wyraz wolny b | b = ȳ - a·x̄ | Wartość y dla x = 0 w modelu. | Nie zawsze ma praktyczny sens, ale jest częścią równania. |
| Prognoza | ŷ = a·x + b | Wstawiasz nowe x do równania regresji. | Dla x=10 model może dać ŷ=27. |
| Reszta | e = y - ŷ | Różnica między wynikiem rzeczywistym a przewidywanym. | Małe reszty oznaczają lepsze dopasowanie. |
Z-score, standaryzacja i percentyle
Wzór na Z-score
Od wyniku odejmujesz średnią i dzielisz przez odchylenie standardowe.
Interpretacja
z dodatnie oznacza wynik powyżej średniej, a z ujemne wynik poniżej średniej.
Percentyl
Percentyl mówi, jaki procent wyników jest mniejszy lub równy badanemu wynikowi.
Do obliczenia Z-score potrzebujesz średniej i odchylenia standardowego. Jeśli ich nie masz, najpierw użyj kalkulatora wariancji i odchylenia standardowego, a dopiero później standaryzuj wynik.
Rozkład normalny - pole pod krzywą
| Pytanie w zadaniu | Zapis | Co liczysz? | Jak zacząć? |
|---|---|---|---|
| Jaka jest szansa, że X będzie mniejsze lub równe x? | P(X≤x) | Pole po lewej stronie punktu x. | Zamień x na Z-score. |
| Jaka jest szansa, że X będzie większe lub równe x? | P(X≥x) | Pole po prawej stronie punktu x. | Policz 1 - P(X≤x). |
| Jaka jest szansa, że X będzie między a i b? | P(a≤X≤b) | Pole między dwoma punktami. | Policz P(X≤b) - P(X≤a). |
| Jak działa reguła 68-95-99,7? | μ±σ, μ±2σ, μ±3σ | Orientacyjny udział danych wokół średniej. | Sprawdź, ile odchyleń od średniej obejmuje przedział. |
Jak rozpoznać, którego wzoru użyć?
Masz pary x,y?
Najpierw sprawdź korelację Pearsona. Jeśli chcesz przewidywać y, użyj regresji liniowej.
Masz jeden wynik i średnią?
Policz Z-score, żeby sprawdzić, jak daleko wynik leży od średniej.
Masz pytanie o prawdopodobieństwo?
Jeżeli dane pasują do krzywej dzwonowej, zastosuj rozkład normalny.
Masz duży rozrzut danych?
Wróć do wariancji, odchylenia standardowego, kwartylów i wartości odstających.
Przykład 1: interpretacja korelacji
Zadanie: Dla par danych otrzymano r = 0,72. Zinterpretuj wynik i oblicz R².
Interpretacja: zależność liniowa jest dodatnia i dość silna. Około 51,84% zmienności jednej zmiennej można w modelu liniowym powiązać ze zmiennością drugiej zmiennej.
Przykład 2: Z-score
Zadanie: Średnia wynosi 80, odchylenie standardowe 10, a wynik ucznia 95. Oblicz Z-score.
Wynik 95 leży 1,5 odchylenia standardowego powyżej średniej. To wyraźnie ponad przeciętną, ale nie jest jeszcze skrajnie odstające.
Przykład 3: regresja liniowa
Zadanie: Model regresji ma postać y = 3x + 4. Oblicz prognozę dla x = 6.
Prognozowana wartość y wynosi 22. Jeżeli rzeczywisty wynik byłby np. 20, reszta wynosiłaby e = 20 - 22 = -2.
Zadania ze statystyki rozszerzonej - pokaż wynik
Zadanie 1
Dla korelacji r = -0,60 oblicz R² i krótko opisz kierunek zależności.
Zadanie 2
Oblicz Z-score dla x = 130, średniej 100 i odchylenia standardowego 15.
Zadanie 3
Model regresji to y = 2,5x + 7. Oblicz prognozę dla x = 8.
Zadanie 4
W rozkładzie normalnym z = 0 oznacza jaki wynik względem średniej?
Zadanie 5
Jeżeli R² = 0,81, ile wynosi |r| w prostej regresji liniowej?
Zadanie 6
W regule 68-95-99,7 jaki procent danych leży zwykle w zakresie μ±2σ?
Najczęstsze błędy w korelacji, regresji i Z-score
- Traktowanie korelacji jak dowodu przyczyny. Korelacja pokazuje związek liczbowy, ale sama nie potwierdza, że jedna rzecz powoduje drugą.
- Używanie regresji liniowej, gdy punkty wyraźnie układają się nieliniowo.
- Mylenie r z R². Współczynnik r może być ujemny, a R² nie jest ujemne.
- Obliczanie Z-score bez sprawdzenia, czy odchylenie standardowe jest większe od zera.
- Odczytywanie rozkładu normalnego dla danych, które są bardzo skośne albo mają wiele wartości odstających.
- Zaokrąglanie wyników zbyt wcześnie, co może zmienić końcową interpretację.
Ciekawostka: wysokie R² nie zawsze oznacza dobry model
Wysokie R² wygląda atrakcyjnie, ale nie wystarczy do oceny modelu. Trzeba jeszcze zobaczyć wykres punktowy, reszty i sens danych. Prosta może dobrze pasować do zakresu danych, ale dawać słabe prognozy poza tym zakresem. Dlatego w zadaniach ze statystyki warto łączyć obliczenia z krótką interpretacją.
Statystyka rozszerzona w praktyce - szybki wybór narzędzia
| Masz w zadaniu... | Użyj | Powiązany kalkulator |
|---|---|---|
| Dwie listy liczb x i y | Korelacja Pearsona | korelacja Pearsona |
| Dane x,y i chcesz przewidzieć y | Regresja liniowa | regresja liniowa |
| Wynik, średnią i odchylenie | Z-score | Z-score i standaryzacja |
| Prawdopodobieństwo wokół średniej | Rozkład normalny | rozkład normalny |
| Średnią, medianę, wariancję, IQR | Statystyka opisowa | poradnik o średniej i odchyleniu |
Wskazówka od KalkulatorXXL
Przy statystyce rozszerzonej zawsze zaczynaj od pytania, co porównujesz. Jeśli porównujesz dwie zmienne, wybierz korelację albo regresję. Jeśli oceniasz jeden wynik na tle grupy, wybierz Z-score. Jeśli liczysz szansę lub pole pod krzywą, przejdź do rozkładu normalnego. Taki wybór narzędzia jest ważniejszy niż samo podstawienie liczb do wzoru.
Sprawdź także w pakiecie statystyki rozszerzonej
Tablica porządkuje wzory, ale do szybkich obliczeń warto przejść do kalkulatorów. Jeśli dopiero zaczynasz, najpierw uporządkuj średnią, medianę i odchylenie standardowe, a potem przejdź do korelacji, regresji, Z-score i rozkładu normalnego.