
STATISTICA SOCIALE
Formule

Lorem1. Frequenza assoluta
Indica quante volte compare una determinata modalità.
ni=numero di osservazioni nella modalitaˋ i
Esempio: in un campione di 100 persone, 60 sono donne.
ndonne=60
Indica la proporzione di osservazioni appartenenti a una modalità.
fi=niN
dove:
ni = frequenza assoluta
N = numero totale di osservazioni
Esempio:
f=60100=0,60
cioè 60%.
Per ottenere la percentuale:
fi⋅100
Somma progressivamente le frequenze.
Fi=∑j=1inj
È particolarmente utile per variabili ordinali o quantitative.
Esempio: se le frequenze sono 10, 20, 30:
F1=10
F2=10+20=30
F3=10+20+30=60
È uno degli indici più importanti.
xˉ=∑i=1NxiN
Si sommano tutti i valori e si divide per il numero di osservazioni.
Esempio: età = 20, 25, 30
xˉ=20+25+303=25
La media è quindi 25 anni.
Se ogni valore compare più volte:
xˉ=∑xiniN
È il valore che divide la distribuzione ordinata in due parti uguali.
Me=xN+12
Me=xN2+xN2+12
Esempio:
10, 15, 20, 25, 30
La mediana è:
Me=20
La mediana è particolarmente utile quando ci sono valori estremi, perché è meno influenzata dalla loro presenza rispetto alla media.
È il valore che compare più frequentemente.
Mo=valore con frequenza massima
Esempio:
2, 3, 3, 3, 5, 7
La moda è:
Mo=3
Una distribuzione può avere una sola moda, più mode oppure nessuna moda.
Misura la distanza tra il valore massimo e quello minimo.
R=xmax−xmin
Esempio:
10, 15, 20, 30
R=30−10=20
Misura quanto i valori si discostano dalla media.
Per una popolazione:
σ2=∑(xi−μ)2N
Per un campione:
s2=∑(xi−xˉ)2N−1
Dove:
xi = singola osservazione
xˉ = media campionaria
N = numero di osservazioni
Più la varianza è elevata, maggiore è la dispersione dei dati.
È la radice quadrata della varianza.
Per la popolazione:
σ=∑(xi−μ)2N
Per un campione:
s=∑(xi−xˉ)2N−1
È molto utilizzata perché è espressa nella stessa unità di misura dei dati.
Serve soprattutto per confrontare la variabilità di distribuzioni con medie diverse.
CV=sxˉ×100
Esempio:
xˉ=50,s=5
CV=550×100=10%
Dividono i dati ordinati in quattro parti.
Q1 = primo quartile → 25%
Q2 = secondo quartile → 50% = mediana
Q3 = terzo quartile → 75%
L'intervallo interquartile è:
IQR=Q3−Q1
Misura la dispersione del 50% centrale dei dati.
Dividono la distribuzione in 100 parti.
Il percentile Pk indica il valore sotto il quale si trova circa il k% delle osservazioni.
Per esempio, se una persona si trova al 90° percentile, il suo valore è superiore o uguale a quello di circa il 90% delle osservazioni considerate.
Indica quanto una osservazione si trova lontana dalla media in termini di deviazioni standard.
z=x−xˉs
Esempio:
x=80,xˉ=70,s=5
z=80−705=2
Quindi il valore è 2 deviazioni standard sopra la media.
Misura come due variabili variano insieme.
Cov(X,Y)=∑(xi−xˉ)(yi−yˉ)N
In generale:
covarianza positiva → le variabili tendono a crescere insieme;
covarianza negativa → una tende a crescere quando l'altra diminuisce;
covarianza vicina a zero → non emerge una relazione lineare evidente.
È uno degli strumenti fondamentali della statistica sociale per misurare la forza e la direzione della relazione lineare tra due variabili quantitative.
r=Cov(X,Y)sXsY
Il valore è compreso tra:
−1≤r≤+1
r=+1 → relazione lineare positiva perfetta
r=−1 → relazione lineare negativa perfetta
r=0 → assenza di relazione lineare
Attenzione: correlazione non significa causalità.
Serve a descrivere la relazione tra una variabile dipendente Y e una variabile indipendente X.
Y=a+bX
dove:
a = intercetta
b = coefficiente angolare
X = variabile indipendente
Y = variabile dipendente
Il coefficiente b indica quanto cambia in media Y quando X aumenta di una unità.
Indica quanta parte della variabilità di Y è spiegata dal modello.
Nel caso della regressione lineare semplice:
R2=r2
Esempio:
R2=0,64
significa che il modello spiega il 64% della variabilità osservata di Y.
La probabilità di un evento A è:
P(A)=casi favorevolicasi possibili
quando tutti i casi sono equiprobabili.
Per esempio:
P(testa)=12
Indica la probabilità che avvenga A, sapendo che B si è verificato.
P(A∣B)=P(A∩B)P(B)
È molto importante nelle analisi sociali, per esempio quando si studia la probabilità di un comportamento condizionatamente a caratteristiche sociali.
È utilizzato soprattutto per verificare l'associazione tra variabili categoriali.
La formula è:
χ2=∑(O−E)2E
dove:
O = frequenza osservata
E = frequenza attesa
In una tabella di contingenza, per esempio, può essere utilizzato per studiare se titolo di studio e condizione occupazionale risultano statisticamente associati.
Per una media, quando si usa l'approssimazione normale:
IC=xˉ±zα/2sN
Per un intervallo al 95%, normalmente:
zα/2≈1,96
Quindi:
IC95%=xˉ±1,96sN
L'intervallo esprime l'incertezza associata alla stima della media nella popolazione.
| Concetto | Formula |
|---|---|
| Frequenza relativa | fi=ni/N |
| Percentuale | fi×100 |
| Media | xˉ=∑xi/N |
| Media con frequenze | xˉ=∑xini/N |
| Campo di variazione | R=xmax−xmin |
| Varianza | s2=∑(xi−xˉ)2/(N−1) |
| Deviazione standard | s=s2 |
| Coefficiente di variazione | CV=s/xˉ×100 |
| Z-score | z=(x−xˉ)/s |
| Correlazione Pearson | r=Cov(X,Y)/(sXsY) |
| Regressione | Y=a+bX |
| Determinazione | R2=r2 |
| Probabilità condizionata | P(A∣B)=P(A∩B)/P(B) |
| Chi-quadrato | χ2=∑(O−E)2/E |
Supponiamo di avere i seguenti dati relativi al numero di libri letti da 10 studenti:
2, 3, 1, 2, 4, 2, 5, 3, 2, 1
Contiamo quante volte compare ogni valore:
| Libri | Frequenza |
|---|---|
| 1 | 2 |
| 2 | 4 |
| 3 | 2 |
| 4 | 1 |
| 5 | 1 |
| Totale | 10 |
Per esempio:
n2=4
Quindi 4 studenti hanno letto 2 libri.
fi=niN
Per il valore 2:
f2=410=0,4
cioè:
0,4×100=40%
Risultato: il 40% degli studenti ha letto 2 libri.
Usiamo ancora:
2, 3, 1, 2, 4, 2, 5, 3, 2, 1
La formula è:
xˉ=∑xiN
Sommiamo:
2+3+1+2+4+2+5+3+2+1=25
Abbiamo 10 osservazioni:
xˉ=2510=2,5
xˉ=2,5
In media, gli studenti hanno letto 2,5 libri.
Se hai una tabella di frequenze, usa:
xˉ=∑xiniN
Prendiamo:
2, 3, 1, 2, 4, 2, 5, 3, 2, 1
Prima ordiniamo i dati:
1, 1, 2, 2, 2, 2, 3, 3, 4, 5
Abbiamo 10 valori, quindi N è pari.
Prendiamo i due valori centrali:
x5=2
x6=2
La mediana è:
Me=2+22=2
Me=2
Media ≠ mediana.
La media utilizza tutti i valori; la mediana dipende dalla posizione dei valori ordinati.
La moda è semplicemente il valore che compare più frequentemente.
Nel nostro esempio:
1 → 2 volte
2 → 4 volte
3 → 2 volte
4 → 1 volta
5 → 1 volta
Quindi:
Mo=2
Questa è una delle formule che crea più difficoltà.
Prendiamo un esempio più piccolo:
2, 4, 4, 6
xˉ=2+4+4+64=4
| xi | xi−xˉ |
|---|---|
| 2 | -2 |
| 4 | 0 |
| 4 | 0 |
| 6 | +2 |
| xi | Scarto | Scarto² |
|---|---|---|
| 2 | -2 | 4 |
| 4 | 0 | 0 |
| 4 | 0 | 0 |
| 6 | +2 | 4 |
Somma:
4+0+0+4=8
Se consideriamo questi dati come popolazione:
σ2=84=2
Quindi:
σ2=2
Se invece sono un campione:
s2=84−1
s2=83≈2,67
La differenza fondamentale è:
Popolazione
∑(xi−μ)2N
Campione
∑(xi−xˉ)2N−1
È la radice quadrata della varianza.
Nel caso della popolazione:
σ=2
σ≈1,41
La deviazione standard ci dice, in termini generali, quanto i dati tendono ad allontanarsi dalla media.
Supponiamo:
xˉ=50
s=5
La formula è:
CV=sxˉ×100
Quindi:
CV=550×100=10%
CV=10%
È particolarmente utile per confrontare la variabilità relativa di distribuzioni diverse.
Supponiamo che uno studente abbia ottenuto:
X=80
La media è:
xˉ=70
e la deviazione standard:
s=5
Usiamo:
z=x−xˉs
Quindi:
z=80−705=2
z=2
Il punteggio è 2 deviazioni standard sopra la media.
Se avessimo ottenuto:
z=−2
sarebbe stato 2 deviazioni standard sotto la media.
Questa è fondamentale nella statistica sociale.
Immaginiamo di voler studiare la relazione tra:
X = ore di studio
Y = voto
Supponiamo di ottenere:
r=0,80
Il coefficiente di Pearson varia tra:
−1≤r≤1
| Valore | Interpretazione |
|---|---|
| r≈+1 | forte relazione positiva |
| r≈0 | assenza di relazione lineare |
| r≈−1 | forte relazione negativa |
Quindi:
r=0,80
indica una forte associazione lineare positiva.
Se r=0,80, possiamo dire che studiare causa voti più alti?
No.
La correlazione descrive un'associazione lineare, ma non dimostra da sola un rapporto causale.
Se:
r=0,80
allora:
R2=r2
R2=0,802=0,64
Convertiamo in percentuale:
0,64×100=64%
Il valore di R2 è 0,64, cioè il 64% della variabilità di Y è associata alla componente lineare spiegata dal modello nel caso considerato.
⚠️ Anche qui non significa automaticamente che il 64% del fenomeno sia "causato" da X.
La formula fondamentale è:
Y=a+bX
Supponiamo di avere:
Y=40+3X
Dove:
a=40
b=3
Se:
X=10
allora:
Y=40+3(10)
Y=70
Il coefficiente:
b=3
significa che, nel modello, a un aumento di una unità di X corrisponde in media un aumento di 3 unità di Y.
Supponiamo di avere 100 persone:
60 occupate
40 non occupate.
La probabilità di selezionare casualmente una persona occupata è:
P(Occupato)=60100=0,60
oppure:
60%
Supponiamo di avere:
| Occupati | Non occupati | Totale | |
|---|---|---|---|
| Laureati | 80 | 20 | 100 |
| Non laureati | 40 | 60 | 100 |
Vogliamo sapere:
Qual è la probabilità di essere occupato sapendo che una persona è laureata?
Usiamo:
P(A∣B)=P(A∩B)P(B)
In questo caso:
P(Occupato∣Laureato)=80100=0,80
Quindi:
80%
Serve per analizzare l'associazione tra variabili categoriali.
Supponiamo di voler verificare la relazione tra:
genere
preferenza per un certo tipo di attività.
La formula è:
χ2=∑(O−E)2E
dove:
O = frequenza osservata
E = frequenza attesa.
In una tabella di contingenza:
E=Totale riga×Totale colonnaTotale generale
Questa formula è molto importante da ricordare.
Supponiamo:
| A favore | Contrari | Totale | |
|---|---|---|---|
| Gruppo A | 30 | 20 | 50 |
| Gruppo B | 20 | 30 | 50 |
| Totale | 50 | 50 | 100 |
Per la prima cella:
E=50×50100=25
Quindi abbiamo:
O=30
E=25
Il contributo della cella al chi-quadrato è:
(30−25)225=2525=1
Si fa lo stesso procedimento per tutte le celle e si sommano i risultati.
In questo esempio:
χ2=4
Il solo valore di χ2, però, non basta per decidere se l'associazione è statisticamente significativa: bisogna confrontarlo con una distribuzione del chi-quadrato oppure utilizzare il relativo p-value, tenendo conto dei gradi di libertà.
Supponiamo di avere:
xˉ=50
s=10
N=100
Per un intervallo approssimato al 95%:
IC=xˉ±1,96sN
Calcoliamo:
100=10
1010=1
1,96×1=1,96
Quindi:
IC=50±1,96
Otteniamo:
48,04≤μ≤51,96
Questa è probabilmente la cosa più importante per l'esame.
➡️ Media
xˉ=∑xiN
➡️ Mediana
➡️ Moda
➡️ Varianza / deviazione standard
➡️ Coefficiente di variazione
CV=sxˉ×100
➡️ Z-score
z=x−xˉs
➡️ Correlazione di Pearson
r
➡️ R2
➡️ Regressione
Y=a+bX
➡️ Chi-quadrato
χ2=∑(O−E)2E
➡️ Probabilità condizionata
P(A∣B)=P(A∩B)P(B)
Se devi preparare un esame e vuoi partire dalle formule più importanti, memorizzerei queste:
xˉ=∑xiN
Me=valore centrale
R=xmax−xmin
s2=∑(xi−xˉ)2N−1
s=s2
CV=sxˉ×100
z=x−xˉs
r=Cov(X,Y)sXsY
Y=a+bX
χ2=∑(O−E)2E
Non basta saper fare i calcoli. In Statistica Sociale, all'esame è spesso altrettanto importante saper interpretare il risultato.
Per esempio, non limitarti a scrivere:
r=0,72
ma scrivi:
“Tra le due variabili emerge una relazione lineare positiva piuttosto elevata. Il coefficiente di correlazione, tuttavia, non consente da solo di stabilire un rapporto causale.”
Questo tipo di interpretazione è ciò che trasforma un calcolo in una risposta da esame. Ipsum dolor sit amet