WWW.SIMPHONY.IT

.

13cf0d81-92f1-48b7-8330-6e91d1399f44

STATISTICA SOCIALE

 Formule

a60799d0-b31c-4523-8516-573d80e7ca2f

Lorem1. Frequenza assoluta

Indica quante volte compare una determinata modalità.

ni=numero di osservazioni nella modalitaˋ i

Esempio: in un campione di 100 persone, 60 sono donne.

ndonne=60

2. Frequenza relativa

Indica la proporzione di osservazioni appartenenti a una modalità.

fi=niN

dove:

ni = frequenza assoluta

N = numero totale di osservazioni

Esempio:

f=60100=0,60

cioè 60%.

Per ottenere la percentuale:

fi⋅100

3. Frequenza cumulata

Somma progressivamente le frequenze.

Fi=∑j=1inj

È particolarmente utile per variabili ordinali o quantitative.

Esempio: se le frequenze sono 10, 20, 30:

F1=10

F2=10+20=30

F3=10+20+30=60

4. Media aritmetica

È uno degli indici più importanti.

xˉ=∑i=1NxiN

Si sommano tutti i valori e si divide per il numero di osservazioni.

Esempio: età = 20, 25, 30

xˉ=20+25+303=25

La media è quindi 25 anni.

Con frequenze

Se ogni valore compare più volte:

xˉ=∑xiniN

5. Mediana

È il valore che divide la distribuzione ordinata in due parti uguali.

Se N è dispari:

Me=xN+12

Se N è pari:

Me=xN2+xN2+12

Esempio:

10, 15, 20, 25, 30

La mediana è:

Me=20

La mediana è particolarmente utile quando ci sono valori estremi, perché è meno influenzata dalla loro presenza rispetto alla media.

6. Moda

È il valore che compare più frequentemente.

Mo=valore con frequenza massima

Esempio:

2, 3, 3, 3, 5, 7

La moda è:

Mo=3

Una distribuzione può avere una sola moda, più mode oppure nessuna moda.

7. Campo di variazione

Misura la distanza tra il valore massimo e quello minimo.

R=xmax⁡−xmin⁡

Esempio:

10, 15, 20, 30

R=30−10=20

8. Varianza

Misura quanto i valori si discostano dalla media.

Per una popolazione:

σ2=∑(xi−μ)2N

Per un campione:

s2=∑(xi−xˉ)2N−1

Dove:

xi = singola osservazione

xˉ = media campionaria

N = numero di osservazioni

Più la varianza è elevata, maggiore è la dispersione dei dati.

9. Deviazione standard

È la radice quadrata della varianza.

Per la popolazione:

σ=∑(xi−μ)2N

Per un campione:

s=∑(xi−xˉ)2N−1

È molto utilizzata perché è espressa nella stessa unità di misura dei dati.

10. Coefficiente di variazione

Serve soprattutto per confrontare la variabilità di distribuzioni con medie diverse.

CV=sxˉ×100

Esempio:

xˉ=50,s=5

CV=550×100=10%

11. Quartili

Dividono i dati ordinati in quattro parti.

Q1 = primo quartile → 25%

Q2 = secondo quartile → 50% = mediana

Q3 = terzo quartile → 75%

L'intervallo interquartile è:

IQR=Q3−Q1

Misura la dispersione del 50% centrale dei dati.

12. Percentili

Dividono la distribuzione in 100 parti.

Il percentile Pk indica il valore sotto il quale si trova circa il k% delle osservazioni.

Per esempio, se una persona si trova al 90° percentile, il suo valore è superiore o uguale a quello di circa il 90% delle osservazioni considerate.

13. Standardizzazione: punteggio Z

Indica quanto una osservazione si trova lontana dalla media in termini di deviazioni standard.

z=x−xˉs

Esempio:

x=80,xˉ=70,s=5

z=80−705=2

Quindi il valore è 2 deviazioni standard sopra la media.

14. Covarianza

Misura come due variabili variano insieme.

Cov(X,Y)=∑(xi−xˉ)(yi−yˉ)N

In generale:

covarianza positiva → le variabili tendono a crescere insieme;

covarianza negativa → una tende a crescere quando l'altra diminuisce;

covarianza vicina a zero → non emerge una relazione lineare evidente.

15. Coefficiente di correlazione di Pearson

È uno degli strumenti fondamentali della statistica sociale per misurare la forza e la direzione della relazione lineare tra due variabili quantitative.

r=Cov(X,Y)sXsY

Il valore è compreso tra:

−1≤r≤+1

r=+1 → relazione lineare positiva perfetta

r=−1 → relazione lineare negativa perfetta

r=0 → assenza di relazione lineare

Attenzione: correlazione non significa causalità.

16. Regressione lineare semplice

Serve a descrivere la relazione tra una variabile dipendente Y e una variabile indipendente X.

Y=a+bX

dove:

a = intercetta

b = coefficiente angolare

X = variabile indipendente

Y = variabile dipendente

Il coefficiente b indica quanto cambia in media Y quando X aumenta di una unità.

17. Coefficiente di determinazione R2

Indica quanta parte della variabilità di Y è spiegata dal modello.

Nel caso della regressione lineare semplice:

R2=r2

Esempio:

R2=0,64

significa che il modello spiega il 64% della variabilità osservata di Y.

18. Probabilità

La probabilità di un evento A è:

P(A)=casi favorevolicasi possibili

quando tutti i casi sono equiprobabili.

Per esempio:

P(testa)=12

19. Probabilità condizionata

Indica la probabilità che avvenga A, sapendo che B si è verificato.

P(A∣B)=P(A∩B)P(B)

È molto importante nelle analisi sociali, per esempio quando si studia la probabilità di un comportamento condizionatamente a caratteristiche sociali.

20. Test del chi-quadrato

È utilizzato soprattutto per verificare l'associazione tra variabili categoriali.

La formula è:

χ2=∑(O−E)2E

dove:

O = frequenza osservata

E = frequenza attesa

In una tabella di contingenza, per esempio, può essere utilizzato per studiare se titolo di studio e condizione occupazionale risultano statisticamente associati.

21. Intervallo di confidenza della media

Per una media, quando si usa l'approssimazione normale:

IC=xˉ±zα/2sN

Per un intervallo al 95%, normalmente:

zα/2≈1,96

Quindi:

IC95%=xˉ±1,96sN

L'intervallo esprime l'incertezza associata alla stima della media nella popolazione.

🧠 Formulario essenziale da ricordare

ConcettoFormula
Frequenza relativafi=ni/N
Percentualefi×100
Mediaxˉ=∑xi/N
Media con frequenzexˉ=∑xini/N
Campo di variazioneR=xmax−xmin
Varianzas2=∑(xi−xˉ)2/(N−1)
Deviazione standards=s2
Coefficiente di variazioneCV=s/xˉ×100
Z-scorez=(x−xˉ)/s
Correlazione Pearsonr=Cov(X,Y)/(sXsY)
RegressioneY=a+bX
DeterminazioneR2=r2
Probabilità condizionataP(A∣B)=P(A∩B)/P(B)
Chi-quadratoχ2=∑(O−E)2/E

 

📚 Statistica Sociale — guida con esercizi svolti

1. Frequenze

Supponiamo di avere i seguenti dati relativi al numero di libri letti da 10 studenti:

2, 3, 1, 2, 4, 2, 5, 3, 2, 1

Frequenza assoluta

Contiamo quante volte compare ogni valore:

LibriFrequenza
12
24
32
41
51
Totale10

Per esempio:

n2=4

Quindi 4 studenti hanno letto 2 libri.

Frequenza relativa

fi=niN

Per il valore 2:

f2=410=0,4

cioè:

0,4×100=40%

Risultato: il 40% degli studenti ha letto 2 libri.

2. Media aritmetica

Usiamo ancora:

2, 3, 1, 2, 4, 2, 5, 3, 2, 1

La formula è:

xˉ=∑xiN

Sommiamo:

2+3+1+2+4+2+5+3+2+1=25

Abbiamo 10 osservazioni:

xˉ=2510=2,5

✅ Risultato

xˉ=2,5

In media, gli studenti hanno letto 2,5 libri.

Trucchetto da esame

Se hai una tabella di frequenze, usa:

xˉ=∑xiniN

3. Mediana

Prendiamo:

2, 3, 1, 2, 4, 2, 5, 3, 2, 1

Prima ordiniamo i dati:

1, 1, 2, 2, 2, 2, 3, 3, 4, 5

Abbiamo 10 valori, quindi N è pari.

Prendiamo i due valori centrali:

x5=2

x6=2

La mediana è:

Me=2+22=2

✅ Risultato

Me=2

Da ricordare

Media ≠ mediana.

La media utilizza tutti i valori; la mediana dipende dalla posizione dei valori ordinati.

4. Moda

La moda è semplicemente il valore che compare più frequentemente.

Nel nostro esempio:

1 → 2 volte

2 → 4 volte

3 → 2 volte

4 → 1 volta

5 → 1 volta

Quindi:

Mo=2

5. Varianza

Questa è una delle formule che crea più difficoltà.

Prendiamo un esempio più piccolo:

2, 4, 4, 6

Passaggio 1: calcoliamo la media

xˉ=2+4+4+64=4

Passaggio 2: calcoliamo gli scarti dalla media

xixi−xˉ
2-2
40
40
6+2

Passaggio 3: eleviamo al quadrato

xiScartoScarto²
2-24
400
400
6+24

Somma:

4+0+0+4=8

Se consideriamo questi dati come popolazione:

σ2=84=2

Quindi:

σ2=2

Se invece sono un campione:

s2=84−1

s2=83≈2,67

⚠️ Attenzione all'esame

La differenza fondamentale è:

Popolazione

∑(xi−μ)2N

Campione

∑(xi−xˉ)2N−1

6. Deviazione standard

È la radice quadrata della varianza.

Nel caso della popolazione:

σ=2

σ≈1,41

La deviazione standard ci dice, in termini generali, quanto i dati tendono ad allontanarsi dalla media.

7. Coefficiente di variazione

Supponiamo:

xˉ=50

s=5

La formula è:

CV=sxˉ×100

Quindi:

CV=550×100=10%

✅ Risultato

CV=10%

È particolarmente utile per confrontare la variabilità relativa di distribuzioni diverse.

8. Z-score

Supponiamo che uno studente abbia ottenuto:

X=80

La media è:

xˉ=70

e la deviazione standard:

s=5

Usiamo:

z=x−xˉs

Quindi:

z=80−705=2

Interpretazione

z=2

Il punteggio è 2 deviazioni standard sopra la media.

Se avessimo ottenuto:

z=−2

sarebbe stato 2 deviazioni standard sotto la media.

9. Correlazione di Pearson

Questa è fondamentale nella statistica sociale.

Immaginiamo di voler studiare la relazione tra:

X = ore di studio

Y = voto

Supponiamo di ottenere:

r=0,80

Il coefficiente di Pearson varia tra:

−1≤r≤1

Interpretazione generale

ValoreInterpretazione
r≈+1forte relazione positiva
r≈0assenza di relazione lineare
r≈−1forte relazione negativa

Quindi:

r=0,80

indica una forte associazione lineare positiva.

⚠️ Domanda tipica d'esame

Se r=0,80, possiamo dire che studiare causa voti più alti?

No.

La correlazione descrive un'associazione lineare, ma non dimostra da sola un rapporto causale.

10. Coefficiente di determinazione R2

Se:

r=0,80

allora:

R2=r2

R2=0,802=0,64

Convertiamo in percentuale:

0,64×100=64%

Interpretazione

Il valore di R2 è 0,64, cioè il 64% della variabilità di Y è associata alla componente lineare spiegata dal modello nel caso considerato.

⚠️ Anche qui non significa automaticamente che il 64% del fenomeno sia "causato" da X.

11. Regressione lineare

La formula fondamentale è:

Y=a+bX

Supponiamo di avere:

Y=40+3X

Dove:

a=40

b=3

Se:

X=10

allora:

Y=40+3(10)

Y=70

Interpretazione del coefficiente b

Il coefficiente:

b=3

significa che, nel modello, a un aumento di una unità di X corrisponde in media un aumento di 3 unità di Y.

12. Probabilità

Supponiamo di avere 100 persone:

60 occupate

40 non occupate.

La probabilità di selezionare casualmente una persona occupata è:

P(Occupato)=60100=0,60

oppure:

60%

13. Probabilità condizionata

Supponiamo di avere:

 OccupatiNon occupatiTotale
Laureati8020100
Non laureati4060100

Vogliamo sapere:

Qual è la probabilità di essere occupato sapendo che una persona è laureata?

Usiamo:

P(A∣B)=P(A∩B)P(B)

In questo caso:

P(Occupato∣Laureato)=80100=0,80

Quindi:

80%

14. Chi-quadrato χ2

Serve per analizzare l'associazione tra variabili categoriali.

Supponiamo di voler verificare la relazione tra:

genere

preferenza per un certo tipo di attività.

La formula è:

χ2=∑(O−E)2E

dove:

O = frequenza osservata

E = frequenza attesa.

Come si calcola la frequenza attesa?

In una tabella di contingenza:

E=Totale riga×Totale colonnaTotale generale

Questa formula è molto importante da ricordare.

15. Esempio di chi-quadrato

Supponiamo:

 A favoreContrariTotale
Gruppo A302050
Gruppo B203050
Totale5050100

Per la prima cella:

E=50×50100=25

Quindi abbiamo:

O=30

E=25

Il contributo della cella al chi-quadrato è:

(30−25)225=2525=1

Si fa lo stesso procedimento per tutte le celle e si sommano i risultati.

In questo esempio:

χ2=4

Il solo valore di χ2, però, non basta per decidere se l'associazione è statisticamente significativa: bisogna confrontarlo con una distribuzione del chi-quadrato oppure utilizzare il relativo p-value, tenendo conto dei gradi di libertà.

16. Intervallo di confidenza

Supponiamo di avere:

xˉ=50

s=10

N=100

Per un intervallo approssimato al 95%:

IC=xˉ±1,96sN

Calcoliamo:

100=10

1010=1

1,96×1=1,96

Quindi:

IC=50±1,96

Otteniamo:

48,04≤μ≤51,96

🧠 Come capire quale formula usare?

Questa è probabilmente la cosa più importante per l'esame.

Ti chiedono "qual è il valore medio?"

➡️ Media

xˉ=∑xiN

Ti chiedono "qual è il valore centrale?"

➡️ Mediana

Ti chiedono "qual è il valore più frequente?"

➡️ Moda

Ti chiedono "quanto sono dispersi i dati?"

➡️ Varianza / deviazione standard

Ti chiedono di confrontare la variabilità relativa?

➡️ Coefficiente di variazione

CV=sxˉ×100

Ti chiedono quanto un valore è lontano dalla media?

➡️ Z-score

z=x−xˉs

Ti chiedono se due variabili quantitative sono associate linearmente?

➡️ Correlazione di Pearson

r

Ti chiedono quanta variabilità è spiegata dal modello?

➡️ R2

Ti chiedono di prevedere/stimare Y sulla base di X?

➡️ Regressione

Y=a+bX

Hai due variabili categoriali e vuoi verificare la loro associazione?

➡️ Chi-quadrato

χ2=∑(O−E)2E

Ti chiedono la probabilità di A sapendo B?

➡️ Probabilità condizionata

P(A∣B)=P(A∩B)P(B)

🎯 Le 10 formule da sapere assolutamente

Se devi preparare un esame e vuoi partire dalle formule più importanti, memorizzerei queste:

xˉ=∑xiN

Me=valore centrale

R=xmax−xmin

s2=∑(xi−xˉ)2N−1

s=s2

CV=sxˉ×100

z=x−xˉs

r=Cov(X,Y)sXsY

Y=a+bX

χ2=∑(O−E)2E

Una cosa fondamentale

Non basta saper fare i calcoli. In Statistica Sociale, all'esame è spesso altrettanto importante saper interpretare il risultato.

Per esempio, non limitarti a scrivere:

r=0,72

ma scrivi:

“Tra le due variabili emerge una relazione lineare positiva piuttosto elevata. Il coefficiente di correlazione, tuttavia, non consente da solo di stabilire un rapporto causale.”

Questo tipo di interpretazione è ciò che trasforma un calcolo in una risposta da esame. Ipsum dolor sit amet