INFERENZA E MODELLI STATISTICI PER L'ECONOMIA

Anno accademico 2026/2027 - Docente: CINZIA DI NUZZO

Risultati di apprendimento attesi

Conoscenza e comprensione

L'insegnamento si propone di fornire agli studenti conoscenze teoriche e metodologiche relative ai principali strumenti dell'inferenza statistica e dell'analisi statistica multivariata, con particolare riferimento alla loro applicazione a problemi economici e socio-economici.

Al termine del corso, lo studente conoscerà e comprenderà:

  • i principi del campionamento e il concetto di distribuzione campionaria;
  • i principali metodi di stima puntuale e intervallare;
  • la logica della verifica delle ipotesi statistiche e i principali test parametrici;
  • il modello di regressione lineare semplice e multipla;
  • i principi dell'inferenza nel modello di regressione;
  • i principali strumenti diagnostici per la valutazione di un modello statistico;
  • i principi della riduzione dimensionale mediante Analisi delle Componenti Principali;
  • i principali metodi di classificazione non supervisionata, con particolare riferimento alla cluster analysis gerarchica e al metodo k-means;
  • i principi fondamentali dell'analisi statistica dei dati mediante il software R.

Capacità di applicare conoscenza e comprensione

Al termine dell'insegnamento lo studente sarà in grado di selezionare e applicare gli strumenti statistici più appropriati per analizzare problemi economici e socio-economici.

In particolare, sarà in grado di:

  • costruire e interpretare stime puntuali e intervalli di confidenza;
  • formulare e verificare ipotesi statistiche;
  • interpretare correttamente il significato di livello di significatività, p-value, errori di I e II specie e potenza;
  • stimare e interpretare modelli di regressione lineare semplice e multipla;
  • valutare la significatività dei parametri di un modello di regressione;
  • utilizzare strumenti diagnostici per valutarne l'adeguatezza;
  • utilizzare la PCA per sintetizzare sistemi complessi di variabili economiche;
  • applicare metodi di clustering e interpretare i gruppi ottenuti;
  • svolgere analisi empiriche mediante il software R;
  • interpretare criticamente gli output prodotti dal software.

Autonomia di giudizio

Lo studente sarà in grado di individuare autonomamente le metodologie statistiche più appropriate rispetto alla natura del problema e dei dati disponibili, valutando criticamente le assunzioni dei modelli, la qualità dei risultati ottenuti e i limiti delle analisi svolte.

L'autonomia di giudizio sarà sviluppata anche attraverso la realizzazione di un progetto empirico su dati reali o simulati, nel quale lo studente dovrà selezionare le tecniche statistiche da applicare e motivare le proprie scelte metodologiche.

Abilità comunicative

Lo studente sarà in grado di utilizzare correttamente il linguaggio statistico e di comunicare i risultati di un'analisi quantitativa a interlocutori specialisti e non specialisti.

La presentazione del progetto finale contribuirà allo sviluppo della capacità di descrivere il problema analizzato, illustrare le metodologie utilizzate, interpretare risultati numerici e grafici e discutere criticamente le conclusioni ottenute.

Capacità di apprendimento

Lo studente acquisirà gli strumenti concettuali e operativi necessari per approfondire autonomamente ulteriori metodologie di inferenza statistica, modellistica statistica e analisi multivariata e per utilizzare tali strumenti nell'ambito di successivi insegnamenti, attività di ricerca o applicazioni professionali.

Modalità di svolgimento dell'insegnamento

L'insegnamento prevede lezioni frontali dedicate alla presentazione e alla discussione dei principali concetti teorici e metodologici, integrate da esercitazioni e applicazioni empiriche.

Durante il corso saranno analizzati esempi relativi a dati economici e socio-economici e saranno svolte esercitazioni mediante il software R, con particolare riferimento ai test statistici, ai modelli di regressione, all'Analisi delle Componenti Principali e alla Cluster Analysis.

Una parte dell'attività didattica sarà dedicata all'impostazione e alla discussione di un progetto empirico, individuale o di gruppo, nel quale gli studenti applicheranno le metodologie studiate a un insieme di dati, motivando le scelte effettuate e interpretando criticamente i risultati.

Le lezioni frontali sono principalmente finalizzate all'acquisizione delle conoscenze teoriche e metodologiche; le esercitazioni, le applicazioni con R e il progetto favoriscono lo sviluppo della capacità di applicare le conoscenze, dell'autonomia di giudizio e delle abilità comunicative.

Qualora l'insegnamento venisse impartito in modalità mista o a distanza potranno essere introdotte le necessarie variazioni rispetto a quanto sopra dichiarato, al fine di rispettare il programma previsto e riportato nel presente syllabus.

Prerequisiti richiesti

Sono importanti conoscenze di base di statistica descrittiva e matematica.

In particolare, lo studente dovrebbe conoscere:

  1. principali misure di posizione, variabilità e associazione;
  2. rappresentazioni grafiche dei dati;
  3. concetti elementari di probabilità e variabile casuale;
  4. principali distribuzioni di probabilità, con particolare riferimento alla distribuzione Normale;
  5. elementi di algebra matriciale;
  6. nozioni di base di analisi matematica.

Non è richiesta una conoscenza preliminare del software R.

Frequenza lezioni

La frequenza non è obbligatoria, ma è fortemente consigliata. La partecipazione alle lezioni, alle esercitazioni e alle attività svolte mediante R favorisce la comprensione degli aspetti metodologici e applicativi della disciplina e facilita la realizzazione del progetto previsto ai fini della valutazione finale.

Contenuti del corso

Campionamento e distribuzioni campionarie

Popolazione e campione. Parametri e statistiche. Campionamento casuale semplice. Distribuzione campionaria. Distribuzione della media campionaria e della proporzione campionaria. Errore standard. Teorema del Limite Centrale e sue implicazioni per l'inferenza.

Stima puntuale

Stimatore e stima. Proprietà degli stimatori. Correttezza, consistenza, efficienza ed errore quadratico medio. Stima dei principali parametri della popolazione. Introduzione al principio di massima verosimiglianza.

Stima per intervallo

Intervalli di confidenza. Livello di confidenza e margine di errore. Intervallo di confidenza per la media con varianza nota e ignota. Distribuzione t di Student. Intervallo di confidenza per una proporzione e per la varianza. Determinazione della numerosità campionaria.

Teoria dei test statistici

Ipotesi nulla e ipotesi alternativa. Statistica test. Regione critica. Livello di significatività. Test unilaterali e bilaterali. Errori di I e II specie. Potenza di un test. p-value. Relazione tra test di ipotesi e intervalli di confidenza.

Test per medie, proporzioni e varianze

Test sulla media. Test sulla proporzione. Test sulla varianza. Confronto tra due medie. Confronto tra due proporzioni. Test per dati appaiati. Applicazione e interpretazione mediante R.

Modello di regressione lineare semplice

Specificazione del modello. Retta di regressione. Metodo dei minimi quadrati. Interpretazione dei coefficienti. Valori stimati e residui. Decomposizione della variabilità. Coefficiente di determinazione R^2.

Inferenza nel modello di regressione lineare

Assunzioni del modello lineare. Distribuzione degli stimatori. Test sui coefficienti di regressione. Intervalli di confidenza. Test t e test F. Intervalli di previsione. Analisi dei residui e diagnostica del modello.

Modello di regressione multipla

Specificazione del modello di regressione multipla. Interpretazione dei coefficienti di regressione parziale. Stima mediante minimi quadrati. Bontà di adattamento. R^2 e R^2 corretto. Test sui singoli coefficienti e test globale del modello. Variabili qualitative e dummy. Cenni alla multicollinearità. Diagnostica e selezione del modello.

Analisi delle Componenti Principali

Dati multivariati. Matrice dei dati. Matrice di varianza-covarianza e matrice di correlazione. Standardizzazione. Riduzione dimensionale. Autovalori e autovettori. Componenti principali. Scores e loadings. Varianza spiegata. Scelta del numero di componenti. Scree plot. Interpretazione delle componenti. Biplot. Applicazioni economiche mediante R.

Cluster Analysis

Obiettivi della classificazione non supervisionata. Misure di distanza e dissimilarità. Standardizzazione delle variabili. Metodi gerarchici. Metodi di linkage. Dendrogramma. Metodo k-means. Variabilità within e between. Scelta del numero di cluster. Elbow method e silhouette. Interpretazione e profilazione dei gruppi. Applicazioni mediante R.

Software R per l'analisi statistica

Importazione e organizzazione dei dati. Analisi esplorativa. Implementazione di procedure inferenziali. Stima e diagnostica di modelli di regressione. PCA e cluster analysis. Rappresentazioni grafiche. Interpretazione degli output statistici.

Testi di riferimento

1) Simone Borra , Agostino Di Ciaccio. "Statistica - Metodologie per le scienze economiche e sociali".  IV edizione. Mc Graw Hill. 

2) Dispense e altro materiale forniti dal docente.

Programmazione del corso

 ArgomentiRiferimenti testi
1Campionamento e inferenza statisticaBorra-Di Ciaccio
2Distribuzioni campionarieBorra-Di Ciaccio
3Stima puntualeBorra-Di Ciaccio
4Stima per intervalloBorra-Di Ciaccio
5Intervalli di confidenza per proporzioni e varianzeBorra-Di Ciaccio
6Teoria dei test statisticiBorra-Di Ciaccio
7p-value, errori e potenzaBorra-Di Ciaccio
8Test per medie, proporzioni e varianzeBorra-Di Ciaccio
9Regressione lineare semplice: modello e stimaBorra-Di Ciaccio
10Regressione lineare semplice: bontà di adattamentoBorra-Di Ciaccio
11Inferenza nella regressione lineareBorra-Di Ciaccio
12Previsione e diagnostica della regressioneBorra-Di Ciaccio
13Regressione lineare multiplaBorra-Di Ciaccio
14Inferenza e valutazione del modello multiploBorra-Di Ciaccio
15Introduzione alla PCADispense
16Costruzione delle componenti principaliDispense
17Scelta e interpretazione delle componentiDispense
18Cluster Analysis gerarchicaDispense
19k-means e scelta del numero di clusterDispense
20Analisi integrata dei dati con RDispense
21Progetto empirico e discussione metodologicaDispense

Verifica dell'apprendimento

Modalità di verifica dell'apprendimento

La verifica dell'apprendimento si articola in:

1. Progetto empirico con presentazione.
Lo studente, individualmente o in gruppo secondo le indicazioni fornite dal docente, dovrà realizzare un'analisi statistica su dati reali o simulati utilizzando il software R. Il progetto dovrà comprendere la descrizione del problema e dei dati, la scelta motivata delle metodologie statistiche, l'analisi dei risultati e una loro interpretazione critica. Il lavoro dovrà essere consegnato secondo le modalità e le scadenze comunicate dal docente e successivamente presentato e discusso.

2. Prova orale individuale.
La prova orale riguarda gli argomenti teorici e metodologici trattati durante l'insegnamento. Durante il colloquio potrà essere richiesto allo studente di definire e discutere concetti statistici, illustrare metodi e relative assunzioni, interpretare formule, risultati numerici e output statistici, nonché mettere in relazione diversi argomenti del corso.

La valutazione complessiva terrà conto della conoscenza e comprensione dei contenuti, della correttezza metodologica, della capacità di applicare i metodi statistici, della capacità di interpretare criticamente i risultati, della proprietà del linguaggio statistico, della capacità di effettuare collegamenti tra gli argomenti e dell'autonomia dimostrata nello svolgimento del progetto.

La verifica dell'apprendimento potrà essere effettuata anche per via telematica, qualora le condizioni lo dovessero richiedere.

Esempi di domande e/o esercizi frequenti

  1. Che cos'è una distribuzione campionaria e perché è fondamentale per l'inferenza statistica? Illustrare il caso della media campionaria.
  2. Enunciare e spiegare il Teorema del Limite Centrale e discuterne il ruolo nell'inferenza statistica.
  3. Che differenza esiste tra parametro, stimatore e stima? Quali proprietà sono desiderabili per uno stimatore?
  4. Che cosa rappresenta un intervallo di confidenza? Spiegare correttamente il significato di un intervallo di confidenza al 95%.
  5. Descrivere la logica di un test statistico, specificando il significato di ipotesi nulla, ipotesi alternativa, livello di significatività e regione critica.
  6. Che cosa rappresenta il p-value? Quali errori di interpretazione devono essere evitati?
  7. Definire gli errori di I e II specie e la potenza di un test e discutere le relazioni esistenti tra tali quantità.
  8. Illustrare il modello di regressione lineare semplice, le sue assunzioni e l'interpretazione dei coefficienti.
  9. Come vengono stimati i coefficienti della regressione lineare con il metodo dei minimi quadrati? Qual è il significato dei residui?
  10. Che cosa misura il coefficiente di determinazione R^2? Perché nel modello multiplo può essere utile considerare anche l'R^2 corretto?
  11. Come si effettua l'inferenza sui coefficienti di un modello di regressione? Spiegare il significato del test t e del test F.
  12. Quali problemi possono essere individuati attraverso l'analisi dei residui di un modello di regressione?
  13. Spiegare il principio dell'Analisi delle Componenti Principali. Come vengono costruite le componenti e quale ruolo hanno autovalori e autovettori?
  14. Qual è la differenza tra scores e loadings nella PCA? Come si interpreta un biplot?


ENGLISH VERSION