INFERENZA E MODELLI STATISTICI PER L'ECONOMIA
Anno accademico 2026/2027 - Docente: CINZIA DI NUZZORisultati di apprendimento attesi
Conoscenza e comprensione
L'insegnamento si propone di fornire agli studenti conoscenze teoriche e metodologiche relative ai principali strumenti dell'inferenza statistica e dell'analisi statistica multivariata, con particolare riferimento alla loro applicazione a problemi economici e socio-economici.
Al termine del corso, lo studente conoscerà e comprenderà:
- i principi del campionamento e il concetto di distribuzione campionaria;
- i principali metodi di stima puntuale e intervallare;
- la logica della verifica delle ipotesi statistiche e i principali test parametrici;
- il modello di regressione lineare semplice e multipla;
- i principi dell'inferenza nel modello di regressione;
- i principali strumenti diagnostici per la valutazione di un modello statistico;
- i principi della riduzione dimensionale mediante Analisi delle Componenti Principali;
- i principali metodi di classificazione non supervisionata, con particolare riferimento alla cluster analysis gerarchica e al metodo k-means;
- i principi fondamentali dell'analisi statistica dei dati mediante il software R.
Capacità di applicare conoscenza e comprensione
Al termine dell'insegnamento lo studente sarà in grado di selezionare e applicare gli strumenti statistici più appropriati per analizzare problemi economici e socio-economici.
In particolare, sarà in grado di:
- costruire e interpretare stime puntuali e intervalli di confidenza;
- formulare e verificare ipotesi statistiche;
- interpretare correttamente il significato di livello di significatività, p-value, errori di I e II specie e potenza;
- stimare e interpretare modelli di regressione lineare semplice e multipla;
- valutare la significatività dei parametri di un modello di regressione;
- utilizzare strumenti diagnostici per valutarne l'adeguatezza;
- utilizzare la PCA per sintetizzare sistemi complessi di variabili economiche;
- applicare metodi di clustering e interpretare i gruppi ottenuti;
- svolgere analisi empiriche mediante il software R;
- interpretare criticamente gli output prodotti dal software.
Autonomia di giudizio
Lo studente sarà in grado di individuare autonomamente le metodologie statistiche più appropriate rispetto alla natura del problema e dei dati disponibili, valutando criticamente le assunzioni dei modelli, la qualità dei risultati ottenuti e i limiti delle analisi svolte.
L'autonomia di giudizio sarà sviluppata anche attraverso la realizzazione di un progetto empirico su dati reali o simulati, nel quale lo studente dovrà selezionare le tecniche statistiche da applicare e motivare le proprie scelte metodologiche.
Abilità comunicative
Lo studente sarà in grado di utilizzare correttamente il linguaggio statistico e di comunicare i risultati di un'analisi quantitativa a interlocutori specialisti e non specialisti.
La presentazione del progetto finale contribuirà allo sviluppo della capacità di descrivere il problema analizzato, illustrare le metodologie utilizzate, interpretare risultati numerici e grafici e discutere criticamente le conclusioni ottenute.
Capacità di apprendimento
Lo studente acquisirà gli strumenti concettuali e operativi necessari per approfondire autonomamente ulteriori metodologie di inferenza statistica, modellistica statistica e analisi multivariata e per utilizzare tali strumenti nell'ambito di successivi insegnamenti, attività di ricerca o applicazioni professionali.
Modalità di svolgimento dell'insegnamento
L'insegnamento prevede lezioni frontali dedicate alla presentazione e alla discussione dei principali concetti teorici e metodologici, integrate da esercitazioni e applicazioni empiriche.
Durante il corso saranno analizzati esempi relativi a dati economici e socio-economici e saranno svolte esercitazioni mediante il software R, con particolare riferimento ai test statistici, ai modelli di regressione, all'Analisi delle Componenti Principali e alla Cluster Analysis.
Una parte dell'attività didattica sarà dedicata all'impostazione e alla discussione di un progetto empirico, individuale o di gruppo, nel quale gli studenti applicheranno le metodologie studiate a un insieme di dati, motivando le scelte effettuate e interpretando criticamente i risultati.
Le lezioni frontali sono principalmente finalizzate all'acquisizione delle conoscenze teoriche e metodologiche; le esercitazioni, le applicazioni con R e il progetto favoriscono lo sviluppo della capacità di applicare le conoscenze, dell'autonomia di giudizio e delle abilità comunicative.
Qualora l'insegnamento venisse impartito in modalità mista o a distanza potranno essere introdotte le necessarie variazioni rispetto a quanto sopra dichiarato, al fine di rispettare il programma previsto e riportato nel presente syllabus.
Prerequisiti richiesti
Sono importanti conoscenze di base di statistica descrittiva e matematica.
In particolare, lo studente dovrebbe conoscere:
- principali misure di posizione, variabilità e associazione;
- rappresentazioni grafiche dei dati;
- concetti elementari di probabilità e variabile casuale;
- principali distribuzioni di probabilità, con particolare riferimento alla distribuzione Normale;
- elementi di algebra matriciale;
- nozioni di base di analisi matematica.
Non è richiesta una conoscenza preliminare del software R.
Frequenza lezioni
La frequenza non è obbligatoria, ma è fortemente consigliata. La partecipazione alle lezioni, alle esercitazioni e alle attività svolte mediante R favorisce la comprensione degli aspetti metodologici e applicativi della disciplina e facilita la realizzazione del progetto previsto ai fini della valutazione finale.
Contenuti del corso
Campionamento e distribuzioni campionarie
Popolazione e campione. Parametri e statistiche. Campionamento casuale semplice. Distribuzione campionaria. Distribuzione della media campionaria e della proporzione campionaria. Errore standard. Teorema del Limite Centrale e sue implicazioni per l'inferenza.
Stima puntuale
Stimatore e stima. Proprietà degli stimatori. Correttezza, consistenza, efficienza ed errore quadratico medio. Stima dei principali parametri della popolazione. Introduzione al principio di massima verosimiglianza.
Stima per intervallo
Intervalli di confidenza. Livello di confidenza e margine di errore. Intervallo di confidenza per la media con varianza nota e ignota. Distribuzione t di Student. Intervallo di confidenza per una proporzione e per la varianza. Determinazione della numerosità campionaria.
Teoria dei test statistici
Ipotesi nulla e ipotesi alternativa. Statistica test. Regione critica. Livello di significatività. Test unilaterali e bilaterali. Errori di I e II specie. Potenza di un test. p-value. Relazione tra test di ipotesi e intervalli di confidenza.
Test per medie, proporzioni e varianze
Test sulla media. Test sulla proporzione. Test sulla varianza. Confronto tra due medie. Confronto tra due proporzioni. Test per dati appaiati. Applicazione e interpretazione mediante R.
Modello di regressione lineare semplice
Specificazione del modello. Retta di regressione. Metodo dei minimi quadrati. Interpretazione dei coefficienti. Valori stimati e residui. Decomposizione della variabilità. Coefficiente di determinazione R^2.
Inferenza nel modello di regressione lineare
Assunzioni del modello lineare. Distribuzione degli stimatori. Test sui coefficienti di regressione. Intervalli di confidenza. Test t e test F. Intervalli di previsione. Analisi dei residui e diagnostica del modello.
Modello di regressione multipla
Specificazione del modello di regressione multipla. Interpretazione dei coefficienti di regressione parziale. Stima mediante minimi quadrati. Bontà di adattamento. R^2 e R^2 corretto. Test sui singoli coefficienti e test globale del modello. Variabili qualitative e dummy. Cenni alla multicollinearità. Diagnostica e selezione del modello.
Analisi delle Componenti Principali
Dati multivariati. Matrice dei dati. Matrice di varianza-covarianza e matrice di correlazione. Standardizzazione. Riduzione dimensionale. Autovalori e autovettori. Componenti principali. Scores e loadings. Varianza spiegata. Scelta del numero di componenti. Scree plot. Interpretazione delle componenti. Biplot. Applicazioni economiche mediante R.
Cluster Analysis
Obiettivi della classificazione non supervisionata. Misure di distanza e dissimilarità. Standardizzazione delle variabili. Metodi gerarchici. Metodi di linkage. Dendrogramma. Metodo k-means. Variabilità within e between. Scelta del numero di cluster. Elbow method e silhouette. Interpretazione e profilazione dei gruppi. Applicazioni mediante R.
Software R per l'analisi statistica
Importazione e organizzazione dei dati. Analisi esplorativa. Implementazione di procedure inferenziali. Stima e diagnostica di modelli di regressione. PCA e cluster analysis. Rappresentazioni grafiche. Interpretazione degli output statistici.
Testi di riferimento
2) Dispense e altro materiale forniti dal docente.
Programmazione del corso
| Argomenti | Riferimenti testi | |
|---|---|---|
| 1 | Campionamento e inferenza statistica | Borra-Di Ciaccio |
| 2 | Distribuzioni campionarie | Borra-Di Ciaccio |
| 3 | Stima puntuale | Borra-Di Ciaccio |
| 4 | Stima per intervallo | Borra-Di Ciaccio |
| 5 | Intervalli di confidenza per proporzioni e varianze | Borra-Di Ciaccio |
| 6 | Teoria dei test statistici | Borra-Di Ciaccio |
| 7 | p-value, errori e potenza | Borra-Di Ciaccio |
| 8 | Test per medie, proporzioni e varianze | Borra-Di Ciaccio |
| 9 | Regressione lineare semplice: modello e stima | Borra-Di Ciaccio |
| 10 | Regressione lineare semplice: bontà di adattamento | Borra-Di Ciaccio |
| 11 | Inferenza nella regressione lineare | Borra-Di Ciaccio |
| 12 | Previsione e diagnostica della regressione | Borra-Di Ciaccio |
| 13 | Regressione lineare multipla | Borra-Di Ciaccio |
| 14 | Inferenza e valutazione del modello multiplo | Borra-Di Ciaccio |
| 15 | Introduzione alla PCA | Dispense |
| 16 | Costruzione delle componenti principali | Dispense |
| 17 | Scelta e interpretazione delle componenti | Dispense |
| 18 | Cluster Analysis gerarchica | Dispense |
| 19 | k-means e scelta del numero di cluster | Dispense |
| 20 | Analisi integrata dei dati con R | Dispense |
| 21 | Progetto empirico e discussione metodologica | Dispense |
Verifica dell'apprendimento
Modalità di verifica dell'apprendimento
La verifica dell'apprendimento si articola in:
1. Progetto empirico con presentazione.
Lo studente, individualmente o in gruppo secondo le indicazioni fornite dal
docente, dovrà realizzare un'analisi statistica su dati reali o simulati
utilizzando il software R. Il progetto dovrà comprendere la descrizione del
problema e dei dati, la scelta motivata delle metodologie statistiche,
l'analisi dei risultati e una loro interpretazione critica. Il lavoro dovrà
essere consegnato secondo le modalità e le scadenze comunicate dal docente e
successivamente presentato e discusso.
2. Prova orale individuale.
La prova orale riguarda gli argomenti teorici e metodologici trattati durante
l'insegnamento. Durante il colloquio potrà essere richiesto allo studente di
definire e discutere concetti statistici, illustrare metodi e relative
assunzioni, interpretare formule, risultati numerici e output statistici,
nonché mettere in relazione diversi argomenti del corso.
La valutazione complessiva terrà conto della conoscenza e comprensione dei contenuti, della correttezza metodologica, della capacità di applicare i metodi statistici, della capacità di interpretare criticamente i risultati, della proprietà del linguaggio statistico, della capacità di effettuare collegamenti tra gli argomenti e dell'autonomia dimostrata nello svolgimento del progetto.
La verifica dell'apprendimento potrà essere effettuata anche per via telematica, qualora le condizioni lo dovessero richiedere.
Esempi di domande e/o esercizi frequenti
- Che cos'è una distribuzione campionaria e perché è fondamentale per l'inferenza statistica? Illustrare il caso della media campionaria.
- Enunciare e spiegare il Teorema del Limite Centrale e discuterne il ruolo nell'inferenza statistica.
- Che differenza esiste tra parametro, stimatore e stima? Quali proprietà sono desiderabili per uno stimatore?
- Che cosa rappresenta un intervallo di confidenza? Spiegare correttamente il significato di un intervallo di confidenza al 95%.
- Descrivere la logica di un test statistico, specificando il significato di ipotesi nulla, ipotesi alternativa, livello di significatività e regione critica.
- Che cosa rappresenta il p-value? Quali errori di interpretazione devono essere evitati?
- Definire gli errori di I e II specie e la potenza di un test e discutere le relazioni esistenti tra tali quantità.
- Illustrare il modello di regressione lineare semplice, le sue assunzioni e l'interpretazione dei coefficienti.
- Come vengono stimati i coefficienti della regressione lineare con il metodo dei minimi quadrati? Qual è il significato dei residui?
- Che cosa misura il coefficiente di determinazione R^2? Perché nel modello multiplo può essere utile considerare anche l'R^2 corretto?
- Come si effettua l'inferenza sui coefficienti di un modello di regressione? Spiegare il significato del test t e del test F.
- Quali problemi possono essere individuati attraverso l'analisi dei residui di un modello di regressione?
- Spiegare il principio dell'Analisi delle Componenti Principali. Come vengono costruite le componenti e quale ruolo hanno autovalori e autovettori?
- Qual è la differenza tra scores e loadings nella PCA? Come si interpreta un biplot?