Exploratory Study of Association in Transaction Data Bases

Iodice D’Enza, Alfonso (2006) Exploratory Study of Association in Transaction Data Bases. [Tesi di dottorato] (Inedito)

Full text disponibile come:

[img]PDF - Richiede un editor Pdf del tipo GSview, Xpdf o Adobe Acrobat Reader
472Kb

Abstract

contesto di riferimento del presente lavoro di tesi è il data mining, processo di estrazione di informazioni utili, non ridondanti e incognite a priori, da data base. In particolare, lo strumento di data mining considerato è costituito dalle regole associative, orientate allo studio dell’associazione in data base di tipo transazionale Il record generico di un data base transazionale è una sequenza binaria di p elementi, ciascuno dei quali indica la presenza o meno di un attributo. Un esempio classico di data base transazionale è costituito dalla banca dati di un supermarket: ciascuna transazione riporta gli acquisti fatti da un singolo cliente in una sessione, gli attributi o items sono i prodotti in vendita nel supermarket considerato. Una regola associativa è composta da due parti, una antecedente (corpo) ed una conseguente (testa): entrambe le componenti possono essere rappresentate da singoli attributi (regole semplici) o da insiemi di attributi (regole complesse). L’informazione espressa da una regola è duplice: il supporto, che rappresenta la frequenza relativa con la quale gli item relativi a corpo e testa della regola sono presenti nelle transazioni osservate; la confidenza, che rappresenta la frequenza relativa delle transazioni contenenti gli item testa della regola, posto che queste contengano gli item costituenti il corpo della regola. Limiti all’efficacia di tale strumento sono legati alla grande quantità di dati da analizzare: il numero di regole estratte è spesso enorme, il che rende difficile l’identificazione di strutture interessanti che caratterizzano i dati. L’informazione triviale o ridondante nasconde e/o confonde le strutture di associazione che potrebbero risultare interessanti. Oggetto della proposta è l’analisi preliminare di tipo esplorativo della struttura associativa caratterizzante i dati, al fine dell’identificazione di coppie di attributi il cui grado di associazione sia interessante. In particolare si cercano coppie di item il cui supporto sia elevato rispetto ad un sottoinsieme di transazioni ma non così evidente se calcolato rispetto all’intero data set: questo per individuare comportamenti di nicchia, ma anche per evitare di fare riferimento ad associazioni banali. La strategia proposta prevede diverse fasi: in una prima fase viene impiegato un algoritmo di classificazione veloce per individuare gruppi omogenei di transazioni; una volta individuati i gruppi, gli item vengono selezionati attraverso opportuni criteri statistici relativi al confronto del grado di associazione di ciascuna coppia di item nei diversi gruppi e rispetto all’intero data set considerato. Nell’ultima fase si ricorre ad un approccio di tipo geometrico proprio delle tecniche di analisi multidimensionale dei dati (AMD) per l’assegnazione del ruolo di antecedente o conseguente agli item precedentemente selezionati, nonché per la visualizzazione della struttura delle relazioni che caratterizza gli item in ciascun gruppo. Il lavoro si chiude con esempi di applicazione della procedura che implementa la strategia proposta. Viene fatto riferimento a dati di tipo reale e a data set sintetici opportunamente generati.

Tipologia di documento:Tesi di dottorato
Parole chiave:Regole associative, Association Rules, Classificazione Automatica, Clustering, Analisi delle Corrispondenze, Correspondence Analysis
Settori scientifico-disciplinari MIUR:Area 13 Scienze economiche e statistiche > SECS-S/01 STATISTICA
Coordinatori della Scuola di dottorato:
Coordinatore del Corso di dottoratoe-mail (se nota)
Lauro, Carlo Natale
Tutor della Scuola di dottorato:
Tutor del Corso di dottoratoe-mail (se nota)
Palumbo, Francesco
Stato del full text:Accessibile
Data:2006
Numero di pagine:86
Istituzione:Università degli Studi di Napoli Federico II
Dipartimento o Struttura:Matematica e Statistica
Tipo di tesi:Dottorato
Stato dell'Eprint:Inedito
Denominazione del dottorato:Statistica
Ciclo di dottorato:XVIII
Numero di sistema:602
Depositato il:01 Agosto 2008
Ultima modifica:04 Febbraio 2009 09:38

Solo per gli Amministratori dell'archivio: edita il record