Iodice D’Enza, Alfonso (2006) Exploratory Study of Association in Transaction Data Bases. [Tesi di dottorato] (Unpublished)

[img] PDF
Tesi_dottorato_Iodice.pdf

Download (483kB)
Item Type: Tesi di dottorato
Uncontrolled Keywords: Regole associative, Association Rules, Classificazione Automatica, Clustering, Analisi delle Corrispondenze, Correspondence Analysis
Date Deposited: 01 Aug 2008
Last Modified: 30 Apr 2014 19:23
URI: http://www.fedoa.unina.it/id/eprint/602

Abstract

contesto di riferimento del presente lavoro di tesi è il data mining, processo di estrazione di informazioni utili, non ridondanti e incognite a priori, da data base. In particolare, lo strumento di data mining considerato è costituito dalle regole associative, orientate allo studio dell’associazione in data base di tipo transazionale Il record generico di un data base transazionale è una sequenza binaria di p elementi, ciascuno dei quali indica la presenza o meno di un attributo. Un esempio classico di data base transazionale è costituito dalla banca dati di un supermarket: ciascuna transazione riporta gli acquisti fatti da un singolo cliente in una sessione, gli attributi o items sono i prodotti in vendita nel supermarket considerato. Una regola associativa è composta da due parti, una antecedente (corpo) ed una conseguente (testa): entrambe le componenti possono essere rappresentate da singoli attributi (regole semplici) o da insiemi di attributi (regole complesse). L’informazione espressa da una regola è duplice: il supporto, che rappresenta la frequenza relativa con la quale gli item relativi a corpo e testa della regola sono presenti nelle transazioni osservate; la confidenza, che rappresenta la frequenza relativa delle transazioni contenenti gli item testa della regola, posto che queste contengano gli item costituenti il corpo della regola. Limiti all’efficacia di tale strumento sono legati alla grande quantità di dati da analizzare: il numero di regole estratte è spesso enorme, il che rende difficile l’identificazione di strutture interessanti che caratterizzano i dati. L’informazione triviale o ridondante nasconde e/o confonde le strutture di associazione che potrebbero risultare interessanti. Oggetto della proposta è l’analisi preliminare di tipo esplorativo della struttura associativa caratterizzante i dati, al fine dell’identificazione di coppie di attributi il cui grado di associazione sia interessante. In particolare si cercano coppie di item il cui supporto sia elevato rispetto ad un sottoinsieme di transazioni ma non così evidente se calcolato rispetto all’intero data set: questo per individuare comportamenti di nicchia, ma anche per evitare di fare riferimento ad associazioni banali. La strategia proposta prevede diverse fasi: in una prima fase viene impiegato un algoritmo di classificazione veloce per individuare gruppi omogenei di transazioni; una volta individuati i gruppi, gli item vengono selezionati attraverso opportuni criteri statistici relativi al confronto del grado di associazione di ciascuna coppia di item nei diversi gruppi e rispetto all’intero data set considerato. Nell’ultima fase si ricorre ad un approccio di tipo geometrico proprio delle tecniche di analisi multidimensionale dei dati (AMD) per l’assegnazione del ruolo di antecedente o conseguente agli item precedentemente selezionati, nonché per la visualizzazione della struttura delle relazioni che caratterizza gli item in ciascun gruppo. Il lavoro si chiude con esempi di applicazione della procedura che implementa la strategia proposta. Viene fatto riferimento a dati di tipo reale e a data set sintetici opportunamente generati.

Actions (login required)

View Item View Item