Back to the 2025 paper

Module 2: Data Mining and Association Rule Mining

20257m

What is Data Mining? How does it differ from Data Warehousing? List and briefly describe any three functionalities of Data Mining.

Worked SolutionAI Assisted

Data Mining vs Data Warehousing + 3 Functionalities

What is Data Mining?

Data mining is the process of discovering interesting, previously unknown, and potentially useful patterns and knowledge from large volumes of data using statistical, machine learning, and database techniques.

Data Mining vs Data Warehousing

Aspect Data Warehousing Data Mining
Purpose Store integrated, historical data for querying/reporting Discover hidden patterns/knowledge from that data
Process ETL (extract, transform, load) + storage in fact/dimension tables Applies algorithms (classification, clustering, association)
Output Organized, queryable repository Patterns, rules, predictive models
User interaction User explores via OLAP (roll-up, drill-down, slice, dice) System (semi-)automatically extracts patterns
Relationship Provides clean, integrated data as input to mining Consumes warehouse data to produce insight
Raw Sources ──ETL──▶ Data Warehouse ──mining algorithms──▶ Data Mining (patterns/knowledge)

In short: a data warehouse is the organized store; data mining is the analysis engine that runs on top of it (though mining can also run on data outside a warehouse).

Three Functionalities of Data Mining

  1. Classification — assigns data objects to predefined categories/classes based on a model learned from labeled training data (e.g., classifying an email as spam/not spam using decision trees, naïve Bayes, or neural networks).

  2. Clustering — groups data objects into clusters such that objects within a cluster are similar to each other, and dissimilar to objects in other clusters, without using predefined labels (e.g., segmenting customers by purchase behavior using k-means).

  3. Association Rule Mining — discovers interesting relationships (rules) between items that co-occur frequently in transactional data (e.g., {Bread, Butter} ⇒ {Milk} [support=20%, confidence=75%] in market-basket analysis).

(Other functionalities include: characterization, discrimination, prediction/regression, outlier analysis, and evolution/trend analysis.)

Similar questions