Back to the 2025 paper

Module 2: Data Mining and Association Rule Mining

20257m

Explain in detail the concept of Data Reduction and Data Discretization. Explain the major steps involved in Data Preprocessing.

Worked SolutionAI Assisted

Data Reduction, Data Discretization & Preprocessing Steps

Data Reduction

Obtains a reduced representation of a dataset that is much smaller in volume, yet closely maintains the integrity/analytical value of the original data — so mining on the reduced data is far more efficient and produces (nearly) the same results.

Techniques:

  • Dimensionality reduction — reduces the number of attributes (PCA, attribute subset selection/wrapper methods).
  • Numerosity reduction — replaces data with a smaller representation: parametric (regression models) or non-parametric (histograms, clustering, sampling, data cube aggregation).
  • Data compression — encoding transformations (wavelet transforms, lossy/lossless compression) to shrink storage size.
Original Data (large) ──[reduction techniques]──▶ Reduced Data (small, representative)

Data Discretization

Converts continuous attribute values into a small number of interval labels or categories, reducing the number of distinct values and making the data suitable for algorithms that work with categorical data.

Methods:

  • Binning — equal-width or equal-frequency bins.
  • Histogram analysis — partitioning based on data distribution.
  • Entropy-based discretization — splits chosen to maximize class purity (supervised).
  • Concept hierarchy generation — organizes discretized values into multi-level hierarchies (e.g., Age → {Young, Middle-aged, Senior} → further grouped).
Continuous: 18, 22, 25, 40, 45, 60, 65
Discretized: [18-30)="Young", [30-55)="Middle-aged", [55-70)="Senior"

Major Steps in Data Preprocessing

Raw Data
   │
   ▼
1. Data Cleaning  ────▶ handle missing values, noise, outliers, inconsistencies
   │
   ▼
2. Data Integration ──▶ merge multiple heterogeneous sources into one dataset
   │
   ▼
3. Data Reduction ────▶ shrink volume via dimensionality/numerosity reduction
   │
   ▼
4. Data Transformation/Discretization ──▶ normalize, aggregate, bucket into
   │                                        mining-ready form
   ▼
Clean, Integrated, Reduced, Transformed Data → ready for Mining
  1. Data Cleaning — fills missing values, smooths noisy data, identifies/removes outliers, resolves inconsistencies.
  2. Data Integration — combines data from multiple databases/files/sources, resolving entity and schema conflicts.
  3. Data Reduction — reduces data volume while preserving analytical results (as described above).
  4. Data Transformation (including Discretization) — normalizes, aggregates, and converts continuous attributes into discrete categories for algorithms that need them.

These four steps together turn messy, real-world raw data into a clean dataset ready for accurate and efficient mining.

Similar questions