Data preprocessing is the process of converting incomplete, noisy, inconsistent and raw data into a clean and suitable form before applying data-mining algorithms.
Why Data Preprocessing is Required
Real-world data is often incomplete.
Different sources may use different formats.
Records may contain errors and duplicate values.
Large data may increase processing time.
Irrelevant attributes can reduce model accuracy.
Mining results depend strongly on data quality.
Main Steps
Raw Data
|
v
Data Cleaning
|
v
Data Integration
|
v
Data Transformation
|
v
Data Reduction
|
v
Discretization
|
v
Prepared Data for Mining
Objectives
Improve data accuracy and consistency.
Reduce the size of data.
Improve algorithm performance.
Produce meaningful and reliable patterns.
Conclusion: Data preprocessing is an essential step because poor-quality input generally produces poor-quality mining results.
2. Data Quality Problems 14 Marks
Incomplete Data
Some attribute values or complete records may be missing.
Noisy Data
Data may contain random errors, abnormal values or measurement errors.
Inconsistent Data
The same fact may be represented differently in different sources.
Example: A gender value may be stored as M, Male, 1 or Man in different databases.
Duplicate Data
The same entity may appear multiple times because of repeated entry or source integration.
Outdated Data
Old values may no longer represent the current real-world situation.
Data Quality Dimensions
Accuracy
Completeness
Consistency
Timeliness
Validity
Uniqueness
3. Data Cleaning 14 Marks
Data cleaning detects and corrects missing, noisy, inconsistent, invalid and duplicate data.
The value range is divided into intervals of equal width.
Equal-Frequency Partitioning
Each interval contains approximately the same number of data values.
Histogram Analysis
Uses the distribution of values to define intervals.
Entropy-Based Discretization
Uses class information and information gain to choose split points.
Cluster-Based Discretization
Uses clusters to create natural value groups.
Advantages
Simplifies data.
Improves interpretability.
Supports concept hierarchy.
Can reduce noise.
13. Concept Hierarchy Generation 14 Marks
A concept hierarchy organizes low-level data values into higher levels of abstraction.
Example Hierarchies
Street → City → State → Country
Day → Month → Quarter → Year
Product → Category → Department
Generation Methods
Explicitly specified by users or experts.
Specified using schema relationships.
Automatically generated using the number of distinct values.
Generated through discretization of numerical attributes.
Uses
Data generalization
OLAP roll-up
Multilevel mining
Improved report readability
14. Basics of Data Mining 14 Marks
Data mining is the process of discovering valid, useful, understandable and previously unknown patterns from large datasets.
Major Functionalities
Concept description
Association analysis
Classification
Prediction
Clustering
Outlier analysis
Evolution and trend analysis
Data Mining System Architecture
Database / Data Warehouse
|
Database Server
|
Data Mining Engine
|
Pattern Evaluation
|
User Interface
|
Knowledge and Results
Pattern Evaluation
Interestingness measures are used to identify patterns that are useful, novel and understandable.
15. Data Mining Techniques 14 Marks
Classification
Assigns data objects to predefined classes.
Classifying an email as spam or not spam.
Clustering
Groups similar objects without predefined class labels.
Association Rule Mining
Discovers relationships among items occurring together.
Customers who buy bread may also buy butter.
Regression and Prediction
Predicts continuous values such as sales, price or demand.
Outlier Detection
Finds objects that differ significantly from normal behavior.
Sequential and Time-Series Mining
Discovers trends and patterns ordered by time.
Text and Web Mining
Extracts useful patterns from documents, web content, links and user behavior.
16. Knowledge Discovery Process (KDD) 14 Marks
Knowledge Discovery in Databases is the complete process of identifying useful knowledge from data. Data mining is one important step within KDD.
KDD Steps
Data Sources
|
1. Data Cleaning
|
2. Data Integration
|
3. Data Selection
|
4. Data Transformation
|
5. Data Mining
|
6. Pattern Evaluation
|
7. Knowledge Presentation
1. Data Cleaning
Removes noise, errors and inconsistencies.
2. Data Integration
Combines multiple data sources.
3. Data Selection
Selects data relevant to the analysis task.
4. Data Transformation
Converts data into appropriate mining form.
5. Data Mining
Applies intelligent algorithms to discover patterns.
6. Pattern Evaluation
Identifies useful and interesting patterns.
7. Knowledge Presentation
Presents results through reports, charts, rules and visualizations.
Data mining and KDD are not identical. Data mining is a central step within the broader KDD process.
17. Applications of Data Mining 14 Marks
Retail and Marketing
Market basket analysis
Customer segmentation
Sales forecasting
Recommendation systems
Banking and Finance
Credit-risk analysis
Fraud detection
Customer profitability analysis
Healthcare
Disease prediction
Patient-risk analysis
Treatment effectiveness analysis
Telecommunication
Customer churn prediction
Network fault detection
Usage pattern analysis
Education
Student performance prediction
Dropout detection
Personalized learning
Cybersecurity
Intrusion detection
Malware behavior analysis
Abnormal activity detection
18. Challenges of Data Mining 14 Marks
Data Quality
Incomplete and noisy data reduces the reliability of discovered patterns.
Scalability
Algorithms must process very large and rapidly growing datasets.
High Dimensionality
Datasets may contain thousands of attributes.
Heterogeneous Data
Data may be relational, spatial, temporal, textual, multimedia or web-based.
Privacy and Security
Personal and confidential data must be protected.
Dynamic and Streaming Data
Patterns may need to be discovered continuously as data arrives.
Pattern Evaluation
A large number of patterns may be generated, but only a few may be useful.
User Interaction
Mining systems should include domain knowledge and produce understandable results.
Ethical Issues
Biased or unfair patterns can lead to harmful decisions.
19. Important Comparisons 14 Marks
Data Cleaning vs Data Transformation
Data Cleaning
Data Transformation
Corrects errors and inconsistencies
Changes format or representation
Handles missing and noisy data
Performs normalization and aggregation
Improves data quality
Makes data suitable for mining
Data Integration vs Data Reduction
Feature
Integration
Reduction
Purpose
Combine sources
Reduce data size
Main issue
Schema and value conflicts
Preserving useful information
Output
Unified dataset
Compact dataset
KDD vs Data Mining
KDD
Data Mining
Complete knowledge discovery process
One step in KDD
Includes cleaning and presentation
Applies algorithms to discover patterns
Broad process
Core analytical step
Classification vs Clustering
Classification
Clustering
Uses predefined classes
No predefined classes
Supervised learning
Unsupervised learning
Predicts a class label
Forms natural groups
Unit 2 Quick Revision
Preprocessing improves data quality before mining.
Cleaning handles missing, noisy and inconsistent data.
Integration combines multiple sources.
Transformation includes aggregation, generalization and normalization.
Reduction decreases size while preserving useful information.
Dimensionality reduction decreases the number of features.
Numerosity reduction replaces data with models or summaries.
Discretization converts continuous values into intervals.