Unit 1: Data preparation and sampling
Business Analytics for Decision Making notes · PTU syllabus (MBA 201-26)
On this page
- Unit summary
- Statistics and analytics in business decisions
- Data types and sources
- Data preprocessing and cleaning
- Handling missing values
- Classification and frequency distributions
- Frequency distributions
- Introduction to SPSS
- Census vs sampling
- Probability and non-probability sampling
- Exploratory data analysis
- Dimension reduction
- Key terms
- Quick revision
- Important questions
Unit summary
Analytics begins with good data. This unit covers the importance and applications of statistics in business decisions, data types and sources, data preprocessing and cleaning, handling missing values, classification and frequency distributions, an introduction to SPSS, census vs sampling, probability and non-probability sampling, exploratory data analysis and dimension reduction.
After this unit you can
- Explain the role of statistics and analytics in business decisions
- Identify data types and sources and prepare data through cleaning and handling missing values
- Use SPSS for data entry, classification and frequency distributions
- Choose sampling methods and apply exploratory data analysis and dimension reduction
PTU syllabus topics
- Importance and applications of statistics in business decisions
- data types and sources
- data preprocessing and cleaning
- handling missing values
- classification and frequency distributions
- introduction to SPSS
- census vs sampling
- probability and non-probability sampling
- exploratory data analysis and dimension reduction
- 1Collect data
Primary and secondary sources
- 2Clean
Errors, duplicates, outliers
- 3Handle missing values
Delete or impute
- 4Explore (EDA)
Summaries and charts
- 5Reduce dimensions
Factor analysis, PCA
Topic 1
Statistics and analytics in business decisions
- Business analytics: the use of data, statistical methods and models to support better and faster decisions.
- Prescriptive
What should we do? Optimisation, simulation
- Predictive
What will happen? Regression, classification, forecasting
- Diagnostic
Why did it happen? Drill-down, correlation
- Descriptive
What happened? Summaries, dashboards
- Applications: demand forecasting, pricing, customer segmentation and churn, credit scoring and fraud detection, inventory optimisation, HR attrition prediction, quality control, campaign measurement.
- Limitations: results depend on data quality; correlation is not causation; models need business judgement.
Topic 2
Data types and sources
Qualitative (categorical)
Nominal (gender, region), ordinal (ratings, ranks)
Quantitative (numerical)
Discrete (number of orders), continuous (sales value, weight)
By structure
Structured (tables), semi-structured (JSON, logs), unstructured (text, images)
By time
Cross-sectional, time series, panel
- Primary sources: surveys, experiments, observation, interviews, sensors and transaction systems.
- Secondary sources: company records (ERP, CRM), government data (MOSPI, RBI database, Census), industry reports (CMIE), web and social media data.
- Levels of measurement: nominal, ordinal, interval, ratio — they decide which statistics are valid.
Topic 3
Data preprocessing and cleaning
- 1
Collect and integrate
Merge sources, match keys
- 2
Clean
Fix errors, duplicates, inconsistent codes, outliers
- 3
Handle missing values
- 4
Transform
Recode, standardise, create derived variables
- 5
Reduce
Select variables, dimension reduction
- 6
Validate
Checks before analysis
- Common problems: typing errors, duplicate records, inconsistent formats ("Punjab", "PB"), impossible values (age 250), outliers.
- Outlier detection: box plots (beyond 1.5 × IQR), z-scores above 3.
- Transformation: standardisation (z = (x − mean) ÷ SD), normalisation to 0–1, log transformation of skewed data, binning, dummy coding of categories.
Topic 4
Handling missing values
- Types: missing completely at random (MCAR), missing at random (MAR), missing not at random (MNAR).
Deletion
Listwise (drop the case), pairwise (use available pairs)
Simple imputation
Mean, median or mode; series mean; last observation carried forward
Model-based imputation
Regression, nearest neighbour, multiple imputation
Flagging
Indicator variable for "missing"
Exam tip
In SPSS: Transform → Replace Missing Values (series mean, mean or median of nearby points, linear interpolation, linear trend); Analyze → Multiple Imputation for model-based methods.
Topic 5
Classification and frequency distributions
Classification groups data into classes by common characteristics — geographical, chronological, qualitative or quantitative.
Topic 6
Frequency distributions
A frequency distribution groups data into classes and shows how many observations fall into each.
| Marks | Number of students |
|---|---|
| 0–20 | 4 |
| 20–40 | 10 |
| 40–60 | 18 |
| 60–80 | 12 |
| 80–100 | 6 |
Key terms: class limits, class interval (width), mid-value, frequency and cumulative frequency. A good distribution has 5–15 classes of equal width.
Topic 7
Introduction to SPSS
SPSS (Statistical Package for the Social Sciences, now IBM SPSS Statistics) is menu-driven software for data management and statistical analysis.
- Data View: rows are cases, columns are variables. Variable View: name, type, width, label, value labels, missing values, measure (scale, ordinal, nominal).
- Output Viewer: tables and charts; Syntax Editor: command scripts for repeatable analysis.
| Task | SPSS menu |
|---|---|
| Frequencies and descriptives | Analyze → Descriptive Statistics → Frequencies or Descriptives |
| Explore (EDA, normality) | Analyze → Descriptive Statistics → Explore |
| Recode or compute variables | Transform → Recode into Different Variables or Compute Variable |
| Cross-tabulation | Analyze → Descriptive Statistics → Crosstabs |
| Charts | Graphs → Chart Builder |
Topic 8
Census vs sampling
Advantages: lower cost, faster results, greater accuracy (fewer non-sampling errors), and possible when the population is huge or testing destroys items. Limitations: sampling error, possible bias and difficulty with very small or heterogeneous populations.
- 1
Define the population
- 2
Identify the sampling frame
List of population units
- 3
Choose the sampling technique
- 4
Decide sample size
- 5
Select the sample
- 6
Collect data
Topic 9
Probability and non-probability sampling
Selection
Random, known chance
Based on judgement or convenience
Types
Simple random, systematic, stratified, cluster, multistage
Convenience, judgement, quota, snowball
Generalisation
Possible
Limited
Cost
Higher
Lower
Topic 10
Exploratory data analysis
EDA (John Tukey) uses summaries and graphs to understand data before formal modelling.
- Univariate: mean, median, SD, skewness, histograms, box plots.
- Bivariate: scatter plots, correlation, cross-tabs, grouped box plots.
- Checks: distribution shape and normality (Q–Q plot, Shapiro–Wilk test), outliers, patterns of missing data.
Example
A retailer's EDA on 10,000 bills shows median spend ₹850 but mean ₹1,400 — a right-skewed distribution driven by a few bulk buyers, so median is the better "typical" value.
Topic 11
Dimension reduction
- Purpose: reduce many correlated variables to a few composite ones — simpler models, less multicollinearity, easier visualisation.
- Methods: variable selection (drop redundant variables), principal component analysis (PCA), factor analysis.
- Suitability checks: KMO measure of sampling adequacy (above 0.6) and Bartlett's test of sphericity (significant).
Exam tip
In SPSS: Analyze → Dimension Reduction → Factor; choose Principal components, retain components with eigenvalue above 1 (Kaiser criterion) or use the scree plot.
Key terms
- Predictive analytics
- Using data to forecast future outcomes
- Data cleaning
- Detecting and correcting errors in data
- Imputation
- Replacing missing values with estimates
- EDA
- Exploring data visually and numerically before modelling
- Dimension reduction
- Reducing many variables to a few components
Quick revision
- Descriptive, diagnostic, predictive, prescriptive analytics.
- Data types, sources and levels of measurement.
- Preprocessing: integrate, clean, missing values, transform, reduce.
- Frequency distributions; SPSS Data and Variable View.
- Census vs sample; probability and non-probability sampling; EDA; PCA and factor analysis.
Important exam questions
Practice questions written to the PTU exam pattern for this unit's syllabus: short answers (Section A style) and long answers (Sections B and C style).
Short-answer questions
- Q1.Distinguish descriptive and predictive analytics.
- Q2.Give two examples each of nominal and ratio data.
- Q3.State two methods of handling missing values.
- Q4.What is the Variable View in SPSS?
- Q5.Distinguish stratified and cluster sampling.
- Q6.What is the purpose of dimension reduction?
Long-answer questions
- Q1.Explain the importance and applications of statistics and analytics in business decisions.
- Q2.Explain the steps of data preprocessing and methods of handling missing values.
- Q3.Discuss probability and non-probability sampling methods.
- Q4.Explain exploratory data analysis and dimension reduction techniques.
Stuck on this unit?
Message SBS on WhatsApp for help with Business Analytics for Decision Making, or to ask about studying MBA at Synetic.
