Unit 1 of 4 · MBA Sem 2

Unit 1: Data preparation and sampling

Business Analytics for Decision Making notes · PTU syllabus (MBA 201-26)

3 min read11 topics10 exam questions
On this page
  1. Unit summary
  2. Statistics and analytics in business decisions
  3. Data types and sources
  4. Data preprocessing and cleaning
  5. Handling missing values
  6. Classification and frequency distributions
  7. Frequency distributions
  8. Introduction to SPSS
  9. Census vs sampling
  10. Probability and non-probability sampling
  11. Exploratory data analysis
  12. Dimension reduction
  13. Key terms
  14. Quick revision
  15. Important questions

Unit summary

Analytics begins with good data. This unit covers the importance and applications of statistics in business decisions, data types and sources, data preprocessing and cleaning, handling missing values, classification and frequency distributions, an introduction to SPSS, census vs sampling, probability and non-probability sampling, exploratory data analysis and dimension reduction.

After this unit you can

  • Explain the role of statistics and analytics in business decisions
  • Identify data types and sources and prepare data through cleaning and handling missing values
  • Use SPSS for data entry, classification and frequency distributions
  • Choose sampling methods and apply exploratory data analysis and dimension reduction

PTU syllabus topics

  • Importance and applications of statistics in business decisions
  • data types and sources
  • data preprocessing and cleaning
  • handling missing values
  • classification and frequency distributions
  • introduction to SPSS
  • census vs sampling
  • probability and non-probability sampling
  • exploratory data analysis and dimension reduction
ProcessPreparing data for analysis
  1. 1Collect data

    Primary and secondary sources

  2. 2Clean

    Errors, duplicates, outliers

  3. 3Handle missing values

    Delete or impute

  4. 4Explore (EDA)

    Summaries and charts

  5. 5Reduce dimensions

    Factor analysis, PCA

1

Topic 1

Statistics and analytics in business decisions

  • Business analytics: the use of data, statistical methods and models to support better and faster decisions.
HierarchyLevels of analytics
  1. Prescriptive

    What should we do? Optimisation, simulation

  2. Predictive

    What will happen? Regression, classification, forecasting

  3. Diagnostic

    Why did it happen? Drill-down, correlation

  4. Descriptive

    What happened? Summaries, dashboards

  • Applications: demand forecasting, pricing, customer segmentation and churn, credit scoring and fraud detection, inventory optimisation, HR attrition prediction, quality control, campaign measurement.
  • Limitations: results depend on data quality; correlation is not causation; models need business judgement.
2

Topic 2

Data types and sources

ClassificationTypes of data
Data
  • Qualitative (categorical)

    Nominal (gender, region), ordinal (ratings, ranks)

  • Quantitative (numerical)

    Discrete (number of orders), continuous (sales value, weight)

  • By structure

    Structured (tables), semi-structured (JSON, logs), unstructured (text, images)

  • By time

    Cross-sectional, time series, panel

  • Primary sources: surveys, experiments, observation, interviews, sensors and transaction systems.
  • Secondary sources: company records (ERP, CRM), government data (MOSPI, RBI database, Census), industry reports (CMIE), web and social media data.
  • Levels of measurement: nominal, ordinal, interval, ratio — they decide which statistics are valid.
3

Topic 3

Data preprocessing and cleaning

ProcessData preprocessing pipeline
  1. 1

    Collect and integrate

    Merge sources, match keys

  2. 2

    Clean

    Fix errors, duplicates, inconsistent codes, outliers

  3. 3

    Handle missing values

  4. 4

    Transform

    Recode, standardise, create derived variables

  5. 5

    Reduce

    Select variables, dimension reduction

  6. 6

    Validate

    Checks before analysis

  • Common problems: typing errors, duplicate records, inconsistent formats ("Punjab", "PB"), impossible values (age 250), outliers.
  • Outlier detection: box plots (beyond 1.5 × IQR), z-scores above 3.
  • Transformation: standardisation (z = (x − mean) ÷ SD), normalisation to 0–1, log transformation of skewed data, binning, dummy coding of categories.
4

Topic 4

Handling missing values

  • Types: missing completely at random (MCAR), missing at random (MAR), missing not at random (MNAR).
ClassificationMethods for missing values
Missing data
  • Deletion

    Listwise (drop the case), pairwise (use available pairs)

  • Simple imputation

    Mean, median or mode; series mean; last observation carried forward

  • Model-based imputation

    Regression, nearest neighbour, multiple imputation

  • Flagging

    Indicator variable for "missing"

Exam tip

In SPSS: Transform → Replace Missing Values (series mean, mean or median of nearby points, linear interpolation, linear trend); Analyze → Multiple Imputation for model-based methods.

5

Topic 5

Classification and frequency distributions

Classification groups data into classes by common characteristics — geographical, chronological, qualitative or quantitative.

6

Topic 6

Frequency distributions

A frequency distribution groups data into classes and shows how many observations fall into each.

MarksNumber of students
0–204
20–4010
40–6018
60–8012
80–1006

Key terms: class limits, class interval (width), mid-value, frequency and cumulative frequency. A good distribution has 5–15 classes of equal width.

7

Topic 7

Introduction to SPSS

SPSS (Statistical Package for the Social Sciences, now IBM SPSS Statistics) is menu-driven software for data management and statistical analysis.

  • Data View: rows are cases, columns are variables. Variable View: name, type, width, label, value labels, missing values, measure (scale, ordinal, nominal).
  • Output Viewer: tables and charts; Syntax Editor: command scripts for repeatable analysis.
TaskSPSS menu
Frequencies and descriptivesAnalyze → Descriptive Statistics → Frequencies or Descriptives
Explore (EDA, normality)Analyze → Descriptive Statistics → Explore
Recode or compute variablesTransform → Recode into Different Variables or Compute Variable
Cross-tabulationAnalyze → Descriptive Statistics → Crosstabs
ChartsGraphs → Chart Builder
8

Topic 8

Census vs sampling

Advantages: lower cost, faster results, greater accuracy (fewer non-sampling errors), and possible when the population is huge or testing destroys items. Limitations: sampling error, possible bias and difficulty with very small or heterogeneous populations.

ProcessThe sampling process
  1. 1

    Define the population

  2. 2

    Identify the sampling frame

    List of population units

  3. 3

    Choose the sampling technique

  4. 4

    Decide sample size

  5. 5

    Select the sample

  6. 6

    Collect data

9

Topic 9

Probability and non-probability sampling

ComparisonSampling techniques
Probability sampling
Non-probability sampling

Selection

Random, known chance

Based on judgement or convenience

Types

Simple random, systematic, stratified, cluster, multistage

Convenience, judgement, quota, snowball

Generalisation

Possible

Limited

Cost

Higher

Lower

10

Topic 10

Exploratory data analysis

EDA (John Tukey) uses summaries and graphs to understand data before formal modelling.

  • Univariate: mean, median, SD, skewness, histograms, box plots.
  • Bivariate: scatter plots, correlation, cross-tabs, grouped box plots.
  • Checks: distribution shape and normality (Q–Q plot, Shapiro–Wilk test), outliers, patterns of missing data.

Example

A retailer's EDA on 10,000 bills shows median spend ₹850 but mean ₹1,400 — a right-skewed distribution driven by a few bulk buyers, so median is the better "typical" value.

11

Topic 11

Dimension reduction

  • Purpose: reduce many correlated variables to a few composite ones — simpler models, less multicollinearity, easier visualisation.
  • Methods: variable selection (drop redundant variables), principal component analysis (PCA), factor analysis.
  • Suitability checks: KMO measure of sampling adequacy (above 0.6) and Bartlett's test of sphericity (significant).

Exam tip

In SPSS: Analyze → Dimension Reduction → Factor; choose Principal components, retain components with eigenvalue above 1 (Kaiser criterion) or use the scree plot.

Key terms

Predictive analytics
Using data to forecast future outcomes
Data cleaning
Detecting and correcting errors in data
Imputation
Replacing missing values with estimates
EDA
Exploring data visually and numerically before modelling
Dimension reduction
Reducing many variables to a few components

Quick revision

  • Descriptive, diagnostic, predictive, prescriptive analytics.
  • Data types, sources and levels of measurement.
  • Preprocessing: integrate, clean, missing values, transform, reduce.
  • Frequency distributions; SPSS Data and Variable View.
  • Census vs sample; probability and non-probability sampling; EDA; PCA and factor analysis.

Important exam questions

Practice questions written to the PTU exam pattern for this unit's syllabus: short answers (Section A style) and long answers (Sections B and C style).

Short-answer questions

  1. Q1.Distinguish descriptive and predictive analytics.
  2. Q2.Give two examples each of nominal and ratio data.
  3. Q3.State two methods of handling missing values.
  4. Q4.What is the Variable View in SPSS?
  5. Q5.Distinguish stratified and cluster sampling.
  6. Q6.What is the purpose of dimension reduction?

Long-answer questions

  1. Q1.Explain the importance and applications of statistics and analytics in business decisions.
  2. Q2.Explain the steps of data preprocessing and methods of handling missing values.
  3. Q3.Discuss probability and non-probability sampling methods.
  4. Q4.Explain exploratory data analysis and dimension reduction techniques.

Stuck on this unit?

Message SBS on WhatsApp for help with Business Analytics for Decision Making, or to ask about studying MBA at Synetic.

WhatsApp us