Dữ liệu thô (raw data) là nguyên liệu đầu vào của toàn bộ quy trình. Ở giai đoạn này, nhiệm vụ chính là xác định nguồn dữ liệu, phương thức thu thập và định dạng lưu trữ — trước khi bất kỳ phân tích nào diễn ra.
Dữ liệu có thể đến từ nhiều nguồn: cơ sở dữ liệu nội bộ (ERP, CRM), file Excel/CSV từ các phòng ban, API từ hệ thống bên thứ ba, web scraping, IoT sensors, hoặc dữ liệu mua từ nhà cung cấp bên ngoài. Mỗi nguồn đi kèm với đặc điểm kỹ thuật và hạn chế riêng.
Nhận diện & Thu thập
- Xác định nguồn dữ liệu sẵn có
- Tải file CSV / Excel về máy
- Kết nối cơ sở dữ liệu cơ bản (MySQL, SQL Server)
- Hiểu sự khác biệt giữa dữ liệu có cấu trúc và phi cấu trúc
- Đánh giá sơ bộ khối lượng và định dạng dữ liệu
Kiến trúc thu thập dữ liệu
- Xây dựng data pipeline tự động (ETL/ELT)
- Tích hợp API real-time và webhooks
- Thu thập dữ liệu streaming (Kafka, Kinesis)
- Quản lý Data Catalog và Data Lineage
- Đánh giá chất lượng dữ liệu ngay tại nguồn
- Danh sách nguồn dữ liệu được xác nhận
- File/bảng dữ liệu thô đã được thu thập về môi trường làm việc
- Ghi chú sơ bộ về đặc điểm dữ liệu (định dạng, kích thước, tần suất cập nhật)
Trước khi đi sâu vào dữ liệu, bạn cần hiểu rõ: Tại sao dữ liệu này tồn tại? Ai sẽ sử dụng kết quả phân tích? Quyết định kinh doanh nào đang cần được hỗ trợ? Đây là giai đoạn khám phá bức tranh toàn cảnh (Big Picture) — đặt dữ liệu vào đúng ngữ cảnh của tổ chức.
Việc hiểu context giúp bạn tránh "phân tích đúng dữ liệu sai vấn đề" — một sai lầm phổ biến khi analyst chỉ tập trung vào kỹ thuật mà quên mất mục tiêu nghiệp vụ.
Xác định bối cảnh cơ bản
- Xác định câu hỏi kinh doanh cần trả lời
- Tìm hiểu domain knowledge của ngành
- Phỏng vấn stakeholders để hiểu nhu cầu
- Xác định KPI và metrics quan trọng
- Vẽ sơ đồ quy trình nghiệp vụ liên quan
Phân tích chiến lược
- Xây dựng Business Question Framework
- Phân tích chuỗi giá trị và điểm tác động
- Áp dụng MECE để cấu trúc vấn đề
- Xác định hypothesis cần kiểm chứng
- Đánh giá ROI tiềm năng của phân tích
Dành tối thiểu 20% thời gian dự án cho bước này. Một business analyst giỏi thường đặt ra 5–10 câu hỏi về bối cảnh trước khi mở file dữ liệu đầu tiên.
- Tài liệu Business Context: mục tiêu, stakeholders, KPI kỳ vọng
- Danh sách câu hỏi phân tích được ưu tiên
- Phạm vi dự án được xác định rõ ràng (in-scope / out-of-scope)
Data Dictionary là tài liệu mô tả ý nghĩa, định dạng, giá trị hợp lệ và mối quan hệ của từng trường dữ liệu trong hệ thống. Đây là "bản đồ ngôn ngữ" giúp mọi người trong tổ chức hiểu dữ liệu theo cùng một cách.
Thiếu Data Dictionary, mỗi analyst sẽ tự diễn giải dữ liệu theo cách riêng — dẫn đến kết quả không nhất quán và xung đột thông tin giữa các báo cáo.
Data Dictionary thực tế
- Lập bảng mô tả: tên cột, kiểu dữ liệu, mô tả
- Ghi chú giá trị null/trống và ý nghĩa
- Liệt kê các giá trị enum/mã hóa
- Xác định primary key và foreign key
- Ghi nguồn gốc của từng trường dữ liệu
Quản lý Metadata chuyên sâu
- Triển khai công cụ Data Catalog tập trung
- Xây dựng Data Lineage (dữ liệu đến từ đâu, đi đâu)
- Thiết lập Data Ownership và Stewardship
- Tích hợp với CI/CD pipeline để cập nhật tự động
- Áp dụng semantic layer trong BI platform
- Tài liệu Data Dictionary đầy đủ cho tất cả bảng/trường được sử dụng
- Bảng mã hóa (lookup table) cho các trường dạng mã
- Sơ đồ quan hệ (ERD) giữa các bảng dữ liệu
Data Cleansing (làm sạch dữ liệu) bao gồm việc phát hiện và xử lý các vấn đề về chất lượng dữ liệu: giá trị thiếu (missing values), dữ liệu trùng lặp (duplicates), outliers bất thường, định dạng không nhất quán, và dữ liệu sai về mặt nghiệp vụ.
Theo nghiên cứu từ Gartner, các tổ chức mất trung bình 12.9 triệu USD mỗi năm do chất lượng dữ liệu kém. Data Cleansing không chỉ là bước kỹ thuật — đây là đầu tư cho độ tin cậy của toàn bộ hệ thống phân tích.
Làm sạch dữ liệu thủ công
- Xử lý missing values (xóa, điền trung bình, mode)
- Loại bỏ hàng trùng lặp
- Chuẩn hóa định dạng ngày tháng, số điện thoại
- Sửa lỗi chính tả trong dữ liệu văn bản
- Xác định và xử lý outlier rõ ràng
Tự động hóa & Data Quality Framework
- Xây dựng Data Quality Rules tự động kiểm tra
- Áp dụng Great Expectations / dbt Tests
- Imputation nâng cao: KNN, regression imputation
- Phát hiện outlier bằng thống kê (IQR, Z-score, Isolation Forest)
- Thiết lập Data Quality Dashboard theo dõi liên tục
Không nên xóa dữ liệu null một cách tuỳ tiện. Null đôi khi mang ý nghĩa nghiệp vụ quan trọng — ví dụ: khách hàng chưa có ngày sinh không phải là dữ liệu lỗi, mà là thông tin chưa được thu thập. Hãy luôn hỏi domain expert trước khi quyết định xử lý.
- Dataset đã được làm sạch, sẵn sàng để phân tích
- Báo cáo Data Quality: tỷ lệ null, duplicate, outlier đã xử lý
- Ghi chú về các quyết định làm sạch để đảm bảo tính tái lập
Data Model định nghĩa cách dữ liệu được tổ chức, kết nối và lưu trữ để phục vụ mục tiêu phân tích. Có hai trường phái chính: mô hình hoá OLTP (tối ưu cho ghi/đọc giao dịch) và OLAP (tối ưu cho tổng hợp và báo cáo).
Trong hầu hết dự án analytics, bạn sẽ cần xây dựng mô hình dữ liệu dạng Star Schema hoặc Snowflake Schema — nơi bảng dữ kiện (fact table) được bao quanh bởi các bảng chiều (dimension tables) để tạo ra cấu trúc truy vấn linh hoạt và hiệu quả.
Mô hình dữ liệu cơ bản
- Hiểu khái niệm Fact Table và Dimension Table
- Xây dựng Star Schema đơn giản
- JOIN các bảng dữ liệu bằng SQL
- Tạo view và stored procedure cơ bản
- Thiết kế mô hình phù hợp với câu hỏi phân tích
Data Warehouse Architecture
- Thiết kế Kimball vs Inmon methodology
- Xây dựng Slowly Changing Dimensions (SCD)
- Áp dụng Data Vault 2.0 cho dữ liệu lịch sử
- Tối ưu hiệu suất: partitioning, indexing, materialized views
- Thiết kế Data Lakehouse (Delta Lake, Apache Iceberg)
- Sơ đồ Data Model (Star Schema / ERD) đã được phê duyệt
- Các bảng đã được tạo và dữ liệu đã được load vào
- Tài liệu mô tả logic transform từ raw data sang data model
Data Analytics Taxonomy phân loại các phương pháp phân tích theo 4 tầng: Descriptive (Mô tả — chuyện gì đã xảy ra?), Diagnostic (Chẩn đoán — tại sao xảy ra?), Predictive (Dự đoán — điều gì sẽ xảy ra?) và Prescriptive (Đề xuất — nên làm gì?). Mỗi tầng đòi hỏi kỹ thuật và dữ liệu khác nhau.
Hiểu Taxonomy giúp bạn thiết lập đúng kỳ vọng với stakeholders — không phải lúc nào cũng cần Machine Learning; đôi khi một báo cáo mô tả tốt đã đủ để tạo ra quyết định kinh doanh có giá trị.
4 loại phân tích cốt lõi
- Descriptive: Tổng hợp, báo cáo, pivot table
- Diagnostic: Drill-down, phân tích nguyên nhân gốc rễ
- Predictive: Regression, forecasting đơn giản
- Prescriptive: Gợi ý hành động dựa trên phân tích
- Xác định loại phân tích phù hợp cho từng câu hỏi
Analytics Engineering nâng cao
- Thiết kế Analytics Framework tổng thể cho tổ chức
- Kết hợp statistical testing với business decision
- Xây dựng Causal Inference methodology
- Tích hợp Real-time analytics với batch analytics
- Thiết kế A/B testing framework có kiểm soát thống kê
- Bản đồ Analytics Approach: mỗi câu hỏi kinh doanh gắn với loại phân tích phù hợp
- Kế hoạch phân tích (Analysis Plan) với phương pháp, công cụ và timeline
- Kết quả phân tích thực tế (output của các query, model, calculation)
Bước Visual tập trung vào việc lựa chọn và thiết kế loại biểu đồ phù hợp nhất để truyền đạt insight. Không phải mọi dữ liệu đều phù hợp với biểu đồ cột — có hơn 80 loại biểu đồ khác nhau, mỗi loại tối ưu cho một dạng thông điệp cụ thể.
Nguyên tắc "Chart Chooser" cơ bản: dùng biểu đồ cột cho so sánh, đường thẳng cho xu hướng theo thời gian, scatter plot cho tương quan, pie chart chỉ khi có ít hơn 5 thành phần và tổng bằng 100%. Thiết kế tốt là khi người đọc hiểu thông điệp trong vòng 5 giây.
Visualisation nguyên tắc nền tảng
- Chọn đúng loại biểu đồ theo mục đích
- Tuân thủ nguyên tắc màu sắc (max 5–7 màu)
- Đặt tiêu đề mô tả nội dung, không phải loại biểu đồ
- Loại bỏ chart junk (gridlines, 3D, background thừa)
- Đảm bảo tỷ lệ trục không gây hiểu lầm
Advanced Visualisation Design
- Xây dựng Visual Design System nhất quán cho tổ chức
- Áp dụng Gestalt Principles trong layout
- Thiết kế cho người dùng khiếm thị màu (accessibility)
- Interactive và animated visualisation
- Geospatial visualization và network graphs
- Thư viện biểu đồ đã thiết kế theo visual design system thống nhất
- Các chart đơn lẻ phục vụ từng câu hỏi phân tích
- Bản mẫu (mockup) layout cho dashboard hoặc báo cáo
Bước này bao gồm ba hình thức phân phối kết quả chính: Dashboard — giao diện tương tác theo dõi metrics liên tục; Ad-hoc Analysis — phân tích đột xuất theo yêu cầu cụ thể, thường là báo cáo one-time; và ML Results — kết quả từ các model Machine Learning như dự đoán, phân cụm, gợi ý.
Mỗi hình thức phục vụ nhu cầu khác nhau: Dashboard cho operational monitoring, Ad-hoc cho strategic decisions, ML Results cho automated intelligence. Quan trọng là phải hiểu stakeholder nào cần hình thức nào.
Xây dựng báo cáo & Dashboard
- Thiết kế dashboard 1–2 trang với KPI chính
- Tạo filter và slicer cho người dùng tự khám phá
- Viết báo cáo ad-hoc theo template chuẩn
- Chia sẻ và phân quyền truy cập đúng đối tượng
- Lên lịch refresh dữ liệu tự động
Production-grade Analytics Systems
- Xây dựng self-service analytics platform
- Tích hợp ML model predictions vào dashboard real-time
- Thiết kế alerting & anomaly detection tự động
- Embedded analytics vào sản phẩm (product analytics)
- MLOps: deploy và monitor ML model trong production
- Dashboard đã deploy và đang hoạt động với người dùng thực
- Báo cáo ad-hoc đã được gửi đến đúng stakeholders
- Model ML đã được tích hợp hoặc kết quả đã được trình bày
Sau khi có kết quả phân tích, challenge lớn nhất là: từ hàng trăm con số và biểu đồ, đâu là điều quan trọng nhất? Bước Declutter (loại bỏ nhiễu) yêu cầu bạn liên tục hỏi: "Thông tin này có thay đổi quyết định của người nghe không?"
Insight thực sự phải đáp ứng ba tiêu chí: Mới (người nghe chưa biết điều này), Hành động được (có thể làm gì đó với thông tin này), và Liên quan (phù hợp với bối cảnh và mục tiêu của người nghe). Insight không đáp ứng cả ba tiêu chí này chỉ là thông tin thống kê đơn thuần.
Phân tách signal và noise
- Xác định top 3–5 insight quan trọng nhất
- Loại bỏ biểu đồ và số liệu không trực tiếp hỗ trợ câu hỏi
- Chuyển số liệu thô thành phát biểu có ý nghĩa
- So sánh với benchmark (kỳ trước, ngành, kế hoạch)
- Kiểm tra lại: "Điều này có làm thay đổi hành động không?"
Strategic Insight Generation
- Áp dụng So What? technique: liên tục hỏi hệ quả tiếp theo
- Phân tích Significance vs Importance (thống kê vs kinh doanh)
- Xây dựng Insight Pyramid: observation → insight → recommendation
- Kết hợp quantitative insight với qualitative context
- Kiểm chứng insight với domain experts trước khi trình bày
Nếu bạn có 20 trang phân tích nhưng chỉ có 10 phút để trình bày, những trang nào bạn giữ lại? Câu trả lời cho câu hỏi đó chính là insight thực sự của bạn. Phần còn lại là phụ lục.
- Danh sách 3–7 insight cốt lõi được viết thành câu hoàn chỉnh
- Mỗi insight kèm theo bằng chứng hỗ trợ (một biểu đồ hoặc con số cụ thể)
- Loại bỏ toàn bộ thông tin không đóng góp vào câu chuyện chính
Focus không chỉ là "viết đơn giản hơn" — đây là chiến lược truyền thông dữ liệu. Bạn cần hiểu người nghe ở góc độ: họ biết gì (kiến thức nền), họ cần gì (nhu cầu thực sự), họ lo gì (rào cản ra quyết định) và họ có thể làm gì (thẩm quyền hành động).
Cấu trúc SCQA (Situation–Complication–Question–Answer) của McKinsey là công cụ mạnh mẽ để thiết kế narrative tập trung: bắt đầu từ bối cảnh mà người nghe đã biết, dẫn đến vấn đề cần giải quyết, đặt câu hỏi trọng tâm, và trả lời bằng insight của bạn.
Thiết kế thông điệp theo đối tượng
- Phân loại đối tượng: Executive, Manager, Analyst, Operations
- Điều chỉnh độ phức tạp kỹ thuật phù hợp với audience
- Đặt kết luận lên đầu (Pyramid Principle)
- Chọn 1 thông điệp chính duy nhất cho mỗi trang
- Dự đoán và chuẩn bị câu hỏi từ người nghe
Advanced Communication Strategy
- Áp dụng SCQA framework trong toàn bộ narrative
- Xây dựng Executive Summary một trang hiệu quả
- Thiết kế multiple versions của cùng một phân tích cho các audiences khác nhau
- Kỹ thuật framing: đặt vấn đề theo góc nhìn người nghe quan tâm
- Pre-mortems: kiểm tra điểm yếu của narrative trước khi trình bày
- Storyboard / outline của câu chuyện với cấu trúc rõ ràng
- Thông điệp chính (key message) được viết thành một câu súc tích
- Danh sách slide/trang với tiêu đề mô tả insight, không phải mô tả biểu đồ
Data Storytelling là sự kết hợp của ba yếu tố: Data (dữ liệu chính xác, đáng tin cậy), Visuals (hình ảnh truyền đạt hiệu quả), và Narrative (câu chuyện có cấu trúc, tạo cảm xúc và logic). Thiếu bất kỳ yếu tố nào, tác động đều bị suy giảm đáng kể.
Một câu chuyện dữ liệu hiệu quả thường có cấu trúc kinh điển: Thiết lập bối cảnh → Giới thiệu vấn đề/xung đột → Phân tích và hành trình khám phá → Insight quan trọng → Khuyến nghị hành động. Cấu trúc này tạo ra sự căng thẳng và giải tỏa — con người học qua câu chuyện hiệu quả hơn qua số liệu.
Kể chuyện dữ liệu cơ bản
- Xây dựng narrative arc: setup → conflict → resolution
- Dùng annotation để dẫn dắt người đọc qua biểu đồ
- Kết hợp con số với ví dụ cụ thể (con người thực, tình huống thực)
- Kết thúc bằng call-to-action rõ ràng
- Luyện tập trình bày bằng lời nói (verbal storytelling)
Mastery of Data Storytelling
- Áp dụng emotional arc: tạo surprise, tension, hope
- Xây dựng interactive storytelling (Scrollytelling)
- Sử dụng analogy và metaphor để giải thích dữ liệu phức tạp
- Thiết kế visual narrative flow trong presentation
- Đo lường impact: quyết định nào đã thay đổi nhờ câu chuyện của bạn?
Câu chuyện dữ liệu của bạn thành công khi người nghe có thể nhớ và kể lại thông điệp chính mà không cần nhìn lại báo cáo — và họ biết chính xác bước tiếp theo họ cần làm.
- Presentation / báo cáo hoàn chỉnh với narrative rõ ràng
- Một trang tóm tắt (Executive Summary) cho người ra quyết định
- Danh sách hành động cụ thể được đề xuất, kèm owner và timeline
- Phụ lục với toàn bộ dữ liệu chi tiết cho người cần đi sâu hơn