Bỏ qua tới nội dung chính
Quay lại tin tức

3 Minh chứng trực quan về Định lý giới hạn trung tâm để xây dựng trực giác

KDnuggets· Iván Palomares Carrascosa· 11/8/2026general

Để xây dựng trực giác, bài viết này trình bày ba bằng chứng trực quan cho thấy đường cong hình chuông cổ điển xuất hiện trong vô số tình huống.

3 minh chứng trực quan về Định lý giới hạn trung tâm giúp xây dựng trực giác Để xây dựng trực giác, bài viết này trình bày ba minh chứng trực quan cho thấy đường cong hình chuông kinh điển xuất hiện trong vô số tình huống. Bởi Iván Palomares Carrascosa, Chuyên gia Nội dung Kỹ thuật của KDnuggets vào ngày 11/8/2026 trong lĩnh vực Khoa học Dữ liệu Định lý giới hạn trung tâm (CLT), nói một cách khái quát, cho chúng ta biết rằng đường cong hình chuông "kỳ diệu" của phân phối chuẩn xuất hiện (và nó xuất hiện rất nhiều!) trong thế giới thực, thường không phụ thuộc vào hình dạng ban đầu của dữ liệu. Nhưng bạn đã bao giờ tự hỏi tại sao chưa? Điểm mấu chốt đằng sau CLT là một quy tắc thống kê cơ bản: nếu lấy đủ mẫu từ bất kỳ dữ liệu nào và tính toán giá trị trung bình của chúng, các giá trị trung bình này sẽ tiệm cận một phân phối chuẩn — bất kể hình dạng ban đầu của dữ liệu là gì. Để xây dựng trực giác, bài viết này trình bày ba minh chứng trực quan cho thấy đường cong hình chuông kinh điển xuất hiện trong vô số tình huống. # 1. Tung nhiều xúc xắc Khi tung một con xúc xắc sáu mặt nhiều lần, chúng ta sẽ có một phân phối phẳng, đồng đều một cách trực quan. Tuy nhiên, câu chuyện thay đổi khi tung nhiều con xúc xắc cùng lúc — ví dụ, năm con cùng một lúc. Nếu chúng ta tính toán giá trị trung bình của các kết quả xúc xắc đó và vẽ biểu đồ, một đường cong hình chuông sẽ xuất hiện, đạt đỉnh quanh các điểm trung bình là 3 và 4. Các điểm trung bình này có xu hướng trở nên thường xuyên hơn nhiều so với các giá trị cực đoan là 1 và 6, vốn đòi hỏi tất cả các con xúc xắc phải có điểm thấp (hoặc cao, tương ứng): điều này trực quan khó đạt được hơn là có các điểm hỗn hợp bù trừ cho nhau. import numpy as np import matplotlib.pyplot as plt # Simulating 100,000 averages of 5 dice rolls: upper bound of 7 is excluded in randint() dice_averages = [np.mean(np.random.randint(1, 7, 5)) for _ in range(100000)] plt.hist(dice_averages, bins=20, edgecolor='black', color='skyblue') plt.title("Distribution of 5-Dice Averages") plt.show() Phân phối giá trị trung bình từ việc tung 5 con xúc xắc 100.000 lần # 2. Tính trung bình một đám đông bị chia rẽ: Thời gian xem màn hình hai đỉnh Giả sử một ứng dụng xem video mà người dùng thuộc hai loại khác biệt rõ rệt: họ chỉ ở lại 1–2 phút, hoặc họ là những "người cuộn sâu" (deep scrollers) ở lại xem 30 phút trở lên — không có người dùng ở giữa. Dữ liệu thô được vẽ biểu đồ, tất nhiên, sẽ cho ra một phân phối hai đỉnh với một thung lũng sâu ở giữa. Tuy nhiên, nếu bạn liên tục chọn ngẫu nhiên các nhóm, ví dụ, 40 người dùng, tính toán thời gian xem màn hình trung bình và vẽ biểu đồ trên nhiều lần lấy mẫu, mọi thứ sẽ thay đổi. Phân phối của các giá trị trung bình hoàn toàn bỏ qua thung lũng giữa hai đỉnh và biến thành một đường cong hình chuông. # Tạo phân phối hai đỉnh (người kiểm tra nhanh và người lướt sâu) `quick = np.random.normal(2, 0.5, 50000)` `deep = np.random.normal(30, 5, 50000)` `bimodal_population = np.concatenate([quick, deep])` # Lấy 10.000 mẫu gồm 40 người dùng mỗi mẫu và tính thời gian sử dụng màn hình trung bình `screen_time_averages = [np.mean(np.random.choice(bimodal_population, 40)) for _ in range(10000)]` `plt.hist(screen_time_averages, bins=30, edgecolor='black', color='mediumpurple')` `plt.title("Averages of Bimodal Screen Times for 10K 40-user samples")` `plt.show()` Phân phối các giá trị trung bình từ việc lấy mẫu một quần thể có thời gian sử dụng màn hình hai đỉnh # 3. Làm mịn độ lệch hỗn loạn: Thu nhập trung bình Một ví dụ thực tế khác về Định lý giới hạn trung tâm (CLT) ở mức độ tốt nhất. Phân phối tài sản, phải thừa nhận, có độ lệch phải đáng kể, với phần lớn dân số nghiêng về phía cận dưới. Do đó, thiểu số giàu có tạo thành một đuôi dài kéo dài về phía bên phải. Bức tranh này thay đổi khi chọn ngẫu nhiên, ví dụ, 50 người và tính thu nhập trung bình của họ. Nếu chúng ta lặp lại quá trình lấy mẫu này vài nghìn lần và vẽ biểu đồ các giá trị trung bình thu được, kết quả là — chúng ta có thể mong đợi điều gì khác vào thời điểm này? — một đường cong hình chuông nguyên sơ, gần như đối xứng hoàn hảo: những người có tài chính vượt trội được làm mịn bởi đám đông khiêm tốn hơn. # Tạo dữ liệu "thu nhập" có độ lệch lớn (phân phối hàm mũ) `population = np.random.exponential(scale=50000, size=100000)` # Lấy 10.000 mẫu gồm 50 người và tính trung bình `income_averages = [np.mean(np.random.choice(population, 50)) for _ in range(10000)]` `plt.hist(income_averages, bins=30, edgecolor='black', color='salmon')` `plt.title("Averages of Skewed Wealth Samples")` `plt.show()` Phân phối các giá trị trung bình từ việc lấy mẫu một quần thể thu nhập có độ lệch phải Iván Palomares Carrascosa là một nhà lãnh đạo, nhà văn, diễn giả và cố vấn về AI, học máy (machine learning), học sâu (deep learning) và các mô hình ngôn ngữ lớn (LLM). Ông đào tạo và hướng dẫn người khác trong việc khai thác AI trong thế giới thực. Thêm về chủ đề này Công cụ gỡ lỗi trực quan cho quy trình làm việc học máy Tổng hợp hàng tuần của KDnuggets: Xây dựng và triển khai hệ thống tự hành đầu tiên của bạn… 5 dự án SQL thực tế để xây dựng danh mục dữ liệu của bạn Bắt đầu với Smolagents: Xây dựng tác nhân mã đầu tiên của bạn trong 15 phút Bắt đầu với Nanobot: Xây dựng tác nhân AI đầu tiên của bạn Xây dựng hay mua an ninh mạng của bạn? Cân nhắc ưu và nhược điểm (Được tài trợ) 5 khóa học miễn phí hàng đầu của chúng tôi Nhận sách điện tử MIỄN PHÍ 'Từ điển bỏ túi trí tuệ nhân tạo của KDnuggets' cùng với bản tin hàng đầu về Khoa học dữ liệu, Học máy, AI & Phân tích trực tiếp vào hộp thư đến của bạn. Bằng cách đăng ký, bạn chấp nhận Chính sách quyền riêng tư của KDnuggets Để trống trường này nếu bạn là người:

Nguồn tin: KDnuggets — Tác giả: Iván Palomares Carrascosa. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.