Bỏ qua tới nội dung chính
Quay lại tin tức

Giới thiệu về Học bán giám sát

Towards Data Science· Carolina Bento· 5/8/2026general

Tổng quan về Học bán giám sát (Semi-Supervised Learning), các phương pháp tiếp cận với các thuật toán khác nhau và những hạn chế khi sử dụng dữ liệu chưa được gán nhãn. Bài viết Giới thiệu về Học bán giám sát xuất hiện lần đầu trên Towards Data Science.

Học máy Giới thiệu về Học bán giám sát Tổng quan về Học bán giám sát, các phương pháp tiếp cận với các thuật toán khác nhau và những hạn chế khi sử dụng dữ liệu chưa được gán nhãn. Carolina Bento Ngày 5/8/2026 9 phút đọc Chia sẻ (Ảnh của tác giả) Khi nghĩ về một phương pháp Học máy giải quyết bài toán Phân loại, tức là khi phải xác định lớp hoặc danh mục của một điểm dữ liệu cụ thể, có thể bạn sẽ nghĩ đến việc thu thập một tập dữ liệu huấn luyện mà mọi điểm dữ liệu đều được gán nhãn với lớp tương ứng. Nhóm thuật toán Học máy này được gọi là Học có giám sát. Tuy nhiên, dữ liệu là một trong những nút thắt lớn nhất khi huấn luyện một mô hình Học máy, và trong số các nút thắt khác có tài nguyên tính toán và thời gian cần thiết để huấn luyện mô hình. Biểu đồ kim tự tháp cổ điển, ở đây cho thấy một số nút thắt khi huấn luyện một mô hình học máy. (Ảnh của tác giả) Người ta cũng có thể lập luận rằng tất cả những hạn chế này đều quy về tiền bạc. Ví dụ, bạn cần tiền để mua hoặc đầu tư vào việc tạo thêm dữ liệu, để cung cấp phần cứng cho khối lượng tính toán cao hơn và thời gian bạn dành để huấn luyện và tinh chỉnh mô hình cũng đại diện cho chi phí cơ hội kinh doanh. Ngoài ra, có một số lĩnh vực vấn đề mà việc thu thập dữ liệu được gán nhãn chất lượng tốt là khó khăn. Ví dụ, việc thu thập dữ liệu để phân loại hình ảnh hoặc khám phá thuốc là khó và tốn kém. Để giải quyết thực tế là trong các vấn đề thực tế, dữ liệu được gán nhãn có thể khan hiếm, các nhà nghiên cứu đã phát triển một nhóm thuật toán Học máy mà, ngoài việc sử dụng dữ liệu được gán nhãn, còn có thể sử dụng các điểm dữ liệu chưa được gán nhãn để huấn luyện một bộ phân loại. Nhóm thuật toán Học máy này được gọi là Học bán giám sát. Học có giám sát so với Học bán giám sát Một bài toán Học có giám sát điển hình được mô tả toán học như sau: Định nghĩa toán học tập hợp các điểm dữ liệu được gán nhãn (Ảnh của tác giả) Bạn có một tập hợp các điểm dữ liệu được gán nhãn có kích thước l và mỗi điểm dữ liệu (xi, yi) là một đối tượng trong không gian X sao cho mỗi xi thuộc không gian X và được liên kết với một nhãn yi [1]. Nhãn yi là nhãn thực hoặc ground truth (sự thật cơ bản) cho điểm dữ liệu đó, trong trường hợp bài toán phân loại. Sau khi huấn luyện mô hình, bạn có thể cung cấp cho nó một điểm dữ liệu x* chưa từng thấy trước đây, và mô hình sẽ có thể dự đoán nhãn y* của nó. Điều này rất tốt nhưng, như đã đề cập trước đó, trong thế giới thực, bạn có thể không có đủ dữ liệu được gán nhãn để huấn luyện một mô hình với hiệu suất chấp nhận được cho trường hợp sử dụng của bạn. Vì vậy, một cách tiếp cận là tận dụng dữ liệu chưa được gán nhãn và do đó phát triển một mô hình Học máy bán giám sát, kết hợp: các điểm dữ liệu được gán nhãn, tức là những điểm mà nhãn thực (ground truth) đã biết các điểm dữ liệu chưa được gán nhãn, tức là không có thông tin về nhãn thực (ground truth) của chúng Định nghĩa toán học tập hợp các điểm dữ liệu được sử dụng trong các thuật toán Học máy bán giám sát (Ảnh của tác giả) Tại thời điểm này, bạn có thể đang nghĩ: Trong bất kỳ tình huống nào mà dữ liệu được gán nhãn khan hiếm hoặc đắt đỏ, tôi có thể chỉ cần thêm dữ liệu chưa được gán nhãn và mô hình của tôi sẽ tốt hơn? Sẽ thật tuyệt vời nếu bạn có thể có tập dữ liệu được gán nhãn nhỏ của mình và sau đó, chỉ bằng cách thêm một lượng lớn dữ liệu chưa được gán nhãn, xây dựng một mô hình tốt hơn theo cấp số nhân so với mô hình bạn đã xây dựng trước đó, chỉ với dữ liệu được gán nhãn. Không thể mặc định rằng việc bổ sung dữ liệu chưa được gán nhãn sẽ giúp thuật toán cải thiện hiệu suất. Liệu có phải nhiều dữ liệu hơn đồng nghĩa với thuật toán tốt hơn? Thực tế không đơn giản như vậy. Việc bổ sung một lượng lớn dữ liệu chưa được gán nhãn vào quá trình huấn luyện thuật toán không đủ để đảm bảo cải thiện khả năng dự đoán. Điều cần thiết là dữ liệu chưa được gán nhãn phải chứa thông tin hữu ích cho việc dự đoán nhãn, thông tin này chưa có trong dữ liệu đã được gán nhãn và không thể dễ dàng trích xuất từ đó. Trên thực tế, nhiều nghiên cứu đã đi sâu vào các kịch bản cụ thể mà việc bổ sung dữ liệu chưa được gán nhãn có thể hoặc không thể cung cấp thông tin hữu ích để cải thiện dự đoán [2]. Các giả định về dữ liệu cho học bán giám sát Để có thể sử dụng dữ liệu chưa được gán nhãn, cần thiết là phân phối biên p(x) cơ bản trên không gian đầu vào phải chứa thông tin về phân phối hậu nghiệm p(y|x) [1]. Nếu không, đã có bằng chứng cho thấy việc cải thiện độ chính xác dự đoán chỉ bằng cách bổ sung dữ liệu chưa được gán nhãn là gần như không thể [2]. Tóm lại, phân phối của dữ liệu chưa được gán nhãn cần tuân theo một tập hợp các giả định để cải thiện hiệu quả bộ phân loại [1]. Các thuật toán khác nhau sẽ tuân theo một hoặc nhiều giả định sau về dữ liệu: Giả định về độ mịn (Smoothness Assumption) Giả định về cụm (Cluster Assumption) Giả định về mật độ thấp (Low-Density Assumption) Giả định về đa tạp (Manifold Assumption) Hãy cùng tìm hiểu chi tiết hơn về từng giả định. Giả định về độ mịn Nếu hai mẫu x và x' gần nhau trong không gian đầu vào, thì nhãn y và y' của chúng phải giống nhau. Giả định này khẳng định rằng nếu khoảng cách Euclidean giữa hai điểm nhỏ, thì nhãn của chúng phải giống nhau [3]. Biểu diễn Giả định về độ mịn. Giả định về cụm Có thể sử dụng dữ liệu chưa được gán nhãn để tìm các cụm. Giả định này liên quan đến Giả định về độ mịn ở chỗ nó cho rằng có thể sử dụng dữ liệu chưa được gán nhãn để tìm các cụm dữ liệu và do đó, truyền nhãn cho các điểm dữ liệu chưa được gán nhãn nếu chúng nằm trong cùng một cụm với các điểm dữ liệu đã được gán nhãn [3]. Áp dụng nhãn một cách bắc cầu cho các điểm dữ liệu chưa được gán nhãn. Giả định về mật độ thấp Đường biên quyết định không nên đi qua các khu vực có mật độ cao trong không gian đầu vào. Đường biên quyết định là đường hoặc mặt phẳng vô hình phân tách các điểm dữ liệu thành các lớp hoặc nhãn khác nhau. Do đó, hợp lý khi một đường biên quyết định được vẽ và thực sự phân tách các nhóm điểm dữ liệu thành các lớp khác nhau, nó sẽ

Nguồn tin: Towards Data Science — Tác giả: Carolina Bento. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.