
5 thư viện Python giúp việc dọn dẹp dữ liệu trở nên thú vị hơn
Bài viết này đề cập đến năm thư viện Python giúp biến việc dọn dẹp dữ liệu tẻ nhạt thành một thứ gì đó mang tính biểu cảm và thực sự thú vị.
-->
5 thư viện Python giúp việc dọn dẹp dữ liệu trở nên thú vị hơn - KDnuggets
-->
Blog
Bài viết hàng đầu
Giới thiệu
chủ đề
trí tuệ nhân tạo
Lời khuyên nghề nghiệp
Thị giác máy tính
Kỹ thuật dữ liệu
Khoa học dữ liệu
Mô hình ngôn ngữ
Học máy
MLOps
NLP
Lập trình
Python
SQL
Bộ dữ liệu
Sự kiện
Tài nguyên
Bảng cheat
Khuyến nghị
Tóm tắt công nghệ
Quảng cáo
Tham gia bản tin
5 thư viện Python giúp việc dọn dẹp dữ liệu trở nên thú vị hơn
Bài viết này đề cập đến năm thư viện Python giúp biến việc dọn dẹp dữ liệu tẻ nhạt thành một thứ gì đó mang tính biểu cảm và thực sự thú vị.
Bởi Bala Priya C, KDnuggets Biên tập viên đóng góp & Chuyên gia nội dung kỹ thuật vào ngày 17 tháng 8 năm 2026 bằng Python
-->
#Giới thiệu
Việc làm sạch dữ liệu hiếm khi thú vị nhưng nó tiêu tốn phần lớn thời gian của chuyên gia dữ liệu. Trước khi hiển thị bất kỳ mô hình tàu hoặc trang tổng quan nào, ai đó phải xử lý các tên cột không khớp, các giá trị rỗng nằm rải rác trên hàng tỷ hàng, sự không nhất quán về loại dữ liệu, bản ghi trùng lặp và các chuỗi gần như khớp nhưng thực tế thì không.
Gấu trúc tiêu chuẩn xử lý rất nhiều việc này, nhưng ở quy mô lớn, với dữ liệu trong thế giới thực phức tạp, lộn xộn, nó trở nên dài dòng, chậm và nhanh dễ mắc lỗi. Các thư viện trong bài viết này tăng tốc mọi thứ và giới thiệu các tính năng trừu tượng tốt hơn, các giá trị mặc định thông minh hơn và các API giúp mục đích rõ ràng hơn.
Bài viết này bao gồm các thư viện xử lý:
Phát hiện và khắc phục nhanh chóng các sự cố về cấu trúc trong DataFrames
Chuẩn hóa chuỗi lộn xộn và dữ liệu phân loại ở quy mô lớn
Cấu hình các tập dữ liệu để giải quyết các vấn đề về chất lượng trước khi chúng gây ra lỗi
Thực thi các lược đồ và xác thực dữ liệu ở ranh giới đường ống
Làm sạch và định hình lại dữ liệu lộn xộn với bản soạn sẵn tối thiểu
Bây giờ chúng ta hãy khám phá từng thư viện.
# 1. pyjanitor để làm sạch khung dữ liệu trôi chảy, có thể xâu chuỗi
pyjanitor là một gói Python được xây dựng dựa trên gấu trúc, bổ sung API dựa trên động từ, rõ ràng cho các tác vụ dọn dẹp dữ liệu thông thường. Nó cho phép bạn xâu chuỗi các thao tác — đổi tên cột, loại bỏ giá trị rỗng, mã hóa phân loại, lọc hàng — tất cả trong một quy trình duy nhất có thể đọc được thay vì phân tán các đột biến trên nhiều câu lệnh gán.
Nó mở rộng gấu trúc bằng cách sử dụng mô hình chuỗi phương thức, do đó không có mô hình tinh thần mới nào để áp dụng. Trong pyjanitor:
Chuỗi phương thức thay thế các chuỗi phép gán df = df[...] bị phân mảnh, khó đọc bằng một đường dẫn khai báo duy nhất.
clean_names() viết thường, loại bỏ khoảng trắng và xóa các ký tự đặc biệt khỏi tiêu đề cột trong một lệnh gọi.
thu gọn_levels() làm phẳng các cột MultiIndex được tạo bởi các hoạt động nhóm thành các tên chuỗi đơn giản.
Các phép nối có điều kiện, các phép biến đổi cấp hàng và các tiện ích giá trị còn thiếu đều có sẵn dưới dạng các phương thức có thể xâu chuỗi.
Tài nguyên học tập: Tài liệu API pyjanitor rất kỹ lưỡng và dựa trên ví dụ. 10 chức năng linh tinh của PyJanitor để tăng cường làm sạch dữ liệu | AskPython cũng là một nguồn tài nguyên hữu ích.
# 2. Kỳ vọng lớn vào việc xác thực và kiểm tra chất lượng dữ liệu
Những kỳ vọng lớn là một khung chất lượng dữ liệu cho phép bạn xác định, ghi lại và thực thi những kỳ vọng về dữ liệu của bạn sẽ trông như thế nào. Thay vì viết các câu lệnh xác nhận một lần không thành công trong quá trình sản xuất, bạn xây dựng một bộ kiểm tra có tên bao gồm các loại cột, phạm vi giá trị, tỷ lệ rỗng và tính toàn vẹn tham chiếu — các kiểm tra chạy theo từng lô dữ liệu đến.
Nó tích hợp với cơ sở dữ liệu pandas, Spark và SQL, đồng thời tạo ra các báo cáo xác thực mà con người có thể đọc được và có thể chia sẻ với các bên liên quan phi kỹ thuật. Mô hình kỳ vọng khai báo cũng đóng vai trò như tài liệu sống: thông số kỹ thuật cho bất kỳ ai đọc nó biết chính xác "dữ liệu sạch" nghĩa là gì đối với một giai đoạn quy trình nhất định. Dưới đây là tổng quan về các tính năng:
Các kỳ vọng bao gồm sự hiện diện của cột, ràng buộc về loại, phạm vi giá trị, tính duy nhất, mẫu biểu thức chính quy và kiểm tra phân phối.
Kết quả xác thực được hiển thị dưới dạng báo cáo HTML có thể duyệt được với phân tích đạt/không đạt theo kỳ vọng.
Tài liệu dữ liệu tự động tạo tài liệu dữ liệu từ bộ dự kiến của bạn, giữ cho thông số kỹ thuật được đồng bộ hóa với cơ sở mã.
Điểm kiểm tra cho phép bạn chạy xác thực dưới dạng một bước trong Airflow, Prefect hoặc bất kỳ quy trình điều phối nào.
Tài nguyên học tập: Các trường hợp sử dụng chất lượng dữ liệu | Kỳ vọng lớn bao gồm hầu hết tất cả các trường hợp sử dụng mà bạn cần.
# 3. ftfy để khắc phục sự cố mã hóa văn bản và Unicode bị hỏng
ftfy hoặc "sửa văn bản cho bạn" là một thư viện nhỏ, tập trung để sửa chữa mojibake, mã hóa không chính xác và Unicode bị sai lệch xuất hiện trong dữ liệu văn bản trong thế giới thực. Nếu bạn đã từng thấy các ký tự có dấu bị cắt xén từ tệp CSV được xuất qua Excel, thì ftfy sẽ xử lý vấn đề đó.
Thư viện có một mục đích duy nhất: lấy văn bản bị hỏng và trả lại phiên bản gần như chắc chắn đã được dự định. Trọng tâm đó khiến nó trở nên cực kỳ hữu ích khi xây dựng các quy trình tiếp thu nội dung do người dùng tạo, dữ liệu web cóp nhặt hoặc các bản ghi đã đi qua nhiều hệ thống cũ. ftfy xử lý như sau:
Phát hiện và sửa các lỗi mã hóa do bộ ký tự được mã hóa kép hoặc xác định sai.
Xử lý mojibake từ các nguồn phổ biến.
Chuẩn hóa Unicode thành các dạng nhất quán, loại bỏ các ký tự vô hình và khoảng trắng có độ rộng bằng 0 làm hỏng kết quả khớp xuôi dòng.
Chạy dưới dạng lệnh gọi ftfy.fix_text(s) đơn giản mà không cần cấu hình trong hầu hết các trường hợp sử dụng.
Tài nguyên học tập: Tài liệu ftfy bao gồm giải thích rõ ràng về lý do tại sao những vấn đề mã hóa này lại xảy ra ngay từ đầu. ftfy GitHub README hiển thị các chế độ lỗi phổ biến nhất với các ví dụ trước và sau.
# 4. lập hồ sơ ydata để kiểm tra tập dữ liệu tức thì
hồ sơ ydata, trước đây là hồ sơ gấu trúc, tạo báo cáo phân tích dữ liệu khám phá (EDA) toàn diện từ bất kỳ DataFrame nào trong một dòng mã. Nó hiển thị các giá trị bị thiếu, các hàng trùng lặp, phân phối sai lệch, phân loại lượng số cao, mối tương quan và các giá trị ngoại lệ - danh sách kiểm tra đầy đủ về những thứ mà bạn sẽ kiểm tra bằng cách khác
Nguồn tin: KDnuggets — Tác giả: Bala Priya C. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.