
Stripe Sử dụng Tìm kiếm đồ thị và Máy trạng thái để Tự động hóa Khắc phục sự cố cơ sở dữ liệu
Đội ngũ kỹ sư tại Stripe gần đây đã mô tả cách họ tự động hóa việc khôi phục sự cố cơ sở dữ liệu bằng cách mô hình hóa cơ sở hạ tầng toàn cầu của họ dưới dạng đồ thị. Sử dụng các thuật toán tìm kiếm đồ thị cùng với máy trạng thái, đội ngũ này tính toán và thực thi các kế hoạch khắc phục một cách tự động.
Trang chủ InfoQ
Tin tức
Stripe sử dụng tìm kiếm đồ thị và máy trạng thái để tự động khắc phục sự cố cơ sở dữ liệu
AI, ML & Kỹ thuật dữ liệu
Stripe sử dụng tìm kiếm đồ thị và máy trạng thái để tự động khắc phục sự cố cơ sở dữ liệu
Ngày 09/8/2026
Thời gian đọc: 2 phút
Bởi
Renato Losio
Theo dõi chúng tôi trên
Youtube 232N người theo dõi
Linkedin 26N người theo dõi
Instagram Mới
RSS 19N độc giả
X 57,1N người theo dõi
Facebook 21N lượt thích
Bluesky Mới
Nghe bài viết này - 0:00
Âm thanh sẵn sàng phát
Trình duyệt của bạn không hỗ trợ phần tử âm thanh.
0:00
0:00
Bình thường 1.25x 1.5x
Thích
Danh sách đọc
Đội ngũ kỹ sư tại Stripe gần đây đã mô tả cách họ tự động phục hồi sự cố cơ sở dữ liệu bằng cách mô hình hóa cơ sở hạ tầng toàn cầu của họ dưới dạng đồ thị. Sử dụng các thuật toán tìm kiếm đồ thị cùng với máy trạng thái, đội ngũ này tính toán và thực hiện các kế hoạch khắc phục tự động.
Theo các tác giả, hệ thống hiện thích ứng linh hoạt với các bố cục phân mảnh MongoDB khác nhau, giảm khoảng 30% cảnh báo từ hệ thống phân trang liên quan đến cơ sở dữ liệu. Điều này tương đương với việc giảm 200 trang mỗi năm, đồng thời loại bỏ ước tính 12 ngày trạng thái phân mảnh không lành mạnh hàng năm.
Stripe nhận thấy rằng hệ thống khắc phục dựa trên plugin được mã hóa cứng ban đầu của họ không mở rộng tốt, vì các phụ thuộc dễ vỡ, các kịch bản đa lỗi phức tạp, logic cụ thể theo bố cục và các trạng thái trung gian không được xử lý thường xuyên đòi hỏi sự can thiệp thủ công. Các tác giả thừa nhận:
Trong khoảng thời gian sáu tháng, mặt phẳng điều khiển đã thông báo cho các nhà điều hành 124 lần về các phân mảnh được cấu hình sai và 32 lần về các kịch bản một nút bị lỗi phức tạp do các vấn đề sức khỏe bổ sung. Các hoạt động quan trọng như xây dựng chỉ mục và bảo trì theo kế hoạch đã bị chặn trung bình một giờ mỗi sự cố.
Stripe đã giải quyết những hạn chế này bằng cách mô hình hóa cơ sở hạ tầng MongoDB của họ dưới dạng đồ thị, trong đó các nút đại diện cho các thành phần cơ sở hạ tầng, các cạnh ghi lại mối quan hệ của chúng và các thuộc tính nút mô tả trạng thái hiện tại của chúng.
Loại bỏ các chuỗi khắc phục được mã hóa cứng trước đây, Stripe hiện dựa vào việc duyệt đồ thị để xác định các đường dẫn phục hồi hợp lệ, cho phép cùng một logic khắc phục tự động thích ứng với các bố cục cơ sở dữ liệu khác nhau và cơ sở hạ tầng đang phát triển.
Ban đầu, Stripe sử dụng thuật toán tìm kiếm theo chiều rộng (BFS) để tìm các đường dẫn khắc phục hợp lệ. Tuy nhiên, sau đó, công ty đã áp dụng thuật toán Dijkstra để ưu tiên các kế hoạch khôi phục có chi phí thấp hơn, nhằm giảm thiểu các thao tác không cần thiết nhưng vẫn đảm bảo tính chính xác.
Do thuật toán Dijkstra khám phá các đường dẫn đến tất cả các trạng thái có thể đạt được thay vì chỉ trạng thái mục tiêu, chúng ta cũng có thể thực hiện khắc phục một phần. Khi không có đường dẫn hoàn chỉnh, thuật toán sẽ trả về đường dẫn đến trạng thái ít bị cấu hình sai nhất.
Thay vì nhúng logic khôi phục vào các quy trình làm việc cố định, Stripe mô hình hóa việc khắc phục dưới dạng các quy tắc có thể kết hợp với các chuyển đổi trạng thái rõ ràng, cho phép công cụ lập kế hoạch kết hợp các hoạt động một cách linh hoạt khi cơ sở hạ tầng phát triển. Theo bài báo, nhóm nghiên cứu dự định mở rộng khuôn khổ này vượt ra ngoài việc khôi phục lỗi để tự động hóa các thay đổi cấu trúc liên kết và triển khai blue-green, cũng như điều phối việc bảo trì theo kế hoạch cùng với việc khắc phục phản ứng. Nhóm kết luận:
Đối với các nhóm quản lý cơ sở hạ tầng phân tán phức tạp, mô hình hóa máy trạng thái, lập kế hoạch dựa trên mô phỏng và tìm đường dẫn trong thời gian chạy này mang đến một giải pháp thay thế hấp dẫn cho việc tích lũy ngày càng nhiều các runbook (sổ tay vận hành) cụ thể. Runbook mã hóa các quy trình khôi phục đã biết; một máy trạng thái khám phá những quy trình mới.
Stripe không phải là công ty phần mềm lớn duy nhất đầu tư vào các hoạt động cơ sở hạ tầng tự động. Uber gần đây đã mô tả nền tảng Odin tự phục hồi, khai báo của mình, trong khi Meta đã trình bày chi tiết các công cụ hỗ trợ AI để tăng tốc phản ứng sự cố. Scott MacVicar, người đứng đầu bộ phận cơ sở hạ tầng nhà phát triển tại Stripe, viết trên LinkedIn:
Vận hành một hệ thống cơ sở dữ liệu toàn cầu đồng nghĩa với việc chấp nhận rằng sự xuống cấp phần cứng và các phân đoạn không lành mạnh là những sự cố hàng ngày. Ở quy mô lớn, thách thức không chỉ là khắc phục sự cố. Đó là làm điều đó mà không làm kiệt sức các kỹ sư trực ban của bạn.
Nhóm kỹ sư tại Stripe cũng đã xuất bản các bài báo gần đây về phân tách quỹ trong Stripe Connect và trình xử lý thông báo sự kiện để xử lý các sự kiện mỏng.
/filters:no_upscale()/news/2026/08/database-remediation-graph/en/resources/24image2-1785182595594.png)
Nguồn tin: InfoQ AI — Tác giả: Renato Losio. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.