Bỏ qua tới nội dung chính
Quay lại tin tức

Các thử nghiệm toán học đang trở nên phổ biến nhờ sự hợp tác giữa con người và máy móc.

Towards Data Science· Sean Moran· 15/8/2026general

Hai vấn đề mở, kiểm tra số học chính xác và một trợ lý chứng minh, đã được giải quyết chỉ trong một cuối tuần. Bài viết "Các Thử Nghiệm Toán Học Đang Trở Nên Phổ Biến Nhờ Sự Phối Hợp Giữa Con Người và Máy Móc" xuất hiện lần đầu trên Towards Data Science.

Toán học Các thử nghiệm toán học đang trở nên phong phú nhờ sự hợp tác giữa người và máy Hai vấn đề mở, kiểm tra số học chính xác và một trợ lý chứng minh, được thực hiện trong một cuối tuần. Sean Moran Ngày 15/8/2026 29 phút đọc Minh họa khái niệm về quá trình tìm kiếm toán học, thể hiện các ý tưởng đã được khám phá, các nhánh đã bị loại bỏ, các hướng đi đầy hứa hẹn và các lĩnh vực chưa được khám phá trong việc chứng minh định lý và nghiên cứu toán học. Nguồn: hình ảnh của tác giả. Tôi đã kết thúc một cuối tuần gần đây mà không có ma trận Hadamard cấp 668 và với một định lý toán học mà tôi chưa đủ tin tưởng để gọi là một kết quả. Làm việc với GPT-5.6 Sol, các tác nhân song song, các chương trình số học chính xác và một trợ lý chứng minh, tôi đã giải quyết hai vấn đề khó trong hai ngày. Một vấn đề đã chống lại mọi cách tôi thử. Vấn đề còn lại đã tạo ra một ứng viên chứng minh: một lập luận thông thường được viết đầy đủ, các kiểm tra chính xác trên các đầu vào được chọn, một hướng dẫn giảng dạy và một hình thức hóa một phần trong Lean. Kết quả thứ hai đó vẫn chỉ là một ứng viên. Chưa có chuyên gia nào xem xét lập luận, tính mới của nó chưa được xác định, và Lean chỉ kiểm tra phần cốt lõi đại số của nó chứ không phải toàn bộ định lý. Tôi sẽ không công bố nó như một định lý mới ở trạng thái hiện tại. Cùng thời điểm đó, Anthropic báo cáo rằng một phiên bản nghiên cứu chưa được phát hành của Claude, mặc dù không giải được giả thuyết Riemann, đã cải thiện giới hạn dưới đã tồn tại từ lâu về tỷ lệ các điểm không của hàm zeta trên đường tới hạn từ 41,6% lên 67,2%. Kết quả này xuất hiện từ một quy trình nghiên cứu đa tác nhân bao gồm hàng trăm ý tưởng không thành công, hàng nghìn kiểm tra số học, xem xét tài liệu, hình thức hóa trong Lean và sau đó được các nhà toán học chuyên gia xem xét trước khi công bố. Quy mô và mức độ phức tạp toán học khác biệt rất lớn so với dự án cuối tuần của tôi, nhưng quy trình làm việc cơ bản lại tương tự đáng kể: tạo ra nhiều cách tiếp cận ứng viên, loại bỏ hầu hết chúng thông qua tính toán chính xác và phê bình, hình thức hóa những gì có thể hình thức hóa, và dành sự đánh giá của con người cho tính mới, tính đúng đắn và ý nghĩa. Quan sát quan trọng không phải là hệ thống nào đã giải quyết một vấn đề mở nổi tiếng. Mà là bản thân việc thử nghiệm toán học đang trở nên rẻ hơn đáng kể, trong khi việc chứng minh, hiểu biết, tính mới và đánh giá độc lập vẫn còn khan hiếm. Mô hình tôi rút ra từ cuối tuần là các thử nghiệm toán học đang trở nên phong phú. Dự án Hadamard đã đóng 44 vùng được xác định chính xác của không gian tìm kiếm và kiểm tra năm lộ trình tiêu chuẩn để chứng minh không tồn tại. Dự án Maxwell đã tạo ra một ứng viên chứng minh hoàn chỉnh với một cốt lõi đại số được máy kiểm tra. Kiến thức toán học được chấp nhận không trở nên rẻ hơn cùng với bất kỳ điều nào trong số đó, bởi vì việc chứng minh, hiểu biết, tính mới và đánh giá độc lập là những nghĩa vụ riêng biệt, và việc tạo ra một lộ trình khác không giải quyết được bất kỳ điều nào trong số đó. Đây là một phần tiếp theo cụ thể của hai ý tưởng trước đó. Trong bài viết "AI đã làm cho nghiên cứu trở nên rẻ. Sự hiểu biết vẫn còn đắt đỏ", tôi đã lập luận rằng AI đang làm cho việc thử nghiệm rẻ hơn nhiều so với sự hiểu biết. Trong bài viết "Từ Tokens đến Định lý: Xây dựng một nhà toán học AI Neuro-Symbolic", tôi đã xây dựng một vòng lặp neuro-symbolic đơn giản, trong đó một mô hình ngôn ngữ lớn (LLM) đề xuất các công thức toán học, SymPy kiểm tra chúng một cách chính xác, và các ứng viên thất bại trở thành phản hồi cho lần thử tiếp theo. Thử nghiệm đó được thực hiện một cách khiêm tốn có chủ đích, nhưng nó đã phơi bày một kiến trúc xuất hiện trở lại ở quy mô lớn hơn nhiều tại đây. Kiến trúc nghiên cứu tương tự đã được mở rộng vượt ra ngoài thí nghiệm thần kinh-biểu tượng trước đó. Thay vì một mô hình và một trình kiểm tra biểu tượng, tôi đã sử dụng các tác nhân song song, chương trình số học chính xác, các trình phê bình đối nghịch và một trợ lý chứng minh. Các cấu trúc và lập luận ứng viên được tạo ra, bị tấn công, kiểm tra khi có thể và sau đó bị loại bỏ hoặc giữ lại với trạng thái rõ ràng. Vòng lặp đã trở nên phong phú hơn khi các hệ thống AI được cải thiện trong suốt năm 2025 và 2026, nhưng cấu trúc cơ bản của nó vẫn giữ nguyên. Nhìn lại sau đó, tôi nhận ra quy trình làm việc này rất giống với một mô hình rộng hơn mà Jeff Dean gần đây đã mô tả cho khoa học và kỹ thuật. Thay vì coi AI là một công cụ để giải quyết từng vấn đề một, ông đã mô tả bản thân nghiên cứu như một chu trình lặp đi lặp lại: đề xuất một thí nghiệm, thực hiện và chạy nó, đánh giá kết quả, sau đó sử dụng đánh giá đó để tạo ra một thí nghiệm tốt hơn. Lập luận của ông là AI nên tự động hóa toàn bộ vòng lặp này, giảm thời gian lặp lại, chạy nhiều thí nghiệm song song và học hỏi từ mọi đánh giá. Đó gần như chính xác là những gì đã xảy ra trong suốt cuối tuần của tôi, mặc dù ở quy mô nhỏ hơn nhiều. Các thí nghiệm mang tính toán học hơn là vật lý. "Thực hiện" có nghĩa là các chương trình số học chính xác, bộ giải ràng buộc hoặc trợ lý chứng minh thay vì thiết bị phòng thí nghiệm. Đánh giá có nghĩa là xác minh số nguyên, tìm kiếm phản ví dụ và hình thức hóa một phần thay vì đo lường một hệ thống vật lý. Các tác nhân song song đã đề xuất các cấu trúc, tạo ra các trình xác minh, tìm kiếm tài liệu, phê bình các lập luận và dịch các ý tưởng sang các biểu diễn toán học khác nhau trước khi vòng lặp tiếp theo bắt đầu. Nhìn theo cách này, sự phát triển đáng chú ý nhất không phải là việc AI tạo ra một ứng viên chứng minh hay không thể xây dựng một ma trận Hadamard. Mà là chu trình thử nghiệm đã trở nên tự động hóa một phần. Một khi các trình đánh giá chính xác tồn tại, việc đề xuất, thực hiện và tinh chỉnh các thí nghiệm toán học trở nên rẻ hơn đáng kể. Sự khác biệt quan trọng không chỉ đơn thuần là về quy mô mà còn về xác thực. Trong thí nghiệm trước đó, một công thức ứng viên có thể được kiểm tra trực tiếp với chuỗi, mặc dù việc tái tạo các giá trị quan sát được không nhất thiết tiết lộ toán học cơ bản. Ở đây, việc xác minh trở nên nhiều lớp. Số học chính xác có thể từ chối các cấu trúc không chính xác, Lean có thể chứng nhận các phần của một lập luận, và tìm kiếm tài liệu có thể giúp thiết lập công trình trước đó, nhưng không có yếu tố nào có thể tự mình xác định tính mới, xác thực mọi cầu nối trong một chứng minh phổ quát hoặc quyết định liệu một kết quả có xứng đáng trở thành

Nguồn tin: Towards Data Science — Tác giả: Sean Moran. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.