
Nhập AI 469: Khoa học AI; Trình mô phỏng RSI; và sự bi quan về công nghệ của Zuck
Chào mừng bạn đến với Import AI, bản tin về nghiên cứu AI. AI nhập khẩu chạy trên arXiv, cappuccino và phản hồi từ độc giả. Nếu bạn muốn hỗ trợ điều này, xin vui lòng đăng ký. Đăng ký ngay bây giờ DiG-bench cho thấy Fable thể hiện một số trực giác sáng tạo: …Biên giới mới cho việc phân tích các hệ thống AI là hiểu được khả năng của chúng trong việc suy ra các quy tắc bất thành văn trong môi trường của chúng… Các hệ thống AI có thể tìm ra các quy tắc môi trường của chúng tốt đến mức nào thông qua việc khám phá và tò mò thay vì được cho ăn? Đó là một câu hỏi quan trọng để hiểu rõ hơn về tính trực quan và sáng tạo.
Chào mừng bạn đến với Import AI, bản tin về nghiên cứu AI. AI nhập khẩu chạy trên arXiv, cappuccino và phản hồi từ độc giả. Nếu bạn muốn hỗ trợ điều này, xin vui lòng đăng ký.
Đăng ký ngay bây giờ
DiG-bench cho thấy Fable thể hiện một số trực giác sáng tạo:
…Biên giới mới cho việc phân tích các hệ thống AI là hiểu được khả năng của chúng trong việc suy ra các quy tắc bất thành văn trong môi trường của chúng…
Các hệ thống AI có thể tìm ra các quy tắc môi trường của chúng tốt đến mức nào thông qua việc khám phá và tò mò thay vì được cho ăn? Đó là một câu hỏi quan trọng để hiểu rõ hơn về khả năng trực quan và sáng tạo của các hệ thống AI và đó là câu hỏi do DiG-bench (Discovery in Games), một chuẩn mực mới của 70 trò chơi “được thiết kế để lập bản đồ bề mặt khám phá trong các hệ thống tương tác được kiểm soát tốt”. Tương tự như trò chơi ‘ARC’ trực quan, trong DiG-bench “mỗi trò chơi là một thế giới thu nhỏ khép kín với những quy luật riêng, nhưng cả quy tắc và mục tiêu đều bị ẩn khỏi người chơi và phải được khám phá thông qua tương tác”. Bạn có thể tự mình chơi một số trò chơi trực tuyến để cảm nhận về chúng tại trang web chính thức của dự án (digbench.ai).
Điều quan trọng mà phương pháp này đo lường là khả năng người chơi phát hiện ra các cơ chế quan trọng quyết định thành công của họ - về cơ bản, bằng cách chơi thử các trò chơi, bạn sẽ hiểu được hành động của mình thay đổi môi trường như thế nào và thông qua đó, bạn cũng khám phá ra các cơ chế mà bạn phải hiểu để thành công trong trò chơi. Ý tưởng là nếu bạn có thể giải được những trò chơi này, bạn có khả năng tốt trong việc phát hiện thông tin quan trọng trong môi trường mới và cập nhật thông tin quan trọng của mình.
Ai thực hiện nghiên cứu: Các tác giả đến từ Nghĩ về tư duy, Đại học Oxford, Đại học Princeton, Đại học Khoa học và Công nghệ King Abdullah, Phòng thí nghiệm AI Thụy Sĩ, Inria, MIT. Một trong những tác giả là Juergen Schmidhuber, một nhà nghiên cứu OG AI cực kỳ sáng tạo.
Thông tin chính:
Hoàn toàn dựa trên văn bản: Các trò chơi về cơ bản đều có nguồn gốc từ các mô hình ngôn ngữ. Chúng cũng hầu hết “đủ ngắn để hầu hết các dấu vết nằm hoàn toàn trong cửa sổ ngữ cảnh của các mô hình biên giới hiện tại”.
Được làm thủ công, mới lạ và riêng tư: Tất cả những trò chơi này đều được xây dựng bởi các chuyên gia của con người. Phần lớn các trò chơi được giữ ở chế độ riêng tư để hệ thống AI không đào tạo về chúng.
Có thể đánh bại nhưng khó: Mọi trò chơi đều bị ít nhất một người đánh bại “nhưng người chơi cho biết họ thấy nhiều trò chơi khó”.
Kỹ năng đa dạng: Việc giải quyết tất cả các trò chơi này đòi hỏi những kỹ năng và chiến lược khác nhau.
Thử nghiệm: Trò chơi có chế độ thử nghiệm tùy chọn cho phép mọi người chơi đùa với chúng mà không gặp phải “giới hạn bước” quá khắt khe đối với các hành động mà họ có thể thực hiện.
Độ khó chắc chắn: Các trò chơi đủ khó để các mô hình tiên tiến ngày nay không thể đánh bại được.
Hệ thống AI hoạt động tốt như thế nào? Điểm chuẩn được chia thành bảy cấp với cấp 1 là dễ nhất và cấp 7 là khó nhất. 21 trò chơi đã được phát hành công khai, số còn lại bị giữ lại. Hầu hết các trò chơi đều có nhiều cấp độ và số lượng hành động có sẵn để người chơi thực hiện ở mỗi bước từ 2 đến 34.
Opus 5 và Fable 5 với Claude Code là những mô hình tổng thể tốt nhất, tiếp theo là GPT-5.5
Chỉ Opus 5 và Fable 5 mới có thể đánh bại bất kỳ nhiệm vụ nào (0,2) trong (Cấp 7). Opus 5, GPT-5.5 và Kimi K3 có thể hoàn thành một số nhiệm vụ ở Cấp 6 khi được cấp quyền truy cập vào dây nịt (ví dụ: Mã Claude).
GLM-5.2 và Gemini 3.1 Pro có thể vượt qua một số cấp độ ở Cấp 4.
Nhìn chung, điều này có vẻ thực sự khó khăn!
Tại sao điều này lại quan trọng - proxy cho sự sáng tạo và khám phá: Các thử nghiệm như thế này là nỗ lực nhằm tách biệt điều kiện tiên quyết cho sự sáng tạo, tức là khả năng tự động khám phá những điều hữu ích không có tài liệu về các tình huống mới lạ mà bạn gặp phải. Như thử nghiệm này cho thấy, một số mô hình tiên phong đã có khả năng đạt được một số thành tích khám phá khá ấn tượng nhưng vẫn gặp khó khăn so với con người (ví dụ: tỷ lệ thành công 20% ở Cấp 7 là khá kém so với thực tế là từng cá nhân có thể đạt 100% trong các bài kiểm tra). Tôi đoán là chúng ta sẽ đạt được mức ngang bằng của con người trên DiG-bench vào giữa năm 2027, tại thời điểm đó, chúng ta nên mong đợi những thứ như quá trình tự cải thiện đệ quy sẽ bắt đầu một cách nghiêm túc.
Đọc thêm: DiG-bench: Khám phá trong trò chơi (GitHub, PDF).
Chơi trò chơi và xem bảng xếp hạng tại trang web chính thức (digbench.ai).
***
Cảm nhận khả năng tự cải thiện đệ quy bằng cách chơi trò chơi dựa trên trình duyệt này:
…Cookie Clicker, nhưng đối với điểm kỳ dị…
Đây là một trò chơi thú vị của những người ở Paradigm Research nhằm mục đích mô phỏng việc điều hành một công ty đang xây dựng các hệ thống AI có khả năng tự cải thiện đệ quy. Nếu chơi trò chơi, bạn có thể hiểu rõ về cách các thành phần khác nhau của nghiên cứu AI tương tác với nhau, từ cách bạn cân bằng giữa đầu tư vào nhà nghiên cứu và tính toán, cách thức và thời điểm cấp phép cho dữ liệu, v.v. Hãy cảnh báo, điều đó rất khó - nhưng một lần nữa, việc phát triển AI biên giới cũng vậy.
Tại sao điều này lại quan trọng: Phát triển trực giác tốt hơn về quá trình tự cải thiện bản thân bằng phương pháp đệ quy có tầm quan trọng hiện hữu đối với tất cả chúng ta; những trò chơi như thế này giúp chúng ta dễ dàng suy luận hơn về công nghệ này và các phòng thí nghiệm xây dựng nó.
Chơi trò chơi tại đây: Trình mô phỏng RSI (Nghiên cứu mô hình).
***
Các hệ thống AI đang có những dấu hiệu ban đầu về sở thích nghiên cứu khoa học:
…Inherent hậu đào tạo một mô hình trọng lượng mở thành một nhà khoa học AI giám sát mô hình biên giới…
Hương vị là một thứ khó định lượng nhưng là thứ trực quan để cảm nhận, như bất kỳ ai trong chúng ta đều biết ai đã từng ngồi trong một căn phòng được thiết kế đẹp mắt, nhìn ai đó mặc một bộ đồ vừa vặn hoặc đọc một bài báo nghiên cứu chỉ đặt ra những câu hỏi phù hợp. Giờ đây, các nhà nghiên cứu của công ty khởi nghiệp AI Inherent đã xuất bản một bài báo cho thấy cách họ đang xây dựng Faraday, một mô hình nhà khoa học AI mà họ hy vọng có thể phát triển một số hương vị về mặt nghiên cứu.
Những gì họ đã làm: Công ty đã xây dựng một hệ thống khai thác giám sát và LLM tương đối nhỏ đặt trên các f lớn, độc quyền.
Nguồn tin: Import AI Newsletter — Tác giả: Jack Clark. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.