Cơ quan Hàng không và Vũ trụ Hoa Kỳ (NASA) và Tập đoàn IBM đã công bố Mô hình Nền tảng Mặt Trăng (Lunar Foundation Model), một trong những mô hình AI mã nguồn mở đầu tiên dành cho khoa học Mặt Trăng. Được huấn luyện trên gần 2 triệu gói dữ liệu ảnh lát (tile bundles), chủ yếu từ 17 năm dữ liệu của Tàu quỹ đạo Trinh sát Mặt Trăng (Lunar Reconnaissance Orbiter), mô hình này giúp giảm tới 22% sai số trong việc dự đoán các trầm tích băng ở cực so với mô hình mạnh nhất mà nó được thử nghiệm.
Bài viết "Mô hình Mặt Trăng mã nguồn mở của NASA và IBM biến 17 năm dữ liệu quỹ đạo thành nền tảng cho khoa học Mặt Trăng" xuất hiện lần đầu trên The Decoder.
Nghiên cứu AI
NASA và mô hình Mặt Trăng mã nguồn mở của IBM biến dữ liệu 17 năm từ tàu quỹ đạo thành nền tảng cho khoa học Mặt Trăng.
Jonathan Kemper
Ngày 4/10/2026
Mô hình nền tảng Mặt Trăng NASA-IBM giúp dữ liệu quan sát Mặt Trăng trong nhiều thập kỷ có thể sử dụng được cho học máy (machine learning). Mô hình này đặc biệt hiệu quả trong việc dự đoán các mỏ băng ở các cực và phát hiện các miệng hố.
Ông Kevin Murphy, Giám đốc dữ liệu khoa học của NASA, cho biết: "NASA đã dành nhiều thập kỷ để xây dựng một hồ sơ khoa học phi thường về Mặt Trăng, nhưng việc thu thập dữ liệu chỉ là một phần của công việc". Ông nói thêm rằng dữ liệu cũng cần dễ dàng hơn cho các nhà khoa học sử dụng. NASA và IBM Research, hợp tác với một số tổ chức học thuật, hiện đã công bố Mô hình nền tảng Mặt Trăng NASA-IBM. Hai tổ chức này mô tả đây là một trong những mô hình nền tảng mã nguồn mở đầu tiên cho khoa học Mặt Trăng.
Không giống như các thuật toán chuyên biệt, một mô hình nền tảng (foundation model) được huấn luyện trước trên một lượng lớn dữ liệu chưa được gắn nhãn và sau đó có thể được điều chỉnh cho các tác vụ cụ thể chỉ với một vài ví dụ được gắn nhãn. Nhóm nghiên cứu xem đây là lợi ích chính cho nghiên cứu Mặt Trăng, nơi dữ liệu quan sát phong phú nhưng nhãn lại khan hiếm.
Gần 2 triệu gói ô dữ liệu từ 17 năm quan sát
Nhóm nghiên cứu đã huấn luyện mô hình từ đầu bằng cách sử dụng SomBench, mà họ cho là kho dữ liệu Mặt Trăng đa phương thức được đăng ký đồng thời lớn nhất cho đến nay. Kho dữ liệu này chứa gần 2 triệu gói ô dữ liệu trên 11 phương thức và hai thang đo không gian. Khoảng 1 triệu hình ảnh độ phân giải cao đến từ Camera Góc Hẹp (NAC) với độ phân giải khoảng 1 mét/pixel, trong khi gần 964.000 hình ảnh đa phổ đến từ Camera Góc Rộng với độ phân giải 100 mét/pixel.
Phần lớn dữ liệu đến từ 17 năm quan sát của Tàu quỹ đạo Trinh sát Mặt Trăng (LRO). Theo NASA, khối lượng dữ liệu của LRO vượt quá tổng khối lượng dữ liệu của tất cả các nhiệm vụ hành tinh khác của NASA cộng lại. Dữ liệu từ nhiệm vụ GRAIL (trường hấp dẫn), Lunar Prospector (hydro) và tàu thăm dò Kaguya/SELENE của JAXA (khoáng vật học) đã bổ sung vào bộ sưu tập.
Tổng cộng, bộ dữ liệu này tập hợp hơn 30 lớp dữ liệu được căn chỉnh không gian từ chín thiết bị và bốn nhiệm vụ. Để ngăn chặn sự rò rỉ giữa dữ liệu huấn luyện, xác thực và kiểm tra, kho dữ liệu được chia theo địa lý theo các vùng bản đồ thay vì phân phối ngẫu nhiên các ô riêng lẻ.
Mô hình nhận điều kiện ánh sáng làm đầu vào thay vì phỏng đoán
Mô hình này dựa trên TerraMind, một mô hình quan sát Trái Đất đa phương thức, nhưng các nhà nghiên cứu đã huấn luyện nó từ đầu thay vì tinh chỉnh. Đối với mỗi ô dữ liệu, mô hình nhận hình học hình ảnh làm ngữ cảnh rõ ràng, bao gồm góc chiếu sáng, vị trí mặt trời và phạm vi ô dữ liệu. Trên Mặt Trăng, hình học ánh sáng định hình cách bề mặt trông như thế nào nhiều hơn so với các đặc tính thực tế của bề mặt. Thay vì buộc mô hình phải điều chỉnh điều này từ các pixel thô, nhóm nghiên cứu chỉ đơn giản cung cấp thông tin đó cho nó.
Mô hình phân tách hình ảnh Mặt Trăng, dữ liệu độ cao và hình học hình ảnh thành các token, sau đó học các mối quan hệ của chúng bằng cách dự đoán các phần bị che khuất. | Ảnh: NASA / IBM
Mô hình cũng học từ hình ảnh độ phân giải cao và thô cùng lúc trong một lần huấn luyện duy nhất, nắm bắt cả chi tiết nhỏ và ngữ cảnh quy mô lớn. Một kỹ thuật gọi là FlexiViT cho phép cùng một mô hình đã được huấn luyện thích ứng với các tác vụ có kích thước mảng hình ảnh khác nhau mà không cần huấn luyện lại.
Dự đoán băng là lĩnh vực mô hình vượt trội nhất.
Nhóm nghiên cứu đã thử nghiệm mô hình trong việc phát hiện miệng hố ở quy mô 100 mét và 1 mét, cũng như dự đoán các trầm tích băng ở cực. Mô hình cũng phải phân đoạn các Vùng Biển Bất Thường (IMPs - Irregular Mare Patches), là các đặc điểm núi lửa trẻ thách thức các mốc thời gian đã được thiết lập về quá trình nguội lạnh của Mặt Trăng. Theo báo cáo kỹ thuật, trên tất cả các tác vụ, mô hình được huấn luyện trước đã đạt hoặc vượt trội so với cả các mô hình cơ sở phổ biến và một mô hình kiểm soát có kiến trúc tương tự nhưng được khởi tạo ngẫu nhiên.
Mô hình nền tảng NASA-IBM tái tạo chính xác các mẫu chi tiết trong bản đồ tham chiếu về phân bố băng tiềm năng tại các cực Mặt Trăng. | Ảnh: NASA / IBM
Những cải tiến lớn nhất xuất hiện trong dự đoán trầm tích băng. Các vùng cực bị che khuất vĩnh viễn duy trì đủ lạnh để bảo tồn băng nước trong hàng tỷ năm và được coi là nguồn tài nguyên tiềm năng cho nước, oxy và nhiên liệu tên lửa. Theo IBM, mô hình đã giảm lỗi dự đoán tới 22% so với mô hình cơ sở tốt nhất, SwinV2-B.
Trong các ví dụ phát hiện miệng hố này, mô hình NASA-IBM và SwinV2-B được huấn luyện trước bằng ImageNet hoạt động tương tự. Tất cả các mô hình đều hoạt động kém hơn trên hình ảnh NAC độ phân giải cao. | Ảnh: NASA / IBM
Đối với việc phát hiện miệng hố quy mô thô, mô hình đã vượt trội SwinV2-B gần 19%, theo IBM. Con số đó đến từ việc huấn luyện chỉ với một nửa dữ liệu, cho thấy mô hình cần ít ví dụ được gắn nhãn hơn để hoạt động tốt.
Một phần lợi thế đến từ cách mô hình xử lý dữ liệu.
Ngay cả mô hình kiểm soát được khởi tạo ngẫu nhiên cũng đã đánh bại năm trong số bảy mô hình cơ sở trong dự đoán băng mà không cần huấn luyện trước về Mặt Trăng. Theo các nhà nghiên cứu, một phần lợi thế đến từ cách mô hình xử lý các loại dữ liệu khác nhau. Mô hình gán cho mỗi lớp dữ liệu một đường dẫn xử lý riêng, trong khi các mô hình cơ sở coi tất cả các đầu vào là các kênh xếp chồng lên nhau.
Khi phân đoạn các Vùng Biển Bất Thường, mô hình NASA-IBM đã phát hiện các khu vực trong ví dụ thứ hai mà cả hai mô hình cơ sở đều bỏ sót. | Ảnh: NASA / IBM
Trong việc phát hiện miệng hố quy mô mét và phân đoạn IMP, mô hình gần như ngang bằng với các mô hình cơ sở mạnh nhất, với sự khác biệt nằm trong phạm vi biến động giữa các lần huấn luyện. IBM tuyên bố dẫn trước 3% so với SwinV2-B trên IMP, nhưng kết quả trông tương đương hơn là rõ ràng tốt hơn.
Theo các nhà nghiên cứu, LoRA, một phương pháp tinh chỉnh nhẹ hơn chỉ huấn luyện một phần nhỏ các tham số, đã theo kịp việc tinh chỉnh hoàn toàn trên tất cả các lĩnh vực và hoạt động tốt hơn trong việc phát hiện miệng hố. Việc tinh chỉnh hoàn toàn
Nguồn tin: The Decoder — Tác giả: Jonathan Kemper. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.