Bỏ qua tới nội dung chính
Quay lại tin tức

Các tác nhân AI xây dựng cảnh 3D từ ảnh nhưng không biết liệu chúng có thực hiện đúng hay không.

The Decoder· Jonathan Kemper· 3/10/2026general

Một phương pháp mới có tên LEGO-Anything có khả năng biến các bức ảnh đơn lẻ thành mã Blender có thể chỉnh sửa được cho các cảnh 3D. GPT-6 Astra dẫn đầu bảng xếp hạng đi kèm với độ chính xác tái tạo lên tới 53%. Điểm yếu lớn nhất của tất cả các tác nhân được thử nghiệm là chúng không thể đánh giá độ chính xác hình học của chính mình tốt hơn việc tung đồng xu. Bài viết "Các tác nhân AI xây dựng cảnh 3D từ ảnh nhưng không biết liệu chúng có làm đúng hay không" lần đầu tiên xuất hiện trên The Decoder.

Cộng tác Nghiên cứu AI Sao chép URL vào khay nhớ tạm Chia sẻ bài viết này Chuyển đến phần bình luận Các tác nhân AI xây dựng cảnh 3D từ ảnh nhưng không biết liệu chúng có làm đúng hay không Jonathan Kemper Xem hồ sơ LinkedIn của Jonathan Kemper Ngày 3/10/2026 Nano Banana Pro được gợi ý bởi THE DECODER Các tác nhân lập trình có thể xây dựng một cảnh 3D có thể chỉnh sửa từ một bức ảnh duy nhất bằng cách viết và tinh chỉnh mã từng bước. Tiêu chuẩn đi kèm với công trình này cho thấy quá trình vẫn còn gặp khó khăn ở đâu: tự đánh giá và độ chính xác hình học. Một bản tái tạo 3D từ một bức ảnh duy nhất hữu ích nhất khi nó tồn tại dưới dạng một chương trình có thể thực thi mà người dùng có thể kiểm tra, chỉnh sửa và truy vấn. Đó là tiền đề đằng sau LEGO-Anything, một dự án từ các nhà nghiên cứu tại Đại học Maryland và AWS. LEGO-Anything có một tác nhân lập trình viết một chương trình Blender có thể thực thi từ một bức ảnh duy nhất. Cảnh kết quả có thể được chỉnh sửa và truy vấn cho các tác vụ phân tích hình ảnh. | Ảnh: Li et al. Phương pháp này được gọi là "Image-to-Code" (Ảnh thành Mã). Một tác nhân lập trình nhận một hình ảnh duy nhất và viết mã cho Blender, phần mềm 3D được sử dụng rộng rãi. Thay vì tạo cảnh trong một lần, tác nhân hoạt động lặp đi lặp lại: nó viết mã, chạy mã, xem kết quả và sửa đổi cho đến khi cảnh khớp với bản gốc. Vì đầu ra là một chương trình, nó nắm bắt các đối tượng, hình học, bố cục và vị trí camera một cách rõ ràng. Người dùng có thể chạy, kiểm tra và sửa đổi cảnh giống như bất kỳ đoạn mã nào khác. Các cảnh mô phỏng cung cấp dữ liệu gốc chính xác Để đo lường hiệu suất của các tác nhân, nhóm nghiên cứu giới thiệu LEGO-Bench. Nó chứa 208 hình ảnh từ 104 cảnh trong nhà và ngoài trời, sử dụng 443 tài sản đã đăng ký. Theo các nhà nghiên cứu, ảnh thật không cung cấp dữ liệu gốc 3D chính xác để so sánh. Các cảnh tổng hợp đơn giản trông không thực tế. Vì vậy, LEGO-Bench giải quyết vấn đề bằng cách kết xuất hình ảnh từ các cảnh mô phỏng được xây dựng chuyên nghiệp. Đầu vào trông tự nhiên, trong khi hình học, độ sâu và gán đối tượng chính xác vẫn được ẩn và đóng vai trò là khóa trả lời để chấm điểm tự động. Độ phức tạp của cảnh cũng có thể được tăng lên mà không thay đổi cài đặt ánh sáng hoặc camera. LEGO-Bench chấm điểm các cảnh dựa trên tính hợp lệ, độ chính xác hình học và sự tương đồng về mặt hình ảnh với bản gốc. | Ảnh: Li et al. Tiêu chuẩn này chấm điểm mỗi cảnh theo ba trục: tính hợp lệ kiểm tra xem một tạo phẩm cảnh có thể sử dụng được có được cung cấp hay không. Tái tạo đo lường độ chính xác của hình học hiển thị. Ngoại hình nắm bắt mức độ gần giống của giao diện với bản gốc bằng cách kết xuất lại cảnh đã gửi và so sánh từng pixel với hình ảnh tham chiếu. Các tác nhân cung cấp tạo phẩm có thể sử dụng nhưng gặp khó khăn về hình học Tất cả sáu cấu hình GPT được thử nghiệm đều cung cấp một cảnh hoạt động gần như mọi lúc. Tuy nhiên, độ chính xác thay đổi đáng kể. GPT-6 Astra, mô hình tốt nhất được thử nghiệm, đạt 53,4% trên các cảnh trong nhà và 39,6% trên các cảnh ngoài trời. Các cấu hình yếu hơn đạt khoảng 15%. GPT-6 Astra gần nhất với hình ảnh tham chiếu. Các mô hình cũ hơn thường bỏ sót góc camera, ánh sáng hoặc toàn bộ đối tượng. | Ảnh: Li et al. Cảnh càng phức tạp, độ chính xác càng giảm, và các cảnh ngoài trời khó hơn nội thất. Khi các nhà nghiên cứu tăng ngân sách suy luận của mô hình, các biến thể GPT-6 đã cải thiện rất nhiều. Điểm của Astra trên một tập hợp con thử nghiệm văn phòng đã tăng từ 32,3% lên 61,8%. Để hiểu rõ nguyên nhân, các nhà nghiên cứu đã phân tích các bước làm việc của các tác nhân (agent). Họ nhận thấy những nỗ lực ban đầu kém hiệu quả, các bản sửa đổi làm mất đi tiến bộ trước đó và khả năng tự đánh giá không đáng tin cậy là những vấn đề phổ biến nhất. Ngay cả GPT-6 Astra cũng làm hỏng cảnh của chính nó ở giai đoạn cuối quá trình, giảm từ 33,9 xuống 4,4 phần trăm. | Hình ảnh: Li et al. Điểm cuối cùng này là đáng chú ý nhất. Khi các mô hình phải chọn phiên bản nào trong hai phiên bản khớp với bản gốc tốt hơn, các đánh giá hình học của chúng đạt mức gần hoặc dưới mức ngẫu nhiên. Một tác nhân về cơ bản không thể biết liệu cảnh của chính nó có tốt hơn hay không. Các nhà nghiên cứu kết luận rằng việc tinh chỉnh nên dựa vào các phép đo cụ thể, chứ không phải sự đánh giá của chính tác nhân. Khi đánh giá hình học, các mô hình hoạt động ở mức gần ngẫu nhiên, ngay cả khi tự đánh giá các cảnh của chính chúng. | Hình ảnh: Li et al. Hiểu biết đó đã khiến các tác giả xây dựng LEGO-Plugin, một tiện ích mở rộng không cần đào tạo thêm. Nó neo cảnh ban đầu vào hình ảnh tham chiếu, thay thế khả năng tự đánh giá không đáng tin cậy bằng các phép đo cụ thể và bảo vệ tiến độ đúng đắn khỏi các chỉnh sửa thoái lui. Plugin này đã cải thiện tất cả sáu mô hình. Các tác nhân yếu hơn đạt được mức tăng lớn nhất, với mức tăng lên tới 62,7 phần trăm. Mô hình hàng đầu vốn đã mạnh chỉ tăng khoảng hai điểm phần trăm. Plugin cải thiện tất cả các mô hình đã thử nghiệm. Các tác nhân yếu hơn được hưởng lợi nhiều nhất. | Hình ảnh: Li et al. Các cảnh được tái tạo chưa đủ chính xác Cuối cùng, nhóm nghiên cứu đã kiểm tra xem liệu các cảnh được tái tạo có thể đóng vai trò là cơ sở cho các tác vụ thị giác tiêu chuẩn hay không. Vì mỗi cảnh là một chương trình có thể thực thi, nên việc phát hiện đối tượng, phân đoạn và ước tính độ sâu có thể được lấy trực tiếp từ đó. Mà không cần bất kỳ quá trình đào tạo bổ sung nào, các cảnh đã tạo ra kết quả có thể sử dụng được nhưng không nổi bật trên cả ba tác vụ. Phát hiện đối tượng hoạt động tốt nhất, với các cảnh được tái tạo đạt khoảng một nửa hiệu suất của mô hình chuyên biệt DINO. Đối với phân đoạn và ước tính độ sâu, khoảng cách đến các mô hình chuyên biệt như SAM 3 và Depth Anything 3 lớn hơn. Các tác giả cho biết các chương trình cảnh có thể thực thi từ các tác nhân lập trình hiện tại cho thấy tiềm năng nhưng chưa đủ chính xác. Một khoảng cách lớn vẫn tồn tại giữa một kết quả hoạt động và một bản tái tạo trung thực. Sự dẫn đầu vượt trội của GPT-6 Astra trong LEGO-Bench phù hợp với các quan sát khác. Nhà nghiên cứu AI Yoav Artzi xem mô hình này là một bước nhảy vọt lớn trong khả năng hiểu không gian và nghi ngờ rằng nó đã được đào tạo trên một lượng lớn dữ liệu 3D như các cảnh Blender. Các nhà sản xuất phần mềm 3D đã và đang chuẩn bị cho các loại tác nhân này. Unity đã phát hành các plugin chính thức cho Claude Code và Codex. Các phương pháp tiếp cận khác bỏ qua hoàn toàn mã và tái tạo cảnh trực tiếp bên trong mô hình, như At

Nguồn tin: The Decoder — Tác giả: Jonathan Kemper. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.