Các nhà nghiên cứu tại Đại học Carnegie Mellon đã phát triển một phương pháp mới để tạo ra các hình ảnh 3D có độ phân giải cao từ các mô hình ngôn ngữ lớn (LLM) như Stable Diffusion. Phương pháp này, được gọi là "Diffusion-backed Neural Radiance Fields" (DiffRF), kết hợp sức mạnh của các mô hình khuếch tán (diffusion models) với các trường bức xạ thần kinh (NeRF) để tạo ra các cảnh 3D chi tiết và chân thực.
DiffRF hoạt động bằng cách sử dụng mô hình khuếch tán để tạo ra nhiều hình ảnh 2D từ các góc độ khác nhau của một đối tượng hoặc cảnh. Sau đó, các hình ảnh này được đưa vào một mạng NeRF, mạng này sẽ học cách tái tạo lại hình dạng và kết cấu 3D của đối tượng. Kết quả là một mô hình 3D có thể được xem từ bất kỳ góc độ nào, với độ chi tiết và chân thực cao.
Một trong những lợi ích chính của DiffRF là khả năng tạo ra các mô hình 3D từ các mô tả văn bản đơn giản. Điều này có nghĩa là người dùng có thể nhập một mô tả như "một chiếc xe thể thao màu đỏ" và DiffRF sẽ tạo ra một mô hình 3D của chiếc xe đó. Điều này mở ra nhiều khả năng mới cho các ứng dụng như thiết kế sản phẩm, trò chơi điện tử và thực tế ảo.
Các nhà nghiên cứu đã thử nghiệm DiffRF trên nhiều loại đối tượng và cảnh khác nhau, bao gồm các vật thể đơn giản, kiến trúc phức tạp và thậm chí cả con người. Kết quả cho thấy DiffRF có thể tạo ra các mô hình 3D chất lượng cao, vượt trội so với các phương pháp hiện có.
DiffRF vẫn đang trong giai đoạn phát triển, nhưng nó đã cho thấy tiềm năng to lớn trong việc cách mạng hóa cách chúng ta tạo và tương tác với nội dung 3D. Với khả năng tạo ra các mô hình 3D từ các mô tả văn bản, DiffRF có thể giúp các nhà thiết kế, nghệ sĩ và nhà phát triển tạo ra các trải nghiệm 3D phong phú và hấp dẫn hơn.
Các nhà nghiên cứu đã công bố mã nguồn và dữ liệu của DiffRF trên GitHub, cho phép các nhà nghiên cứu và nhà phát triển khác khám phá và xây dựng dựa trên công trình của họ.