Bỏ qua tới nội dung chính
Quay lại tin tức

Dyna Robotics giới thiệu Dyna-2: Mô hình hành động thế giới được huấn luyện trước trên 1 triệu giờ video con người

MarkTechPost· Asif Razzaq· 13/8/2026general

Dyna Robotics đã công bố Dyna-2, một mô hình hành động thế giới (world-action model) dành cho thao tác robot. Mô hình này được huấn luyện trước (pre-trained) trên hơn một triệu giờ video người nhìn từ góc độ thứ nhất (egocentric human video). Con số này tương đương khoảng 170 năm trải nghiệm thức liên tục. Học máy robot đã bị hạn chế bởi dữ liệu được gán nhãn hành động (action-labelled data), vốn phải được tạo ra một cách có chủ đích thông qua điều khiển từ xa (teleoperation). Dyna-2 kiểm tra liệu video người thông thường có thể thay thế dữ liệu này hay không. Nhóm nghiên cứu đã huấn luyện một "thang dữ liệu" (data ladder) từ 1.000 đến 1.000.000 giờ và đo lường những gì có thể mở rộng. Ba kết quả sau đây đã được ghi nhận: một quy luật mở rộng (scaling law) trên dữ liệu người, lần đầu tiên quy luật đó được chuyển giao cho dữ liệu robot chưa từng thấy, và bằng chứng cho thấy

Dyna Robotics đã công bố Dyna-2, một mô hình hành động thế giới (world-action model) dành cho thao tác robot. Mô hình này được huấn luyện trước (pre-trained) trên hơn một triệu giờ video người quay từ góc nhìn thứ nhất (egocentric human video). Con số này tương đương khoảng 170 năm trải nghiệm thức liên tục. Việc học của robot đã bị tắc nghẽn bởi dữ liệu được gán nhãn hành động, vốn phải được tạo ra một cách có chủ đích thông qua điều khiển từ xa (teleoperation). Dyna-2 thử nghiệm liệu video thông thường của con người có thể thay thế dữ liệu này hay không. Nhóm nghiên cứu đã huấn luyện một "thang dữ liệu" từ 1.000 đến 1.000.000 giờ và đo lường những gì có thể mở rộng. Ba kết quả sau đây đã được ghi nhận: một quy luật mở rộng trên dữ liệu con người, lần đầu tiên áp dụng quy luật đó cho dữ liệu robot chưa từng thấy, và bằng chứng cho thấy dự đoán video thúc đẩy sự chuyển giao này. Liệu có thể triển khai? Có, nhưng dưới dạng một hệ thống do nhà cung cấp vận hành, không phải dưới dạng các trọng số (weights) có thể tải xuống. Dyna Robotics chưa công bố bất kỳ điểm kiểm tra (checkpoint) công khai, API hay giấy phép nào cho Dyna-2. Việc triển khai hiện nay có nghĩa là mua một cụm robot Dyna, chứ không phải tự lưu trữ (self-hosting) một mô hình. Các công ty nào: Robot Dyna-1 đã hoạt động trong sản xuất tại các khách sạn, nhà hàng và tiệm giặt là, theo thông báo ngày 10/8/2026 của công ty. Điều này cho thấy đối tượng khách hàng là các nhà khai thác dịch vụ tầm trung và các doanh nghiệp đa địa điểm với công việc thao tác lặp đi lặp lại, cố định. Nó không phù hợp với các nhà phát triển độc lập hoặc các phòng thí nghiệm nghiên cứu muốn suy luận cục bộ (local inference). Các ngành công nghiệp: Khách sạn, giặt là thương mại, dịch vụ ăn uống, lắp ráp và đóng gói nhẹ, và vệ sinh cơ sở vật chất. Các ứng dụng: 14 tác vụ sau huấn luyện (post-training tasks) tương ứng rõ ràng với công việc thực tế: dọn khay rác, chuẩn bị bộ sơ cứu, lắp ráp túi đựng đồ, múc thức ăn, buộc dây, chuẩn bị móc treo và lấy đồ uống có mục tiêu từ tủ lạnh. Dyna-2 là gì Dyna-2 là một mô hình hành động thế giới (WAM): một mô hình tạo sinh (generative model) khử nhiễu video tương lai và một khối hành động tương lai (future action chunk), cùng lúc hoặc riêng rẽ, trên một kiến trúc khuếch tán video (video-diffusion backbone). Nó được huấn luyện trước trên hơn một triệu giờ video người quay từ góc nhìn thứ nhất, tương đương khoảng 170 năm trải nghiệm thức liên tục. Về mặt kiến trúc, nó là một hỗn hợp các bộ biến đổi (transformers). Video và hành động được mã hóa riêng biệt và nhận các chồng lớp DiT (DiT layer stacks) riêng biệt, chúng chú ý lẫn nhau. Thông tin cảm nhận bản thể (Proprioception) được đưa trực tiếp vào bộ biến đổi hành động. Các mã thông báo video (video tokens) sử dụng mặt nạ nhân quả (causal masking); các mã thông báo hành động (action tokens) sử dụng cơ chế tự chú ý hai chiều (bidirectional self-attention) và chú ý đến các mã thông báo video ngữ cảnh. Các mã thông báo video chú ý chéo (cross-attend) đến văn bản, nhưng văn bản không ảnh hưởng trực tiếp đến các mã thông báo hành động. Huấn luyện sử dụng phương pháp khớp luồng (flow matching). Một hàm mất mát video (video loss) và một hàm mất mát hành động (action loss) chia sẻ một thân chung dưới dạng hai trường vận tốc biên (marginal velocity fields) riêng biệt. Bởi vì mạng hành động không bao giờ lấy tiềm ẩn video bị nhiễu (noised video latent) làm đối số, chính sách vẫn phản ứng tại thời điểm suy luận – nó không tạo ra cũng không chú ý đến video tương lai được dự đoán. Bộ biến đổi hành động được thiết kế nông hơn một cách có chủ đích và tham gia vào luồng video sớm, điều mà nhóm nghiên cứu cho biết giúp cải thiện độ trễ thời gian thực (real-time latency) mà không làm giảm hiệu suất. Ba kết quả mở rộng Dyna Robotics đã cắt các tập con lồng nhau chính xác 1.000, 10.000, 100.000 và 1.000.000 giờ, giữ tỷ lệ giống hệt nhau từ mỗi nguồn. Ngân sách lớn hơn chỉ thêm dữ liệu, vì vậy sự khác biệt của đường cong không thể được quy cho sự thay đổi phân phối (distribution shift). Một tập xác thực (validation set) cố định, không trùng lặp gồm 100 giờ được dùng để chấm điểm từng cấp. Một quy luật mở rộng được duy trì trên dữ liệu con người đến một triệu giờ: Tất cả bốn chỉ số đều cải thiện đơn điệu (monotonically) và phù hợp với các quy luật lũy thừa (power laws): MSE giữ lại (held-out MSE) = 0,0691·D^-0,0184 (R²=0,919), độ chính xác@0,5 (accuracy@0.5) = 0,357·D^+0,0203 (R²=0,865). Trên toàn bộ thang, độ chính xác@0,1 tăng 51% so với 12% của MSE. Luật đó chuyển dữ liệu robot sang mô hình chưa từng thấy: Các điểm kiểm tra (checkpoint) tương tự được chấm điểm zero-shot trên 39 tác vụ trên hai nền tảng YAM hai tay cố định — 12 tác vụ nội bộ, 27 tác vụ từ xdof ABC. Sai số bình phương trung bình (MSE) hành động zero-shot = 0,306·D^-0,0713 (R²=0,884). Nhóm nghiên cứu báo cáo một điểm uốn giữa 10.000 và 100.000 giờ. Mục tiêu rất quan trọng và video là một trục riêng biệt: Khử nhiễu chung (joint denoising) vượt trội hơn chỉ hành động (action-only) trên 39/39 tác vụ ở mọi quy mô hành động. Giữ cố định dữ liệu được gắn nhãn hành động ở 50.000 giờ và thêm giờ chỉ video làm giảm MSE robot zero-shot từ 0,340 xuống 0,120. Đáng chú ý, lỗi con người được giữ lại không cải thiện — lợi ích của video đặc biệt là khả năng khái quát hóa đa thể hiện (cross-embodiment generalization). Kết quả trên robot Mỗi bậc thang được huấn luyện sau (post-trained) trên 14 tác vụ, tối đa 10 giờ dữ liệu robot mỗi tác vụ, trên ba thể hiện (embodiment): cánh tay YAM 6 bậc tự do với kẹp song song, cùng loại cánh tay với bàn tay khéo léo WUJI-2 20 bậc tự do, và một nguyên mẫu bán người. Huấn luyện sau chỉ sử dụng dữ liệu robot — không căn chỉnh người-robot, không đồng huấn luyện (co-training). Điểm chuẩn hóa trung bình tăng 20% → 28% → 45% → 53% qua các bậc thang, đạt kết quả tốt nhất trên 9 trong số 14 tác vụ ở một triệu giờ. Tác vụ "Lockbox Key Turning" là trường hợp ngưỡng: 0% cho đến 100.000 giờ, sau đó là 90%. Tác vụ "Bottle Cap Untwisting" được huấn luyện sau trên khoảng 10 phút trình diễn và vẫn đạt 50%. So với Dyna-1 — VLA sản xuất của công ty được khởi tạo từ Qwen3-VL-4B — một phiên bản Dyna-2 ban đầu đạt tỷ lệ thành công 1,55 lần và cấp độ 1,12 lần, tổng hợp trên 7 tác vụ và 3 điểm kiểm tra. Tại các địa điểm khách hàng chưa từng thấy, Dyna-2 vượt qua tiêu chí sản xuất 87% so với 46% của Dyna-1, mặc dù cả hai đều vượt qua gần 100% trong nội bộ. Một quy trình chưng cất (distillation pipeline) cũng cắt giảm thời gian lấy mẫu video từ 10.203 ms xuống 110 ms trên một H100. Giải thích tương tác HOẠT HÌNH HÓA CÁC BẬC THANG Dữ liệu con người được giữ lại · bậc thang 1k giờ MSE được giữ lại ↓ 0,062 D^-0,0184 · R²=0,919 L1 được giữ lại ↓ 0,140 D^-0,0132 · R²=0,879 Độ chính xác @0,1 ↑ 0,017 D^+0,0606 · R²=0,926 Độ chính xác @0,5 ↑ 0,40

Nguồn tin: MarkTechPost — Tác giả: Asif Razzaq. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.