Bỏ qua tới nội dung chính
Quay lại tin tức

Thông minh hơn, không lớn hơn: Cách Perforation giúp ResNet-18 hoạt động như ResNet-34

Medium Towards AI· Dr. Rorry Brenner· 7/8/2026general

Kỹ thuật lấy cảm hứng sinh học này mang lại độ chính xác tốt hơn đáng kể mà hầu như không cần thêm tài nguyên tính toán. Tăng cường hiệu suất của "người bạn cũ" đáng tin cậy Nếu quan tâm đến các mô hình thị giác, chắc hẳn bạn đã biết đến ResNet-18. Perforated AI đã sử dụng công nghệ tối ưu hóa dendrite của mình để "đục lỗ" ResNet-18, và phiên bản nâng cấp của chúng tôi có hiệu suất tương đương với ResNet-34. Điều này thực sự có ý nghĩa gì và tại sao bạn nên quan tâm? Nhóm của chúng tôi tin rằng tương lai của AI nằm ở các mô hình thông minh hơn và nhỏ gọn hơn, và còn cách nào tốt hơn để chứng minh điều đó bằng việc nâng cấp một mô hình mà ngành công nghiệp đã quen thuộc? ResNet-18 vẫn được sử dụng.

Kỹ thuật lấy cảm hứng sinh học này mang lại độ chính xác cao hơn đáng kể với chi phí tính toán gần như không tăng thêm. Tăng cường sức mạnh cho "ngựa thồ" cũ Nếu quan tâm đến các mô hình thị giác, bạn chắc chắn đã biết đến ResNet-18. Perforated AI đã sử dụng công nghệ tối ưu hóa dendritic của mình để "đục lỗ" ResNet-18, và phiên bản nâng cấp của chúng tôi có hiệu suất tương đương với ResNet-34. Điều đó thực sự có ý nghĩa gì và tại sao bạn nên quan tâm? Nhóm của chúng tôi tin rằng tương lai của AI nằm ở các mô hình thông minh hơn và nhỏ gọn hơn, và cách tốt nhất để chứng minh điều đó là nâng cấp một mô hình mà ngành công nghiệp đã quen thuộc. ResNet-18 vẫn đạt gần 50.000 lượt tải xuống mỗi tháng: Tại sao? Trong thế giới của Vision Transformers, DINOv2 và các kiến trúc khuếch tán, có vẻ như ResNet-18, một mô hình được công bố lần đầu vào năm 2015, sẽ dần chìm vào quên lãng. Nhưng không phải vậy. ResNet-18 vẫn là một trong những mô hình thị giác được huấn luyện trước được sử dụng tích cực nhất trên HuggingFace vì nó đạt được điểm tối ưu mà các mô hình mới hơn, lớn hơn đơn giản là không thể sánh kịp: Tốc độ: Với chỉ 11,7 triệu tham số, nó chạy suy luận nhanh. Sự quen thuộc: Hầu như mọi kỹ sư học máy đều biết cách sử dụng nó. Độ tin cậy của học chuyển giao: Nó cung cấp các biểu diễn đặc trưng sạch, được huấn luyện trước trên ImageNet, có khả năng chuyển giao tốt sang các tập dữ liệu hình ảnh tùy chỉnh với dữ liệu được gán nhãn hạn chế. Ngân sách tính toán: ResNet-18 có thể được tinh chỉnh trên GPU cấp thấp; các bộ chuyển đổi thị giác lớn hơn thì không thể. Đối với các nhóm làm việc trong lĩnh vực hình ảnh y tế, kiểm tra chất lượng, phân loại bán lẻ và các lĩnh vực tương tự, nơi tính toán là một hạn chế lớn, ResNet-18 vẫn là lựa chọn đúng đắn, không chỉ là một di sản còn sót lại. Tuy nhiên, chúng ta vẫn đang nói về một mô hình hơn 10 năm tuổi, và bạn không thể không tự hỏi: Điều gì sẽ xảy ra nếu bạn có thể tạo ra một mô hình có kích thước ResNet-18 phù hợp với các hạn chế tính toán chặt chẽ nhưng hoạt động với độ chính xác của một mô hình lớn hơn nhiều? Câu trả lời là phiên bản ResNet-18 được "đục lỗ" của chúng tôi, hiện đã có trên Hugging Face. ResNet-18 trong bối cảnh Trước khi đi sâu vào kết quả, cần đặt ResNet-18 vào bối cảnh kiến trúc rộng hơn. ResNets được giới thiệu vào năm 2015 trong bài báo nổi tiếng "Deep Learning for Image Recognition" của một nhóm từ Microsoft Research. Chúng sử dụng khung học tập dư (Res trong ResNet). Không đi sâu vào chi tiết, có thể nói rằng điều này đã cách mạng hóa học sâu cho nhận dạng hình ảnh. ResNets đã giành chiến thắng trong Thử thách nhận dạng hình ảnh quy mô lớn ImageNet (ILSVRC) năm 2015 và trở thành xương sống tiêu chuẩn cho một thập kỷ nghiên cứu thị giác máy tính. Dưới đây là cách hai mô hình ResNet có độ sâu khác nhau so với các mô hình thị giác máy tính phổ biến khác. Vị trí của từng mô hình: MobileNetV2 – Được xây dựng để suy luận trên thiết bị. Tốt nhất khi nhị phân: nó vừa vặn trên thiết bị hoặc không có gì. Sự hy sinh độ chính xác cho học chuyển giao là có thật. ResNets – Con ngựa thồ. Được hỗ trợ rộng rãi, dễ hiểu, nhanh chóng để tinh chỉnh. Độ chính xác chuẩn thấp hơn, nhưng những con số đó là trên ImageNet. ROI được tinh chỉnh thường đảo ngược thứ hạng trên các tập dữ liệu miền hạn chế. EfficientNets – Số liệu chuẩn mạnh mẽ, nhưng chậm một cách đáng ngạc nhiên trên các GPU thực tế. Cần thêm công việc triển khai (lượng tử hóa, TensorRT) để phù hợp với những gì thông số kỹ thuật hứa hẹn. Không lý tưởng nếu bạn đang lặp lại nhanh chóng. ResNet-18 nằm ở một vị trí trung gian thực dụng: đủ lớn để học các đặc trưng phong phú, đủ nhỏ để tinh chỉnh nhanh chóng. Biến thể được "đục lỗ" của chúng tôi đẩy nó lên ngang tầm ResNet-34 mà không phải trả chi phí tính toán cao của ResNet-34 sâu hơn. Kỹ thuật của chúng tôi: Tối ưu hóa Dendritic Có một khía cạnh cụ thể về cách thần kinh học hiện đại hiểu cách thức hoạt động của mạng lưới thần kinh sinh học thực sự (tức là bộ não). Các phần mở rộng giống như cây, được gọi là 'sợi nhánh' trên các tế bào não, đóng vai trò quan trọng trong cách bộ não xử lý thông tin và đưa ra quyết định. Các cấu trúc phân nhánh giống cây, hay 'sợi nhánh', được thể hiện bằng màu đỏ trong tế bào thần kinh sinh học này, là nguồn cảm hứng cho công nghệ của chúng tôi. Khoa học thần kinh hiện đại đã phát hiện ra rằng chúng đóng vai trò quan trọng trong cách bộ não thực sự hoạt động, một vai trò mà cho đến nay vẫn chưa được tái tạo trong các mạng lưới thần kinh nhân tạo. Chúng tôi đã xây dựng một bản nâng cấp cho tế bào thần kinh nhân tạo, khối xây dựng mà tất cả AI hiện đại được tạo ra từ đó. Công nghệ của chúng tôi bổ sung một phiên bản kỹ thuật số của sợi nhánh vào các nút của mạng lưới thần kinh hiện có, làm cho chúng thông minh hơn, cho phép chúng nhỏ hơn và nhìn chung tốt hơn trong những gì quan trọng nhất đối với các trường hợp sử dụng trong thế giới thực. Nếu bạn muốn tìm hiểu sâu hơn, đây là bài báo chính thức giải thích chi tiết. Kết quả: Thực sự tốt hơn bao nhiêu? Phiên bản ResNet-18 được đánh giá trên ba tiêu chuẩn học chuyển giao (transfer learning) tiêu chuẩn: Flowers-102, Oxford-IIIT Pets và CIFAR-100, các tập dữ liệu chuẩn để đo lường mức độ chuyển giao tốt của một backbone đã được huấn luyện trước sang các miền hình ảnh mới. Kết quả của hàng trăm lần thử nghiệm siêu tham số (hyperparameters) kể một câu chuyện ấn tượng. Trên Oxford-IIIT Pets và Flowers-102, mô hình được cải tiến tốt nhất đã thu hẹp 31% và 44% khoảng cách độ chính xác giữa ResNet-18 tốt nhất và ResNet-34 tốt nhất, tương ứng, chỉ với 13% tăng số lượng tham số so với ResNet-18 gốc. Chỉ riêng điều đó đã khiến nó trở thành một bản nâng cấp hấp dẫn. Nhưng kết quả CIFAR-100 mới là tiêu đề thực sự: phiên bản ResNet-18 được cải tiến vượt trội hơn hẳn ResNet-34, trong khi chỉ thêm 13% tham số bổ sung mà việc nâng cấp lên ResNet-34 sẽ yêu cầu. Một mô hình với 12,5 triệu tham số đánh bại một mô hình với 21,3 triệu tham số trên một tiêu chuẩn phân loại chi tiết chính xác là loại kết quả khiến bạn phải suy nghĩ lại về triết lý mô hình lớn hơn = mô hình tốt hơn. Về độ trễ: thử nghiệm suy luận một hình ảnh trên CPU AMD Ryzen Threadripper PRO trên toàn bộ tập dữ liệu Flowers-102 cho thấy độ trễ tỷ lệ thuận với số lượng tham số, nghĩa là mô hình được cải tiến chỉ chạy chậm hơn một chút so với ResNet-18 thông thường, không hề gần với mức phạt tốc độ của ResNet-34. Mô hình ResNet-18 được cải tiến đi kèm với một đầu phân loại ImageNet đã được huấn luyện và hoạt động ngay lập tức để suy luận ImageNet. Để học chuyển giao sang một tập dữ liệu mới, chỉ cần thay thế lớp FC cuối cùng như được hiển thị trong phần sử dụng.

Nguồn tin: Medium Towards AI — Tác giả: Dr. Rorry Brenner. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.