Bỏ qua tới nội dung chính
Quay lại tin tức

Dự đoán tốc độ nhận nuôi thú cưng đa phương thức với lớp AI tác nhân

Medium Towards AI· Pedro Markovicz· 17/8/2026general

Kiến trúc AI đa phương thức kết hợp các tổ hợp được tăng cường độ dốc với các mô hình tầm nhìn và vòng xác minh LangGraph để kiểm tra danh sách thú cưng trước khi đề xuất các cải tiến đã được xác thực. “Hàng triệu động vật đi lạc phải chịu đau khổ trên đường phố hoặc bị giết chết trong các nơi trú ẩn mỗi ngày trên khắp thế giới”. Đó là câu mở đầu của cuộc thi Dự đoán nhận con nuôi của PetFinder.my trên Kaggle, cuộc thi đã phát hành tập dữ liệu được xây dựng dựa trên dự án này. PetFinder.my là nền tảng phúc lợi động vật hàng đầu của Malaysia kể từ năm 2008 và nắm giữ kỷ lục về hơn 150.000 động vật. Tiền đề là tốc độ áp dụng bị ảnh hưởng

Kiến trúc AI đa phương thức kết hợp các tổ hợp được tăng cường độ dốc với các mô hình tầm nhìn và vòng xác minh LangGraph để kiểm tra danh sách thú cưng trước khi đề xuất các cải tiến đã được xác thực. “Hàng triệu động vật đi lạc phải chịu đau khổ trên đường phố hoặc bị giết chết trong các nơi trú ẩn mỗi ngày trên khắp thế giới”. Đó là câu mở đầu của cuộc thi Dự đoán nhận con nuôi của PetFinder.my trên Kaggle, cuộc thi đã phát hành tập dữ liệu được xây dựng dựa trên dự án này. PetFinder.my là nền tảng phúc lợi động vật hàng đầu của Malaysia kể từ năm 2008 và giữ kỷ lục về hơn 150.000 động vật. Tiền đề là tốc độ chấp nhận bị ảnh hưởng bởi cách danh sách trình bày con vật: mô tả, thuộc tính và ảnh của nó. Khả năng trú ẩn là hữu hạn, đó là yếu tố liên kết thời gian tồn tại của thú cưng với kết quả trong câu mở đầu đó. Mục tiêu đã nêu của cuộc thi đã đi xa hơn dự đoán. Các mô hình chiến thắng nhằm mục đích trở thành công cụ hướng dẫn những nơi trú ẩn và người cứu hộ đến những danh sách được trả lời. Một tình nguyện viên cứu hộ tải lên một vài bức ảnh, viết một mô tả ngắn, điền một số chi tiết và nhận lại dự đoán về tốc độ áp dụng. Đó là nhiệm vụ cạnh tranh và nó chỉ cách mục tiêu một bước. Việc biết thời điểm thú cưng có khả năng được nhận nuôi không nói lên điều gì về những gì cần thay đổi để điều đó xảy ra sớm hơn. Công cụ tăng tốc áp dụng thực hiện bước đó. Một đường dẫn đa phương thức đọc các thuộc tính dạng bảng, mô tả và ảnh, dự đoán tốc độ tiếp nhận với một tập hợp được tăng cường độ dốc và chuyển dự đoán cũng như các phân bổ SHAP của nó tới lớp tác nhân LangGraph, nơi mô hình tầm nhìn kiểm tra hình ảnh trực tiếp. Điều làm nên sự khác biệt của hệ thống là điều gì xảy ra trước khi bất kỳ lời khuyên nào đến với người dùng. Khi một tác nhân đề xuất thay đổi, cho dù đó là bức ảnh thứ tư hay mô tả được viết lại, nó không ước tính được hiệu quả. Nó xây dựng lại vectơ đặc trưng với thay đổi được áp dụng, chạy lại tập hợp và báo cáo delta đã đo được. Do đó, mọi khuyến nghị đều mang một con số mà mô hình đưa ra và các đề xuất không thay đổi được dự đoán sẽ bị từ chối bởi chính cơ chế đã tạo ra chúng. Hệ thống làm gì Công cụ tăng tốc nhận con nuôi dự đoán tốc độ một con vật cưng được liệt kê trên PetFinder.my sẽ được nhận nuôi. Mô hình này là một tập hợp biểu quyết mềm gồm các cây được tăng cường độ dốc trên một ma trận tính năng duy nhất được xây dựng từ cả ba phương thức và nó trả về phân bố xác suất trên năm lớp tốc độ áp dụng cộng với phân bổ SHAP. Trên hết là một hệ thống đa tác nhân LangGraph mà tôi gọi là Ban Bằng chứng. Nó xem xét các bức ảnh bằng mô hình tầm nhìn, dịch trình điều khiển SHAP sang ngôn ngữ đơn giản, kiểm tra các cải tiến được đề xuất so với tổng thể thực và viết lại danh sách. Một quy tắc chi phối toàn bộ thiết kế: ML cổ điển sở hữu con số, LLM sở hữu ngôn ngữ và LLM không bao giờ phát minh ra con số. Việc thực thi điều khoản thứ ba đó đã chiếm phần lớn thời gian của dự án. Tại sao mục tiêu thứ tự lại thay đổi mọi thứ Tập dữ liệu PetFinder có 14.993 hàng đào tạo và năm lớp: cùng ngày, trong vòng một tuần, trong vòng một tháng, trong vòng ba tháng và vẫn được liệt kê sau một trăm ngày. Những lớp đó được sắp xếp theo thứ tự mà hầu hết các số liệu phân loại đều bỏ qua. Nếu sự thật “vẫn được liệt kê sau một trăm ngày” và bạn dự đoán “trong vòng ba tháng”, thì bạn đã hơi sai. Nếu bạn dự đoán “cùng ngày”, thì bạn đã sai lầm nghiêm trọng và bạn vừa yêu cầu một nơi trú ẩn đừng lo lắng về một con vật mà không ai hỏi đến. Độ chính xác ghi cả hai lỗi giống hệt nhau. Kappa có trọng số bậc hai thì không. Nó phạt pr các sắc lệnh tùy theo mức độ chúng cách xa lớp thực sự (với các lỗi lớn hơn sẽ bị phạt bậc hai) trong khi tính đến sự đồng ý được mong đợi một cách ngẫu nhiên. Thuộc tính đó thực hiện hầu hết công việc sau này, khi xác suất của mô hình phải được chuyển thành một nhãn duy nhất. Trước đó, các tính năng. Ba phương thức, một ma trận tính năng Mỗi phương thức tuân theo quy trình trích xuất riêng và chỉ được hợp nhất ở cuối chứ không được hợp nhất trong một mạng duy nhất. Nhánh dạng bảng: Kỹ thuật tính năng tiêu chuẩn, bao gồm điểm chăm sóc sức khỏe tổng hợp, tổng hợp cho mỗi người cứu hộ chỉ phù hợp với phần phân chia đào tạo và mã hóa tần số cho giống và vị trí. Nhánh văn bản: Sử dụng all-mpnet-base-v2, ở 768 thứ nguyên cho mỗi danh sách. Bộ biến đổi câu được chọn thay vì TF-IDF vì âm thanh vẫn tồn tại trong quá trình mã hóa: một danh sách được đọc là ấm áp và cụ thể sẽ chiếm một vùng khác trong không gian nhúng so với danh sách đọc như một nghĩa vụ và sự khác biệt đó tương quan trực tiếp với hiệu suất ở phía dưới. Nhánh hình ảnh: Sử dụng EfficiencyNet V2-S. Lớp áp chót cung cấp 1.280 kích thước, được giảm xuống còn 100 thông qua PCA phù hợp với phần phân chia huấn luyện và được gộp trung bình trên các bức ảnh của thú cưng. Bước PCA này chịu tải vì việc cung cấp 1.280 kích thước hình ảnh cho mô hình cây cùng với khoảng 50 tính năng dạng bảng sẽ đẩy hầu hết các phần phân tách về phía nhiễu hình ảnh. Bên cạnh các cách nhúng hình ảnh đã học, tôi còn trích xuất siêu dữ liệu đã được thiết kế từ các hình ảnh thô bằng Google Vision, bao gồm nhãn đối tượng, màu chủ đạo và độ tin cậy của gợi ý cắt xén làm proxy cho bố cục. Nhánh văn bản đóng góp một tính năng được thiết kế bổ sung: tình cảm ở cấp độ tài liệu. Sau đó, tất cả các bộ tính năng sẽ được liên kết theo chiều ngang trên PetID. Phản ứng tổng hợp muộn được chọn vì hai lý do thực tế. Đầu tiên, các mô hình dựa trên cây xử lý các nhóm tính năng không đồng nhất một cách tự nhiên và mỗi phương thức vẫn được phiên bản độc lập. Thứ hai, mọi tính năng đều giữ thẻ phương thức của nó và nửa sau của hệ thống này phụ thuộc vào nguồn gốc đó. Để đánh giá hệ thống một cách an toàn, tôi đã sử dụng Bebé, chú chó Maltese hai tuổi của hàng xóm của tôi. Bởi vì anh ấy không thực sự sẵn sàng nhận con nuôi nên danh sách của anh ấy cung cấp cơ sở thực tế để chạy việc viết lại văn bản dựa trên ảnh thật mà không ảnh hưởng đến động vật có nhu cầu. Đối với Bebé, văn bản chiếm 71% dự đoán. Bốn câu ngắn có sức ảnh hưởng lớn hơn nhánh hình ảnh và mọi thuộc tính dạng bảng cộng lại. Mức độ phân bổ đó chỉ có thể thực hiện được vì các phương thức đã được hợp nhất muộn và được gắn nhãn. Quy tắc quyết định đánh bại tunin

Nguồn tin: Medium Towards AI — Tác giả: Pedro Markovicz. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.