Bỏ qua tới nội dung chính
Quay lại tin tức

Mở rộng khả năng tính toán trong chế độ tìm kiếm tại thời điểm thử nghiệm

Weaviate Blog· 11/8/2026opensource

Việc mở rộng năng lực tính toán trong giai đoạn kiểm thử đã trở thành một trong những thành công rõ rệt nhất của kỷ nguyên mô hình nền tảng. Dành nhiều tài nguyên tính toán hơn cho một vấn đề trong quá trình suy luận sẽ mang lại kết quả tốt hơn. Truy xuất thông tin cũng không ngoại lệ. Tham số "effort" (nỗ lực) mới trong Chế độ tìm kiếm của Query Agent hiện cho phép người dùng kiểm soát điều này. Trên BRIGHT Biology, một trong những bộ dữ liệu đánh giá truy xuất thông tin chuyên sâu về suy luận khó nhất, Chế độ tìm kiếm với nỗ lực cực cao đã nâng chỉ số nDCG@10 lên 57,5, so với mức 13,0 khi chỉ sử dụng Hybrid Search. Các ứng dụng khác nhau sẽ nằm ở những điểm khác nhau trên đường cong đánh đổi giữa độ chính xác và độ trễ. Tính năng này hiện có sẵn trong weaviate-agents 1.8.0 và agents-typescript-client.

Việc mở rộng khả năng tính toán tại thời điểm kiểm thử đã trở thành một trong những thành công rõ rệt nhất của kỷ nguyên mô hình nền tảng. Dành nhiều tài nguyên tính toán hơn cho một vấn đề trong quá trình suy luận sẽ mang lại kết quả tốt hơn. Truy xuất thông tin cũng không ngoại lệ. Tham số "effort" (nỗ lực) mới trong Chế độ Tìm kiếm của Query Agent hiện cho phép người dùng kiểm soát điều này. Trên BRIGHT Biology, một trong những bộ dữ liệu đánh giá truy xuất chuyên sâu về suy luận khó nhất, Chế độ Tìm kiếm với nỗ lực "ultrahigh" (cực cao) đã nâng chỉ số nDCG@10 lên 57,5, so với 13,0 khi chỉ sử dụng Hybrid Search. Các ứng dụng khác nhau có những điểm khác nhau trên đường cong đánh đổi giữa độ chính xác và độ trễ. Tham số "effort", có sẵn trong weaviate-agents 1.8.0 và agents-typescript-client 1.7.0, cho phép người dùng chọn mức độ nỗ lực mà Query Agent đầu tư vào mỗi lần tìm kiếm theo từng yêu cầu. Python JS/TS from weaviate.agents.query import QueryAgent qa = QueryAgent( client=client, collections=["IRPAPERS"] ) response = qa.search( "What are Listwise Rerankers?", effort="ultrahigh" ) import { QueryAgent } from "weaviate-agents"; const qa = new QueryAgent(client, { collections: ["IRPAPERS"], }); const response = await qa.search("What are Setwise Rerankers?", { effort: "ultrahigh", }); Ba cấp độ nỗ lực của Chế độ Tìm kiếm: "medium" (trung bình), "high" (cao) và "ultrahigh" (cực cao) điều chỉnh khả năng tính toán ở hai giai đoạn mà Chế độ Tìm kiếm thực hiện công việc của mình: viết truy vấn và sắp xếp lại kết quả (reranking). Ở mức nỗ lực cao hơn, tác nhân (agent) sẽ suy nghĩ lâu hơn về cách phân tách truy vấn và sắp xếp lại kết quả kỹ lưỡng hơn. Ở mức nỗ lực thấp hơn, tác nhân đánh đổi một phần chiều sâu đó để lấy tốc độ và chi phí. Người dùng có thể tăng mức nỗ lực khi câu trả lời là quan trọng và giảm mức nỗ lực khi độ trễ là yếu tố ưu tiên. Các bộ dữ liệu đánh giá (Benchmarks) Bảng sau đây so sánh các cấp độ nỗ lực "medium", "high" và "ultrahigh" của Chế độ Tìm kiếm với Hybrid Search của Weaviate trên 8 bộ dữ liệu đánh giá: 5 tập con từ BRIGHT, IRPAPERS, WixQA và một tập con từ OBLIQ-Bench. Chúng tôi chọn các bộ dữ liệu này vì chúng minh họa các vấn đề truy xuất chuyên sâu về suy luận và theo lĩnh vực cụ thể. Phương pháp luận Tương tự như bài viết blog đầu tiên về đánh giá Chế độ Tìm kiếm, chúng tôi so sánh với Hybrid Search của Weaviate, kết hợp BM25 với tìm kiếm vector trên các nhúng (embeddings) Snowflake Arctic 2.0, được hợp nhất bằng Reciprocal Rank Fusion (RRF). Sau đó, chúng tôi chạy Chế độ Tìm kiếm ở mỗi trong ba cấp độ nỗ lực trên cùng các tập dữ liệu. Để tính đến tính ngẫu nhiên của các mô hình được sử dụng trong Chế độ Tìm kiếm, mỗi cấu hình Chế độ Tìm kiếm được chạy 3 lần thử nghiệm và chúng tôi báo cáo giá trị trung bình cùng độ lệch chuẩn qua các lần thử nghiệm. Hybrid Search gần như mang tính xác định với một tập dữ liệu cố định, vì vậy chúng tôi báo cáo một lần chạy duy nhất. Thuật ngữ các chỉ số (Metrics Glossary) Gold Document (Tài liệu vàng): Trong các bộ dữ liệu đánh giá IR (Information Retrieval - Truy xuất thông tin), "gold document" là tài liệu hoặc các tài liệu được gắn nhãn là có liên quan cho một truy vấn nhất định. Success@K: Đo lường liệu K tài liệu được truy xuất có phải là "gold document" hay không. Chúng tôi thường báo cáo Success khi đặt K = 1 để tính đến trường hợp có nhiều "gold document" cho mỗi truy vấn. Recall@K: Đo lường có bao nhiêu "gold document" nằm trong K kết quả hàng đầu. nDCG@K: Viết tắt của normalized Discounted Cumulative Gain (Độ lợi tích lũy chiết khấu chuẩn hóa), nDCG không chỉ xem xét liệu các tài liệu liên quan có được truy xuất hay không, mà còn xem xét cách chúng được sắp xếp. Sức mạnh của nó nằm ở việc nắm bắt mức độ liên quan được phân cấp thay vì liên quan nhị phân, và thưởng cho các hệ thống đặt kết quả tốt nhất ở vị trí cao hơn trong danh sách. Đối với tất cả các chỉ số, giá trị cao hơn cho thấy hiệu suất tốt hơn. Mỗi chỉ số nhấn mạnh một khía cạnh khác nhau của truy xuất thông tin, và cùng nhau chúng cung cấp một bức tranh đầy đủ hơn. Thuật ngữ các bộ dữ liệu đánh giá (Benchmarks Glossary) BRIGHT: Được giới thiệu tại ICLR 2025, BRIGHT kiểm tra khả năng truy xuất thông tin chuyên sâu về lập luận với các truy vấn dài, mô tả chi tiết được lấy mẫu từ các bài đăng trên StackExchange. Các tài liệu gốc là các trang web được trích dẫn trong các câu trả lời được chấp nhận hoặc có nhiều lượt tán thành. Chúng tôi sử dụng 5 tập con: Sinh học, Khoa học Trái đất, Kinh tế học, Tâm lý học và Robot học. IRPAPERS: Đây là bộ tiêu chuẩn của chúng tôi về các bài báo Truy xuất thông tin, được xuất bản vào đầu năm 2026 để nghiên cứu truy xuất chuyên biệt theo lĩnh vực và so sánh các hệ thống dựa trên văn bản và hình ảnh. Chúng tôi báo cáo kết quả trên các bản ghi văn bản. WixQA: Được nhóm Nghiên cứu AI của Wix.com phát hành vào tháng 5 năm 2025, WixQA kiểm tra khả năng truy xuất hỗ trợ kỹ thuật chuyên biệt theo lĩnh vực với 200 truy vấn của khách hàng do chuyên gia viết, mỗi truy vấn được ghép nối với các tài liệu gốc do các chuyên gia hỗ trợ của Wix biên soạn. OBLIQ-Bench: Được các nhà nghiên cứu MIT giới thiệu vào tháng 5 năm 2026, OBLIQ-Bench nhắm mục tiêu vào các truy vấn mà mức độ liên quan tiềm ẩn hoặc gián tiếp, thay vì được nêu rõ trong văn bản bề mặt của tài liệu. Chúng tôi sử dụng tập con Phiên điều trần Quốc hội với 254 truy vấn "đầu lưỡi" trên 213.650 đoạn văn bản phiên điều trần của quốc hội. Trên cả tám bộ tiêu chuẩn, mô hình nhất quán: mọi cấp độ nỗ lực của Chế độ Tìm kiếm (Search Mode) đều vượt trội hơn Tìm kiếm Lai (Hybrid Search), và nỗ lực cao hơn mang lại độ chính xác cao hơn trung bình. Mức độ chênh lệch giữa các cấp độ phụ thuộc vào vấn đề. Trên BRIGHT, nơi các truy vấn đòi hỏi lập luận nhiều bước, các cấp độ phân tách rõ rệt. Nỗ lực cực cao nâng nDCG@10 từ 13,0 lên 57,5 trong Sinh học và từ 22,2 lên 54,4 trong Tâm lý học, với mỗi bước tăng nỗ lực mang lại độ chính xác bổ sung đáng kể. Trên các bộ tiêu chuẩn chuyên biệt theo lĩnh vực, nhưng ít chuyên sâu về lập luận hơn như IRPAPERS và WixQA, khoảng cách thu hẹp lại. Ở đây, nỗ lực trung bình đã đạt được hầu hết lợi ích so với Tìm kiếm Lai, và các cấp độ cao hơn chỉ bổ sung thêm những gia tăng nhỏ. Vì quy trình suy luận của Chế độ Tìm kiếm là ngẫu nhiên, các cấp độ liền kề có thể trùng lặp trên các tập dữ liệu riêng lẻ. Ví dụ, trên BRIGHT Kinh tế học, nỗ lực trung bình nhỉnh hơn nỗ lực cao. Tính trung bình trên các bộ tiêu chuẩn và thử nghiệm, thứ tự vẫn được giữ nguyên và nỗ lực cao hơn luôn mang lại độ chính xác cao hơn. Độ lệch chuẩn được tính trên ba thử nghiệm cho mỗi hệ thống, và sự nhất quán giữa các lần chạy mang lại cho chúng tôi niềm tin rằng những cải thiện này là vững chắc chứ không phải là sản phẩm của một mẫu duy nhất. BRIGHT Các tập con của BRIGHT mang lại phần thưởng cho nỗ lực theo những cách khác nhau. Trong Sinh học và Tâm lý học, mỗi bước tăng nỗ lực mang lại một lợi ích đáng kể, với nỗ lực cực cao gần như tăng gấp bốn lần nDCG@10 của Tìm kiếm Lai trong Sinh học. Khoa học Trái đất lại có một câu chuyện khác, nơi nỗ lực trung bình đã tăng gấp ba lần mức cơ sở của Tìm kiếm Lai và các cấp độ cao hơn chỉ bổ sung thêm những cải tiến nhỏ. Robot học là trường hợp nổi bật nhất, nơi nỗ lực trung bình và cao chỉ cải thiện Tìm kiếm Lai một cách khiêm tốn, nhưng nỗ lực cực cao...

Nguồn tin: Weaviate Blog. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.