
Điểm chuẩn tìm kiếm web của LLM: Nhiều lượt tìm kiếm hơn đánh bại một công cụ tìm kiếm tốt hơn
URL bài viết: https://openrouter.ai/blog/announcements/web-search-benchmark/ URL bình luận: https://news.ycombinator.com/item?id=49302033 Điểm: 1 Bình luận: 0
Kiểm định hiệu suất tìm kiếm web trực tiếp: Chọn công cụ, độ sâu và mô hình phù hợp cho tác nhân của bạn
Ayush Patel · 12/8/2026
Chúng tôi kiểm định tất cả các kết hợp để tìm ra điểm mạnh và điểm yếu.
Ngân sách tìm kiếm quan trọng hơn bất kỳ yếu tố nào khác.
Kịch bản chi phí tồi tệ nhất của bạn được thúc đẩy bởi tỷ lệ thất bại.
Mặc dù công cụ tìm kiếm quan trọng, mô hình còn quan trọng hơn.
Hãy thử nghiệm trên khối lượng công việc của riêng bạn.
Phương pháp kiểm định hiệu suất.
Câu hỏi thường gặp.
Tìm kiếm web là yếu tố cơ bản đối với hầu hết các yêu cầu của mô hình ngôn ngữ lớn (LLM) nhằm khắc phục giới hạn kiến thức. Các phòng thí nghiệm và nhà cung cấp dịch vụ tìm kiếm đang phát triển nhanh chóng để làm cho việc tìm kiếm hiệu quả và năng suất hơn, đặt ra cho chúng ta một loạt các quyết định khó khăn: sử dụng tính năng tìm kiếm tích hợp sẵn của một số phòng thí nghiệm, hay kết nối với một công cụ bên thứ ba như Exa, Parallel, hoặc Perplexity? Một lần tìm kiếm có đủ không, và nếu không thì tôi nên cho tác nhân tìm kiếm trong bao lâu? Liệu nhiều lượt tìm kiếm hơn có đáng với chất lượng mà chúng mang lại không?
Chúng tôi đã xây dựng các bảng xếp hạng trực tiếp để giúp bạn quyết định cấu hình tìm kiếm tốt nhất dựa trên dữ liệu. Xem dữ liệu trên trang Kiểm định hiệu suất mới của chúng tôi.
Chúng tôi kiểm định tất cả các kết hợp để tìm ra điểm mạnh và điểm yếu.
Khi thiết lập một yêu cầu tìm kiếm, bạn có bốn quyết định:
Mô hình. Viết truy vấn chính xác được gửi đến công cụ tìm kiếm và xử lý kết quả.
Công cụ. Bạn có thể chọn một công cụ cụ thể hoặc dựa vào các công cụ đi kèm được cung cấp bởi một số phòng thí nghiệm. Trên OpenRouter, chúng tôi cung cấp Exa, Parallel và Perplexity, cùng với các công cụ gốc từ các phòng thí nghiệm như OpenAI, Anthropic và Google.
Phương pháp tìm kiếm. Bạn có thể thực hiện tìm kiếm trước khi gọi mô hình và truyền kết quả vào làm ngữ cảnh, hoặc bạn có thể trang bị cho mô hình một công cụ tìm kiếm web mà nó sẽ gọi theo ý mình.
Ngân sách tìm kiếm. Nếu bạn chọn phương pháp công cụ tìm kiếm, bạn cũng có thể cấp cho mô hình một ngân sách về số lượt tìm kiếm mà nó được phép thực hiện. Điều này cho phép các mô hình điều chỉnh truy vấn nếu chúng không thích kết quả hoặc thực hiện các tìm kiếm tiếp theo. Các lần chạy của chúng tôi sử dụng 1, 5 hoặc 25 lượt.
Để hiểu toàn diện hiệu suất tìm kiếm web, chúng tôi thường xuyên chạy bốn bài kiểm định hiệu suất trên nhiều mô hình, công cụ và cấu hình tìm kiếm:
BrowseComp: tìm kiếm thông tin thực tế khó khăn đòi hỏi duyệt web thực sự.
DeepSearchQA: các câu hỏi nghiên cứu đa bước.
WideSearch: thu thập dữ liệu rộng rãi để "điền toàn bộ bảng".
HLE: các câu hỏi thi chuyên gia có tìm kiếm.
Mỗi trang xếp hạng các cấu hình theo chất lượng, giá trị và tốc độ, để bạn có thể đưa ra quyết định dựa trên yếu tố quan trọng nhất đối với khối lượng công việc của mình. Các bảng xếp hạng là trực tiếp, vì vậy các con số thay đổi khi có các lần chạy mới và các mô hình, công cụ mới được thêm vào. Người dẫn đầu hôm nay không đảm bảo sẽ là người dẫn đầu ngày mai. Chúng tôi sẽ không dành nhiều thời gian cho những người dẫn đầu hiện tại trong bài viết này vì chúng tôi kỳ vọng điều đó sẽ thay đổi theo thời gian. Thay vào đó, hãy xem xét dữ liệu cho chúng ta biết điều gì về cách đưa ra quyết định cho khối lượng công việc của bạn.
Ngân sách tìm kiếm quan trọng hơn bất kỳ yếu tố nào khác.
Tăng ngân sách công cụ từ một lượt cải thiện chất lượng nhiều hơn bất kỳ thay đổi đơn lẻ nào khác mà bạn có thể thực hiện. Để minh họa, đây là lần chạy BrowseComp ban đầu của chúng tôi trên Perplexity với ba ngân sách khác nhau:
Mô hình, với Perplexity
1 lượt
5 lượt
25 lượt
Claude Opus 5, cao
35,8% (0,14 USD)
66,5% (0,51 USD)
89,0% (0,99 USD)
GPT-5.6 Sol, cao
46,3% (0,20 USD)
65,2% (0,29 USD)
82,4% (0,50 USD)
GPT-5.6 Luna, cực cao
33,7% (0,02 USD)
57,0% (0,04 USD)
74,0% (0,10 USD)
Mô hình này đúng với tất cả các nhà cung cấp mà chúng tôi đã đo lường:
Các lần chạy này chỉ bao gồm BrowseComp, sử dụng công cụ máy chủ với mười kết quả mỗi lần tìm kiếm, không tìm nạp trang hoặc thực thi mã, và lần chạy đủ điều kiện mới nhất cho mỗi cấu hình.
Tăng độ sâu tìm kiếm là cách hiệu quả nhất để nâng cao chất lượng. Việc tăng từ 1 lượt lên 25 lượt tìm kiếm giúp tăng gấp đôi điểm số, trong khi chi phí chỉ tăng từ 2,5 đến 7 lần cho mỗi câu hỏi.
Có thể cho rằng điều này sẽ làm chậm thời gian phản hồi một cách phổ biến, nhưng thực tế không phải lúc nào cũng vậy. Ví dụ, Luna mất 140 giây cho mỗi câu hỏi ở 1 lượt tìm kiếm và 111 giây ở 25 lượt. Trong số 35 cấu hình được chạy ở cả 1 và 5 lượt, hơn một phần ba có tốc độ chậm hơn khi số lượt tìm kiếm ít hơn. Tất cả đều là các mô hình của OpenAI. Các mô hình này xử lý các giới hạn ngân sách tìm kiếm bằng cách tăng cường khả năng suy luận.
Mặt khác, độ sâu tìm kiếm có thể gây bất lợi về chi phí đối với các tác vụ dễ hơn. Ví dụ, trên HLE, GPT-5.6 Sol với Perplexity đạt điểm tương tự giữa 1 lượt và 25 lượt tìm kiếm, nhưng chi phí tăng gấp ba lần. Nếu các tìm kiếm của bạn có xu hướng đơn giản, việc giữ ngân sách ở mức giới hạn vẫn có thể là một lựa chọn đáng cân nhắc.
Kịch bản chi phí tồi tệ nhất của bạn được thúc đẩy bởi tỷ lệ thất bại.
Tình huống khác mà ngân sách mở rộng gây bất lợi là khi mô hình không tìm được câu trả lời. Chúng tôi nhận thấy rằng các mô hình sẽ cạn kiệt ngân sách khi cố gắng tìm câu trả lời, mặc dù cuối cùng chúng sẽ thất bại.
Bộ (ngân sách 25 lượt)
Tìm kiếm trung bình khi đúng | Tìm kiếm trung bình khi sai
BrowseComp | 10.3 | 19.7
DeepSearchQA | 11.7 | 20.1
HLE | 5.2 | 7.5
WideSearch | 17.6 | 23.4
Nỗ lực sâu nhất được ghi nhận, 81 lượt tìm kiếm trên bảng WideSearch, vẫn bị đánh giá là không chính xác. Nếu khối lượng công việc của bạn có tỷ lệ thất bại cao, thì việc giảm độ sâu tìm kiếm có thể là một cách hiệu quả để giảm chi phí.
Mặc dù công cụ tìm kiếm quan trọng, nhưng mô hình còn quan trọng hơn.
Khi ngân sách đã được thiết lập, câu hỏi quan trọng tiếp theo là nên sử dụng mô hình nào.
Mô hình | Perplexity | Exa | Parallel
Claude Opus 5, cao | 89.0% ($0.99) | 82.2% ($1.29) | 88.8% ($2.42)
GPT-5.6 Sol, cao | 82.4% ($0.50) | 77.8% ($0.54) | 76.6% ($1.26)
DeepSeek V4 Flash, cao | 77.0% ($0.08) | 67.4% ($0.12) | 64.6% ($0.10)
GPT-5.6 Luna, rất cao | 74.0% ($0.10) | 68.4% ($0.14) | 58.0% ($0.11)
Bảng trên hiển thị kết quả BrowseComp ở 25 lượt tìm kiếm, so sánh các mô hình tiên tiến với các mô hình tiết kiệm chi phí trên các công cụ tìm kiếm.
Việc thay đổi công cụ tìm kiếm trong khi giữ nguyên mô hình đã thay đổi điểm số trung bình 10 điểm, trong khi khoảng cách trung bình giữa các mô hình tiên tiến và các mô hình tiết kiệm chi phí lớn hơn, ở mức 15 điểm. Trên các công cụ tìm kiếm, chi phí thay đổi nhiều nhất đối với các mô hình tiên tiến, trong đó công cụ đắt nhất có chi phí gấp 2,5 lần công cụ rẻ nhất, so với 1,5 lần đối với các mô hình tiết kiệm chi phí.
Lý do có thể thực hiện so sánh như vậy là vì công cụ máy chủ nằm phía trên nhà cung cấp. Thay đổi mô hình trong yêu cầu của bạn và hành vi tìm kiếm vẫn được giữ nguyên.

Nguồn tin: Hacker News LLM — Tác giả: DGAP. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.