Với sự cạnh tranh khốc liệt giữa các công ty mô hình tiên phong, cùng với sức mạnh ngày càng tăng của các mô hình trọng lượng mở như Kimi K3 và Qwen3.8-Max, việc định tuyến mô hình đã trở thành một phần quan trọng trong quá trình triển khai AI. Chúng ta vừa thấy Stripe mua OpenRouter với giá hơn 7 tỷ USD, nhưng xu hướng này cũng không kém phần hấp dẫn trong các doanh nghiệp.
Glean, được đồng sáng lập và lãnh đạo bởi cựu Kỹ sư xuất sắc của Google Arvind Jain, chuyên đưa AI đến các tổ chức lớn. Nó được định giá lần cuối ở mức 7,2 tỷ đô la sau đợt huy động vốn Series F trị giá 150 triệu đô la vào tháng 6 năm ngoái. Năm nay, nó đạt 300 triệu USD doanh thu định kỳ hàng năm (ARR) - tăng gấp ba lần
Với sự cạnh tranh khốc liệt giữa các công ty mô hình tiên phong, cùng với sức mạnh ngày càng tăng của các mô hình trọng lượng mở như Kimi K3 và Qwen3.8-Max, việc định tuyến mô hình đã trở thành một phần quan trọng trong quá trình triển khai AI. Chúng ta vừa thấy Stripe mua OpenRouter với giá hơn 7 tỷ USD, nhưng xu hướng này cũng không kém phần hấp dẫn trong các doanh nghiệp.
Glean, được đồng sáng lập và lãnh đạo bởi cựu Kỹ sư xuất sắc của Google Arvind Jain, chuyên đưa AI đến các tổ chức lớn. Nó được định giá lần cuối ở mức 7,2 tỷ đô la sau đợt huy động vốn Series F trị giá 150 triệu đô la vào tháng 6 năm ngoái. Năm nay, nó đạt 300 triệu USD doanh thu định kỳ hàng năm (ARR) - tăng gấp ba lần trong 15 tháng.
Một phần nhiệm vụ của Glean là chọn mô hình nào sẽ sử dụng cho từng nhiệm vụ - hoặc thực sự nếu cần có LLM.
Jain nói với Latent Space: “Mục tiêu lớn của Glean là tránh sử dụng LLM cho những nhiệm vụ mà chúng tôi không cần đến chúng”. "Đôi khi bạn sẽ thấy các truy vấn trong Glean nơi mọi người cộng hai số hoặc nhân hai số. Họ có thể đã sử dụng máy tính để làm điều đó."
Nhưng điều mà Glean chủ yếu cố gắng làm là mang lại điều mà Jain gọi là “một đồng nghiệp cá nhân thực sự có quyền lực” cho nhân viên doanh nghiệp. Và điều đó có nghĩa là trở thành một loại siêu khai thác cho các LLM hàng đầu.
Glean đã công bố Trợ lý Glean thế hệ thứ ba vào tháng 9 năm ngoái; ngày nay, các đại lý là một phần quan trọng trong hệ thống của Glean.
Jain nói: “Ngày nay, bạn có thể coi Glean như một siêu nhóm của ChatGPT, Claude, Gemini, Grok. “Tất cả những sản phẩm AI khác nhau mà chúng tôi đang sử dụng hàng ngày này, Glean kết hợp sức mạnh của tất cả chúng vào một trải nghiệm.”
Với các doanh nghiệp, việc đưa công nghệ AI vào tổ chức chỉ là một nửa thách thức. Nửa còn lại là đưa kiến thức tổ chức vào hệ thống AI.
Jain nói: “Cuối cùng, hoạt động kinh doanh của chúng tôi là hiểu sâu sắc dữ liệu, kiến thức và thông tin của bạn cũng như cách thức công việc diễn ra trong công ty của bạn”.
Cách định tuyến mô hình được thực hiện trong Glean
Vậy định tuyến mô hình có ý nghĩa gì trong thực tế? Về cơ bản, Glean cung cấp ba cấp độ lựa chọn mô hình:
Nhân viên có thể chọn một mô hình một cách rõ ràng.
Quản trị viên có thể hạn chế các mô hình hoặc áp đặt giới hạn sử dụng.
Chế độ tự động của Glean chọn mô hình một cách linh hoạt cho từng tác vụ.
Cấu hình các mô hình cho một số nhiệm vụ nhất định.
Hóa ra chế độ tự động chủ yếu được khách hàng của Glean lựa chọn vì lý do kinh tế.
Jain nói với chúng tôi: "Tại sao mọi người lại nói về định tuyến mô hình? Tại sao họ lại hào hứng với nó? Chủ yếu là do chi phí".
Một người đồng sáng lập khác của Glean, trưởng nhóm kỹ thuật Tony Gentilcore, gần đây đã tuyên bố rằng Glean “tiết kiệm chi phí gấp 4 lần” so với Claude Code, “trung bình 0,45 USD cho mỗi nhiệm vụ so với 1,84 USD cho Claude Cowork”. Anh ấy cho rằng điều đó là do “khả năng khai thác và định tuyến” của Glean.
Về mặt cá nhân, nhiều người trong chúng ta đang nhận được giá trị lớn từ việc đăng ký hàng tháng 20 đô la, 100 đô la hoặc 200 đô la cho nhà cung cấp LLM. Nhưng đối với một doanh nghiệp, chi phí cho mỗi người dùng có thể dễ dàng vượt khỏi tầm kiểm soát.
Jain nói: “Các mô hình AI ngày càng trở nên đắt đỏ. "Giống như, nếu bạn nhìn vào Opus hoặc các mô hình GPT mới nhất, các mô hình tiên tiến nhất. Chúng không chỉ rất mạnh mẽ mà còn có thể chạy các tác vụ phức tạp hơn nhiều so với các mô hình trước đó. Nhưng xét trên cơ sở mỗi mã thông báo, chúng đắt hơn — đôi khi gấp đôi hoặc gấp bốn lần tốc độ của các mô hình trước đó. Và sau đó người dùng thực sự sử dụng chúng để chạy các tác vụ dài hơn nhiều. Vì vậy, bạn đang chi tiêu gấp 10 lần, 20 lần, nhiều hơn cho mỗi người dùng, so với những gì bạn đã làm năm ngoái. Vì vậy, chi phí có đã tăng lên rất nhiều.”
Vòng phản hồi của con người
Một yếu tố quan trọng khác trong sự phát triển của Glean là nó có thể xem người dùng doanh nghiệp thông thường đang sử dụng AI như thế nào. Sản phẩm này có khả năng được triển khai cho mọi nhân viên với tư cách là “đồng nghiệp” và nó cũng được sử dụng để xây dựng và triển khai các đại lý trên tất cả các phòng ban và chức năng.
Trong số các khách hàng của mình, Zillow báo cáo 80% được áp dụng trên 7.000 nhân viên, trong khi tại Booking.com, “Glean đã trở thành nền tảng AI đầu tiên được áp dụng trên toàn công ty”. Kiểu thâm nhập đó mang lại cho Glean một cái nhìn tuyệt vời về cách AI đang được sử dụng trong các doanh nghiệp.
Jain cho biết: “Vì vậy, chúng tôi đang quan sát những gì mọi người thực sự đang làm với AI trên cơ sở rất rộng”. “Chúng tôi đang tìm hiểu khi nào họ thực hiện các loại nhiệm vụ khác nhau với AI, họ chọn mô hình nào đầu tiên và khi nào họ không hài lòng, khi nào họ thực sự nâng cấp lên một số mô hình khác [điều đó] thực sự mang lại cho họ kết quả phù hợp.”
Vòng phản hồi của con người này, ở quy mô lớn, giúp cải thiện hệ thống định tuyến mô hình.
Đây là Waldo, đang thu thập nguyên liệu thô
Một phần khác trong kiến trúc của Glean là một mô hình có tên Waldo, mà Jain mô tả là nằm trên các mô hình ngôn ngữ lớn. Waldo được giới thiệu vào tháng 4 với tư cách là “Mô hình tìm kiếm tác nhân đầu tiên của Glean”.
Glean tuyên bố rằng Waldo, mô hình tìm kiếm tác nhân của nó, “giảm độ trễ 50% và mã thông báo xuống 25%, dành các mô hình nâng cao cho công việc cần chúng”.
Trong một bài đăng trên blog kỹ thuật, Waldo được miêu tả như một loại quy trình lọc các truy vấn của người dùng: nó “quyết định cách chia nhỏ câu hỏi, sử dụng công cụ nào, đọc gì tiếp theo và khi nào nó có đủ bằng chứng để chuyển giao cho một mô hình biên giới để có câu trả lời chất lượng cao”.
Điều này có nghĩa là quá trình định tuyến mô hình đang diễn ra sau khi Glean xác định được thứ mà Jain gọi là “nguyên liệu thô” cần thiết cho nhiệm vụ.
Ông nói thêm: “Chúng tôi có thể tập hợp các nguyên liệu thô cần thiết để thực hiện công việc mà không cần đốt mã thông báo LLM”.
Hệ quả tất yếu của điều này là một mô hình rẻ hơn với bối cảnh tốt hơn có thể hoạt động tốt hơn một mô hình biên giới chứa đầy dữ liệu không liên quan.
Sự gia tăng nhanh chóng của các mẫu xe có trọng lượng mở
Jain xác nhận hiện có sự quan tâm đáng kể từ các doanh nghiệp đối với các mẫu xe có trọng lượng mở, chủ yếu là do lo ngại về chi phí. Nhưng điều này chỉ xảy ra trong vài tháng qua.
“Năm ngoái, việc sử dụng [LLM nguồn mở] rất nhỏ và không đáng kể.
Nguồn tin: Latent Space — Tác giả: Richard MacManus. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.