Bỏ qua tới nội dung chính
Quay lại tin tức

Đây là cách Jev giúp trợ lý AI của bạn nhanh hơn, và đánh giá Jev

Hacker News AI· dszb· 3/10/2026general

URL bài viết: https://texposit.com/blog/using-jev-for-ai-decisions URL bình luận: https://news.ycombinator.com/item?id=49944224 Điểm: 2 Số bình luận: 0

Các trợ lý viết bằng trí tuệ nhân tạo (AI) thường dành vài lượt đầu tiên để chuẩn bị. Quá trình này bao gồm duyệt kỹ năng, tải kỹ năng, đọc các tệp dự án, sơ đồ công cụ, v.v. Có thể tối ưu hóa bằng cách giới thiệu một mức độ song song nhất định, sử dụng các mô hình nhanh hơn để thu thập ngữ cảnh hoặc để hệ thống đề xuất/tải trước các yếu tố dựa trên yêu cầu của người dùng. Tuy nhiên, những phương pháp này làm tăng độ phức tạp và nhanh chóng đạt đến giới hạn thời gian tối thiểu. Chúng tôi bắt đầu thử nghiệm với Jev cho phần cụ thể này của các phiên làm việc với trợ lý AI. Chúng tôi chuyển một mô tả ngắn về nhiệm vụ và một loạt câu hỏi hẹp cho Jev: yêu cầu này có cần kỹ năng này, tệp này hay công cụ này không? Jev trả lời các câu hỏi đó cùng lúc và TeXposit tải tất cả những gì Jev yêu cầu ngay lập tức. Dưới đây là một ghi nhận thực tế từ một trường hợp đơn lẻ, hơi cực đoan: "Những khái niệm phức tạp nào trong bài báo này cần được hình dung bằng TikZ?" Trợ lý đã trả lời sau 73 giây, trong đó 59 giây đầu tiên là để thiết lập: nó tải kỹ năng TikZ, đọc tệp chú thích của dự án qua hai lượt và đọc hai phạm vi của tệp main.tex. Chỉ 14 giây cuối cùng là để đưa ra câu trả lời. Cùng một lời nhắc, sử dụng bước tiền xử lý mới dựa trên Jev, bao gồm 42 câu hỏi có/không về 23 kỹ năng của dự án, 14 công cụ bị trì hoãn và 5 tệp ứng cử viên. Jev đã chọn kỹ năng TikZ, tệp main.tex và tệp chú thích, đây cũng là những gì trợ lý đã tự tìm nạp. Nó cũng chọn một kỹ năng thứ hai, một tệp ghi chú dự án và một công cụ tải xuống PDF mà sau đó không bao giờ được sử dụng. Đây là một sự lãng phí token nhỏ, nhưng không đáng kể so với việc tiết kiệm thời gian và được kiểm soát bằng các ngưỡng và giới hạn. Chúng tôi đọc tối đa ba tệp và mở khóa tối đa bốn công cụ cho lượt đầu tiên của mô hình chính. Chúng tôi chưa đo lường tổng thời gian tiết kiệm hoặc thực hiện các bài kiểm tra hiệu suất, nhưng sự khác biệt có thể nhận thấy, đặc biệt khi làm việc với các mô hình chính chậm hơn. Điều quan trọng cần lưu ý là thiết lập này không trao quyền cho Jev hành động trên dự án. Mô hình chính vẫn quyết định những gì cần làm, và mọi chỉnh sửa đều trải qua quá trình xác thực và phê duyệt tương tự như trước đây, do đó chất lượng đầu ra cuối cùng không bị ảnh hưởng. Trên thực tế, việc có Jev đóng vai trò là người đánh giá còn cải thiện chất lượng đầu ra. Jev đánh giá Trong một bản cập nhật gần đây, chúng tôi đã giới thiệu Chế độ Nghiêm ngặt (Rigour Mode) tự động chạy các câu trả lời cuối cùng của mô hình dựa trên một loạt các yêu cầu có thể tùy chỉnh, nhằm tránh việc người dùng phải xem xét từng yêu cầu một hoặc tin tưởng mô hình không vi phạm bất kỳ quy tắc nào. Mặc dù điều này giúp cải thiện chất lượng đầu ra, nhưng nó đi kèm với chi phí thời gian và token đáng kể. Hơn nữa, người đánh giá không đưa ra giải thích dài dòng. Nó báo cáo tiêu chí nào đã thất bại, khiến Jev trở thành một ứng cử viên tốt để thay thế một mô hình ngôn ngữ lớn (LLM) để cung cấp năng lượng cho tính năng này. Jev kiểm tra từng mục yêu cầu đang hoạt động một cách song song với cuộc hội thoại và câu trả lời cuối cùng hoặc chỉnh sửa được đề xuất của LLM. Một kiểm tra thất bại sẽ gửi phản hồi trở lại mô hình chính, mô hình này sau đó sẽ sửa đổi câu trả lời của mình trước khi người dùng nhìn thấy hoặc một chỉnh sửa được phê duyệt. Trong ví dụ so sánh được trình bày dưới đây, năm ví dụ mất khoảng 28 giây để đánh giá với người đánh giá dựa trên LLM cũ và 2,4 giây với Jev. Jev đồng ý với người đánh giá cũ ở bốn ví dụ, trong khi ở ví dụ thứ năm, Jev đã từ chối không chính xác một câu trả lời tốt vì không tiết lộ các hạn chế. Việc thử nghiệm và đánh giá hiệu suất thêm có thể được biện minh ở đây, nhưng chúng tôi nhận thấy rằng Chế độ Nghiêm ngặt là vô dụng nếu không được bật, và người dùng không bật nó nếu nó làm chậm quy trình làm việc của họ, vì vậy có lẽ những lỗi dương tính giả không thường xuyên là chấp nhận được. Chúng tôi cũng giới hạn vòng lặp hiệu chỉnh: sau ba lần thử không thành công, nhiệm vụ sẽ tiếp tục trong khi đưa ra cảnh báo rõ ràng cho người dùng rằng câu trả lời có thể không đủ chặt chẽ, tránh việc một giám khảo nghiêm khắc hoặc một yêu cầu bất khả thi làm tắc nghẽn nhiệm vụ mãi mãi. Điều này sẽ giúp người dùng xem xét liệu, ví dụ, câu hỏi của họ không thể được trả lời bằng các bằng chứng có sẵn, thay vì để LLM (mô hình ngôn ngữ lớn) đưa ra một câu trả lời đáng ngờ với các kết nối logic không rõ ràng với các nguồn. Jev với vai trò bộ định tuyến cấp độ lượt Một số lượt mang tính cơ học, như chạy một công cụ được đặt tên hoặc sửa lỗi mà trình biên dịch đã xác định. Những lượt khác cần đến khả năng đánh giá viết thông thường, và một số liên quan đến các tuyên bố chính hoặc hướng dẫn phức tạp. TeXposit sử dụng thiết lập ba tầng, trong đó một mô hình nhanh, một mô hình tổng quát và một mô hình thông minh (ví dụ: Haiku, Sonnet và Opus) luôn sẵn sàng linh hoạt cho mỗi phiên. Với Jev, chúng ta có thể quyết định cho mỗi lượt nên sử dụng tầng nào cho lượt tiếp theo. Khi Jev không chắc chắn, nó sẽ chuyển lên một tầng cao hơn và nếu việc định tuyến thất bại, nó sẽ mặc định sử dụng mô hình thông minh. Jev cũng xử lý việc tự động khám phá kỹ năng ở cấp độ lượt. Cho đến nay, dựa trên NLP (xử lý ngôn ngữ tự nhiên) rất đơn giản, chúng tôi đã đề xuất các kỹ năng cho LLM dựa trên những gì người dùng hỏi. Giờ đây, chúng tôi đã thay thế danh sách cụm từ viết tay bằng các câu hỏi có/không của Jev vì một yêu cầu có thể chỉ ra một công cụ hoặc kỹ năng ngay cả khi người dùng không sử dụng các từ trong mô tả của nó. Ngoài ra, hiện tại, bộ định tuyến không áp dụng cho những người dùng tự mang khóa OpenRouter của mô hình riêng của họ. Việc chuyển đổi họ sang một mô hình khác mà không hỏi sẽ là một giao dịch kém hiệu quả, ngay cả khi nó tiết kiệm thời gian.

Nguồn tin: Hacker News AI — Tác giả: dszb. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.