
Trình bày: Sản xuất các token rẻ nhất thế giới: Hướng dẫn thực hiện
Bà Meryem Arik thảo luận về các chiến lược thiết kế kiến trúc suy luận mô hình ngôn ngữ lớn (LLM) chi phí thấp cho các khối lượng công việc lớn, không yêu cầu thời gian thực. Bà giải thích cách các kiến trúc sư phần mềm và lãnh đạo kỹ thuật có thể đạt được mức giảm chi phí theo cấp số nhân bằng cách thực hiện các đánh đổi quan trọng trên phần cứng, thời gian chạy suy luận, giải mã suy đoán và sắp xếp lại hàng đợi thông minh.
Trang chủ InfoQ
Các bài thuyết trình
Sản xuất token rẻ nhất thế giới: Hướng dẫn thực hiện
AI, ML & Kỹ thuật dữ liệu
Sản xuất token rẻ nhất thế giới: Hướng dẫn thực hiện
Thích
Danh sách đọc
Xem bài thuyết trình
Dọc
Ngang
Toàn màn hình
Tốc độ:
1x
1,25x
1,5x
2x
Tải xuống
Các slide
30:14
Tóm tắt
Meryem Arik thảo luận về các chiến lược thiết kế kiến trúc suy luận LLM (mô hình ngôn ngữ lớn) chi phí thấp cho các khối lượng công việc lớn, không yêu cầu thời gian thực. Bà giải thích cách các kiến trúc sư phần mềm và lãnh đạo kỹ thuật có thể đạt được mức giảm chi phí theo cấp số nhân bằng cách thực hiện các đánh đổi quan trọng trên phần cứng, thời gian chạy suy luận, giải mã suy đoán và sắp xếp lại hàng đợi thông minh.
Tiểu sử
Meryem Arik là đồng sáng lập và Giám đốc điều hành của Doubleword, một nền tảng suy luận AI tự lưu trữ. Tốt nghiệp Đại học Oxford, Meryem đã học Vật lý lý thuyết và Triết học. Bà thường xuyên diễn thuyết tại các hội nghị hàng đầu, bao gồm TEDx và QCon, chia sẻ những hiểu biết sâu sắc về công nghệ suy luận và AI doanh nghiệp. Meryem đã được vinh danh trong danh sách Forbes 30 Under 30 nhờ những đóng góp của mình cho lĩnh vực AI.
Về hội nghị
Phần mềm đang thay đổi thế giới. QCon San Francisco thúc đẩy phát triển phần mềm bằng cách tạo điều kiện truyền bá kiến thức và đổi mới trong cộng đồng nhà phát triển. Là một hội nghị do các chuyên gia thực hành điều hành, QCon được thiết kế dành cho các trưởng nhóm kỹ thuật, kiến trúc sư, giám đốc kỹ thuật và quản lý dự án, những người có ảnh hưởng đến sự đổi mới trong các nhóm của họ.
Meryem Arik: Hầu hết các công ty đang chi trả quá mức cho hoạt động suy luận (inference) của mình từ 2 đến 5 lần, đôi khi lên đến một bậc độ lớn đối với một số trường hợp sử dụng token cao nhất. Điều này là do họ chưa thực sự suy nghĩ kỹ lưỡng về cấu trúc hệ thống suy luận của mình và liệu cấu trúc đó có phù hợp với các ưu tiên trường hợp sử dụng của họ hay không. Hôm nay, tôi sẽ trình bày cách thiết kế các hệ thống suy luận từ đầu khi mục tiêu duy nhất của bạn là tạo ra token với chi phí thấp nhất có thể. Cách tiếp cận tập trung này có thể vượt trội hơn các thiết lập đa năng phổ biến đến hơn một bậc độ lớn.
Điều đầu tiên tôi muốn nói là tôi cực kỳ tiết kiệm, nhờ người cha gốc Thổ Nhĩ Kỳ của tôi. Tôi không bao giờ mua bất cứ thứ gì mà không mặc cả. Tại Doubleword, chúng tôi là một công ty chuyên về suy luận. Một trong những trường hợp sử dụng tạo ra lượng token cao nhất mà chúng tôi từng gặp, đặc biệt trong 6 đến 12 tháng qua, và đang phát triển khá nhanh, là các trường hợp sử dụng không theo thời gian thực nhưng tạo ra rất nhiều token. Chúng tôi đã dành nhiều thời gian để suy nghĩ về cách tạo ra token rẻ hơn nhiều, và đó là những gì tôi sẽ chia sẻ trong buổi nói chuyện này.
**Đánh đổi trong suy luận và kinh tế học token**
Tôi sẽ dành chút thời gian để thiết lập kinh tế học suy luận và cách chúng tôi tính phí token. Suy luận là một trò chơi đánh đổi, giống như hầu hết mọi thứ. Bạn chỉ có thể có hai trong ba yếu tố: độ trễ thấp (tức là tốc độ tạo token), chi phí token và chất lượng token. Tôi sẽ trình bày từng ví dụ cụ thể. Tôi có thể nói rằng tôi sẽ đánh đổi chi phí. Tôi sẽ không quan tâm đến chi phí. Vậy bạn sẽ thực hiện đánh đổi này như thế nào? Tôi sẽ thực hiện các việc như chạy ở kích thước lô (batch size) thấp, sử dụng phần cứng rất đắt tiền. Tôi sẽ thực hiện các tối ưu hóa suy luận tập trung vào độ trễ. Điều này thực sự hữu ích cho một số trường hợp sử dụng, ví dụ phổ biến là các trợ lý viết mã (coding assistants). Một ví dụ khác là chatbot, nơi bạn có thể quan tâm đến độ trễ rất thấp và đầu ra chất lượng cao.
Tôi có thể đưa ra một lựa chọn khác là đánh đổi chất lượng mô hình. Tôi muốn phản hồi nhanh chóng và chi phí thấp. Tôi có thể sử dụng một mô hình nhỏ hơn. Tôi có thể lượng tử hóa (quantize) mô hình. Các trường hợp sử dụng theo thời gian thực của phương pháp này có thể là các mô hình bảo vệ (guardrails) hoặc mô hình định tuyến (routing model), hoặc tôi chưa đề cập ở đây, nhưng cả các mô hình trên thiết bị (on-device models) nữa. Nếu tôi thực sự muốn chạy một cái gì đó cục bộ trên thiết bị, tôi sẽ thực hiện đánh đổi này. Sự đánh đổi mà tôi quan tâm và sẽ nói đến hôm nay là khi tôi không quan tâm đến độ trễ. Tất cả những gì tôi quan tâm là chất lượng mô hình cao và chi phí rất thấp. Làm thế nào để thực hiện đánh đổi này? Tôi sẽ nói chi tiết hơn trong buổi nói chuyện này. Tôi sẽ thực hiện các việc như tối ưu hóa theo lô cụ thể, sắp xếp lại hàng đợi, lập lịch thông minh. Điều thú vị đối với tôi là loại đánh đổi này thực sự rất phổ biến.
Các trường hợp sử dụng bao gồm xử lý dữ liệu, các tác nhân ngoại tuyến (offline agents). Tôi có một tác nhân chạy qua đêm thực hiện một quy trình làm việc phức tạp và dài. Tóm tắt, gắn nhãn dữ liệu, tạo dữ liệu. Tạo dữ liệu tổng hợp (synthetic data generation) nếu tôi đang thực hiện tinh chỉnh (fine-tuning) hoặc học tăng cường (RL). Có rất nhiều trường hợp sử dụng thuộc nhóm này. Một điều thú vị là khi các mô hình ngày càng tốt hơn, số lượng trường hợp sử dụng trong nhóm này sẽ tiếp tục tăng lên, vì chúng ta có thể tin tưởng các mô hình hoạt động độc lập mà không cần luôn có sự can thiệp của con người ở mọi bước có thể. Đây chính là sự đánh đổi.
chúng ta đang thảo luận hôm nay. Trong lĩnh vực suy luận (inference), đã có rất nhiều nỗ lực tập trung vào các trường hợp sử dụng có độ trễ thấp. Có một sự đánh đổi giữa chi phí và độ trễ. Khi cần suy luận với độ trễ cực thấp, có những nhà cung cấp thực hiện rất tốt điều này, như Cerebras và Groq. Cách họ làm là thông qua phần cứng chuyên dụng. Sau đó, chúng ta có suy luận kiểu chatbot hàng ngày, với vLLM, SGLang là các framework phổ biến. Hầu hết các nhà cung cấp dịch vụ suy luận cũng nằm trong phân khúc độ trễ khá thấp này. Còn đối với các tác vụ có độ trễ cao nhưng chi phí rất thấp, đó là nơi nhóm nghiên cứu của chúng tôi đã tập trung trong khoảng sáu tháng đến một năm qua.
**Tạo ra các Token rẻ hơn**
Cách tôi sẽ cấu trúc bài nói chuyện này là tôi sẽ bắt đầu từ các token rất nhanh.

Nguồn tin: InfoQ AI — Tác giả: Meryem Arik. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.