Một vài lưu ý: Không lồng tiếng cho một bài đăng "ra mắt" nhanh khác. Sẽ có thêm nhiều bài luận sớm!
Sau vài năm dài dành thời gian ghi lại những bài học từ việc huấn luyện các mô hình mở, cuốn sách về hậu huấn luyện của tôi đã hoàn thành! Sách được xuất bản bởi Manning, với tựa đề "Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs" (Học tăng cường từ phản hồi của con người: Căn chỉnh và hậu huấn luyện các mô hình ngôn ngữ lớn).
Kể về câu chuyện của cuốn sách là một cách hữu ích để giải thích lý do độc giả có thể muốn sở hữu một bản.
Cuốn sách bắt đầu như một trang web nơi tôi muốn ghi lại các phương pháp hậu huấn luyện quan trọng mà có thể không có tài liệu trực tuyến nào giải thích chúng. Nếu có, tôi sẽ không...
Dọn dẹp: Không lồng tiếng cho một bài đăng "ra mắt" nhanh khác. Sẽ có thêm nhiều bài luận sớm!
Sau vài năm dài tìm thời gian để ghi lại những bài học từ việc huấn luyện các mô hình mở, cuốn sách về hậu huấn luyện của tôi đã hoàn thành! Sách được xuất bản bởi Manning, với tựa đề "Reinforcement Learning from Human Feedback: Aligning and Post-training LLMs" (Học tăng cường từ phản hồi của con người: Căn chỉnh và hậu huấn luyện các mô hình ngôn ngữ lớn).
Kể lại câu chuyện về cuốn sách là một cách hữu ích để giải thích lý do độc giả có thể muốn sở hữu một bản.
Cuốn sách bắt đầu như một trang web nơi tôi muốn ghi lại các phương pháp hậu huấn luyện quan trọng mà có thể không có tài liệu trực tuyến nào giải thích. Nếu có, tôi cũng không thể tìm thấy. Điều này tồn tại đối với nhiều chủ đề hơn độc giả có thể mong đợi, vì hậu huấn luyện đã phổ biến vào năm 2024 (khi tôi mua tên miền) và tiếp tục cho đến ngày nay. Các chủ đề như lấy mẫu từ chối (rejection sampling), mô hình phần thưởng kết quả (outcome reward models) và huấn luyện nhân vật (character training) là những ví dụ điển hình. Điều này đã giúp trang web trở nên khá phổ biến, vì đây vẫn là một trong số ít nơi thảo luận về các chủ đề này một cách cơ bản, trực quan.
Ngoài ra, phần lớn cuốn sách là về việc truyền đạt các trực giác và lịch sử. Phần lớn ngành công nghiệp LLM được định hình bởi các kỹ thuật cốt lõi không thay đổi nhiều trong vài năm qua. Cuốn sách này là nỗ lực của tôi để giải thích một cách đơn giản lý do hậu huấn luyện hoạt động, những đánh đổi mà mọi người cần thực hiện để thực hiện đúng, và những quan niệm sai lầm mà mọi người thường mắc phải. Để làm được điều này, một số bài đăng blog cũ, nền tảng trên Interconnects đã được chỉnh sửa để xâu chuỗi câu chuyện đằng sau các chủ đề toán học quan trọng. Vì lý do này, nhiều văn bản giải thích có giọng văn cao hơn so với một cuốn sách giáo khoa thông thường.
Đây là cuốn sách tôi muốn đọc khi mới bắt đầu vài năm trước! Với số lượng người vẫn hỏi tôi những câu hỏi cơ bản về hậu huấn luyện, thực tế là một nhóm người đang tăng lên về quy mô, tôi nghi ngờ cuốn sách này sẽ được đón nhận rất nồng nhiệt. Tôi vẫn thường xuyên sử dụng cuốn sách và nghe từ các nhà nghiên cứu có kinh nghiệm trong ngành rằng họ cũng vậy. Vì vậy, đây không phải là một cuốn sách dành cho người mới bắt đầu – nó phù hợp hơn với những người đã hoàn thành bằng cử nhân Khoa học Máy tính – nhưng nếu độc giả nắm vững nó, họ sẽ tiến xa hơn rất nhiều trong thế giới quan về hậu huấn luyện của mình.
Chia sẻ
Ưu đãi dành cho độc giả!
Cuốn sách cũng có sẵn trực tuyến miễn phí và đi kèm với một khóa học đầy đủ 12 giờ (slide + video trên YouTube), một cơ sở mã đơn giản với các bài tập gợi ý và so sánh hoàn thành mô hình. Sách được giảm giá 50% cho đến ngày 19/8 trên Manning với mã PBLambert.
Mua sách của tôi từ Manning
Mua sách của tôi trên Amazon
Đúng vậy, tiêu đề của cuốn sách này hơi lỗi thời – tôi đã học được một số bài học và trải qua một số khó khăn với quy trình xuất bản – nhưng tôi có thể đảm bảo nội dung rất mới mẻ. Tôi thường xuyên tham khảo cuốn sách cho công việc nghiên cứu của mình và nghe từ bạn bè rằng họ cũng làm như vậy. Tôi đã thêm một phần về chưng cất theo chính sách (on-policy distillation) vào phút cuối cùng! Cuốn sách hiện đang được vận chuyển từ Manning và Amazon Mỹ, và từ Amazon Anh vào tháng 10.
1. Trực giác về cách các thuật toán RL thay đổi đầu ra của mô hình
Theo số lượng từ hoặc trang, cuốn sách dành khoảng 25% cho RL. Điều này có vẻ phù hợp. Nếu có một điều cuốn sách đang làm, đó là dạy mọi người cách suy nghĩ về các thuật toán RL khác nhau. Trực giác này, từ định lý gradient chính sách (policy-gradient theorem) đến PPO và các phiên bản hiện đại như GSPO và CISPO, là rất quan trọng để hiểu liệu một thuật toán mới là giả mạo hay có tiềm năng (không có thuật toán mới nào sẽ được chứng minh đúng ngay từ đầu).
Dưới đây là một ví dụ về trực giác mà độc giả nên có.
độc giả có thể nắm bắt sau khi đọc.
Ví dụ, đây là một hình minh họa thú vị mà chúng tôi đã cải tiến để làm rõ cơ chế cắt (clipping) của PPO. Rốt cuộc, hàm mục tiêu xấp xỉ của PPO được quy về sáu vùng. Các vùng này có thể được xem là hai gradient, khi lợi thế (advantage) cho một token là dương hoặc âm, tùy thuộc vào giá trị hiện tại của tỷ lệ chính sách (policy ratio). Đối với một mẫu riêng lẻ trong một lần hoàn thành, nó nằm ở một vị trí nào đó trên biểu đồ này. Nếu đó là bước gradient đầu tiên trong lô, nó bắt đầu ở giá trị 1 trên trục x (gradient luôn dịch chuyển), sau đó tùy thuộc vào cách tỷ lệ cập nhật sau khi thay đổi hành vi chính sách RL, gradient sẽ giữ nguyên hoặc trở thành 0 (đây là mục đích của các đối số cắt).
Trực giác này được áp dụng rất chặt chẽ vào cách thiết kế các hệ thống, nhằm quản lý các gradient và các vấn đề số học mà chúng thường gây ra. Phần về gradient chính sách (policy-gradient) tập trung vào toán học khá kỹ lưỡng, bao gồm tất cả các thuật toán mà độc giả có thể đã nghe đến trong 3 năm qua:
Deriving the Policy Gradient (Đạo hàm Gradient Chính sách)
Vanilla Policy Gradient (Gradient Chính sách Cơ bản)
REINFORCE
REINFORCE Leave One Out (RLOO)
Proximal Policy Optimization (PPO)
Understanding the PPO Objective (Hiểu về Mục tiêu của PPO)
Value Functions and PPO (Hàm Giá trị và PPO)
Group Relative Policy Optimization (GRPO)
Group Sequence Policy Optimization (GSPO)
Clipped Importance Sampling Policy Optimization (CISPO)
Comparing Algorithms (So sánh các Thuật toán)
2. Hiểu biết về các yếu tố quan trọng mà các hệ thống và thuật toán học tăng cường (RL) mới phải đối mặt
Hầu hết các hệ thống RL hiện đại là một vấn đề cân bằng giữa một số yếu tố – mức độ lệch chính sách (off-policy) của dữ liệu, sự không khớp giữa huấn luyện và suy luận (training-inference mismatch), và thông lượng (throughput). Thiết kế hệ thống cốt lõi, RL bất đồng bộ (asynchronous RL) với các GPU riêng biệt cho bộ học (learner) (các GPU thực hiện các bước gradient) và bộ tác nhân (actor) (các GPU tạo ra các lần chạy thử nghiệm trong môi trường), đã tương tự nhau trong vài năm.
Các tác vụ dựa trên tác nhân (Agentic tasks) chỉ bổ sung thêm cơ sở hạ tầng trên nền tảng cơ bản này. Cuốn sách được thiết kế để trở thành tài liệu đơn giản nhất giúp người đọc bắt đầu từ gần như không có kiến thức về RL cho mô hình ngôn ngữ lớn (LLM) và sẵn sàng thử nghiệm với các hệ thống. Sách bắt đầu với những kiến thức cơ bản, chẳng hạn như giải thích dạng chung của việc triển khai một thuật toán RL:
pg_loss = -advantages * ratio
Sách tiếp tục hướng dẫn về tổng hợp hàm mất mát (loss aggregation) – ý tưởng đã tạo ra DAPO và Dr. GRPO như một số biến thể GRPO tiên phong, ban đầu – và lấy mẫu quan trọng bị cắt cụt (truncated importance sampling) – kỹ thuật được sử dụng để làm cho PPO hoạt động trong các thử nghiệm RL ban đầu.
Policy-Gradient Basics (Các Khái niệm Cơ bản về Gradient Chính sách)
Loss Aggregation Tradeoffs (Đánh đổi trong Tổng hợp Hàm mất mát)
Asynchronous RL Systems (Hệ thống RL Bất đồng bộ)
Truncated Importance Sampling (Lấy mẫu Quan trọng bị Cắt cụt)
Ex
Nguồn tin: Interconnects Newsletter — Tác giả: Nathan Lambert. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.