
LLMs From Scratch đạt 100.000 lượt gắn dấu sao (star) trên GitHub
Kho lưu trữ LLMs-from-scratch đã vượt mốc 100.000 lượt gắn dấu sao (star) trên GitHub. Kho lưu trữ này cung cấp các tài liệu học tập về mô hình ngôn ngữ lớn (LLM), bao gồm: * Hướng dẫn từng bước xây dựng LLM từ đầu. * Giải thích chi tiết về các khái niệm cốt lõi của LLM. * Mã nguồn (code) minh họa cho các kiến trúc LLM phổ biến. * Tài nguyên bổ sung để nghiên cứu sâu hơn.
Vừa qua, kho lưu trữ LLMs-from-scratch đã vượt mốc 100.000 lượt gắn dấu sao (star) trên GitHub.
Đây là một tín hiệu rất tích cực và tạo động lực. Chúng tôi rất vui khi thấy kho lưu trữ mã nguồn mở này đã hỗ trợ được nhiều người.
Xin cảm ơn tất cả những người đã chia sẻ ý tưởng và đóng góp các yêu cầu kéo (PR) để cải thiện dự án.
Chúng tôi sẽ tiếp tục bổ sung các tài liệu mới, bao gồm các biến thể và kiến trúc chú ý (attention) mới (trong khi các dự án lớn hơn như RL và Reasoning From Scratch sẽ được đặt trong các kho lưu trữ riêng biệt).
Hiện tại, chúng tôi cũng đang thực hiện một dự án lớn hơn về ứng dụng mô hình ngôn ngữ lớn (LLM) "nhỏ" tùy chỉnh. Dự án này đã chiếm rất nhiều thời gian trong tháng này, nhưng chúng tôi sẽ sớm chia sẻ thêm thông tin trong một bài viết lớn sắp tới trên Substack. Đây sẽ là bài viết dài nhất từ trước đến nay của chúng tôi.
Nếu bạn chưa biết về kho lưu trữ này, một số điểm nổi bật bao gồm:
Toàn bộ quy trình mã hóa từ mã hóa token (tokenization) và cơ chế chú ý (attention) đến huấn luyện trước (pretraining), phân loại (classification) và tinh chỉnh hướng dẫn (instruction fine-tuning), v.v. Tất cả đều được xây dựng TỪ ĐẦU. (RL nằm trong một kho lưu trữ đi kèm.)
Các triển khai từ đầu của Llama, Qwen, Gemma và Olmo (các biến thể nhỏ hơn chạy cục bộ và có thể được tích hợp vào các tập lệnh huấn luyện).
Các triển khai từ đầu của các phương án chú ý thay thế và các thành phần kiến trúc khác, như GQA, MLA, chú ý cửa sổ trượt (sliding-window attention), Gated DeltaNet, DeepSeek Sparse Attention, chia sẻ KV giữa các lớp (cross-layer KV sharing) và hỗn hợp chuyên gia (mixture-of-experts).
Các tài liệu về bộ nhớ đệm KV (KV caching), hiệu suất huấn luyện, tải trọng lượng hiệu quả bộ nhớ, DPO, đánh giá và LoRA.
Vì vậy, nếu bạn chưa có kế hoạch gì cho cuối tuần, hãy cùng khám phá!
Các hình ảnh từ kho lưu trữ LLMs-from-scratch.
Nguồn: phiên bản trang web của ghi chú Substack của tôi.
Nguồn tin: Sebastian Raschka. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.