Tupoi: Một mô hình ngôn ngữ lớn (LLM) không cần cơ chế chú ý (attention), với bộ nhớ O(1) nghiêm ngặt và trạng thái 6 KB.
Địa chỉ URL bài viết: https://github.com/narelabs/TUPOI Địa chỉ URL bình luận: https://news.ycombinator.com/item?id=49312921 Điểm: 1 Số bình luận: 0
TUPOI: Mô hình ngôn ngữ hậu Transformer với bộ nhớ O(1)
Một kiến trúc mô hình hóa chuỗi (sequence modeling) không cần cơ chế chú ý (attention), có độ phức tạp dưới bậc hai (sub-quadratic), thay thế các ma trận chú ý dày đặc bằng Bộ tích hợp Hamilton Symplectic (Velocity-Verlet).
Tác giả: NARE LABS (Được xây dựng bởi một cá nhân 15 tuổi)
Kho lưu trữ này chứa bản triển khai tham chiếu, trọng số được huấn luyện trước và bộ kiểm định thực nghiệm cho mô hình ngôn ngữ TUPOI. Đây là một kiến trúc hậu Transformer loại bỏ hoàn toàn cơ chế Attention và bộ nhớ đệm KV (KV-cache) liên tục, thay vào đó sử dụng động lực học không gian pha Hamilton liên tục.
Mục tiêu chính của nghiên cứu này là điều tra xem liệu việc mô hình hóa ngữ cảnh chuỗi dưới dạng các hạt chuyển động trong không gian pha symplectic $(q, p)$ có thể đạt được khả năng biểu đạt tương đương với các mô hình Transformer tiêu chuẩn hay không, đồng thời đảm bảo nghiêm ngặt mức tiêu thụ bộ nhớ $O(1)$ và không có sự tiêu tán trạng thái ($\det(J) \equiv 1.0$).
🔬 Kiến trúc
TUPOI thay thế cơ chế Attention có độ phức tạp $O(N^2)$ bằng một hệ thống chuyển đổi symplectic sâu:
1. Lõi Hamilton Symplectic
Trạng thái ẩn được phân tách thành các tọa độ chính tắc $(q, p)$ và được tích hợp qua 24 lớp thông qua lược đồ động lực học Velocity-Verlet Leapfrog:
$$p_{t+1/2} = p_t - \frac{\Delta t}{2} \nabla V(q_t)$$
$$q_{t+1} = q_t + \Delta t , p_{t+1/2}$$
$$p_{t+1} = p_{t+1/2} - \frac{\Delta t}{2} \nabla V(q_{t+1})$$
Vì định thức Jacobi của phép biến đổi này thỏa mãn $\det(J) \equiv 1.000000$ (Định lý Liouville), thể tích không gian pha được bảo toàn nghiêm ngặt theo chiều sâu chuỗi. Thông tin không được tạo ra cũng không bị phá hủy trong quá trình truyền tiến (forward pass).
2. IgnoranceGate & OpinionAnchor
Để ổn định các biểu diễn ngôn ngữ trên các chân trời tạo sinh vô hạn:
IgnoranceGate: Một bộ lọc sigmoid trơn được học $x' = x \odot \sigma(W_g x)$ giúp làm suy giảm nhiễu token trước khi làm nhiễu không gian pha.
OpinionAnchor: Một trung bình động hàm mũ đang chạy $a_t = (1-\eta)a_{t-1} + \eta \cdot \bar{x}'$ hoạt động như một điểm hấp dẫn pha chính tắc.
📊 Kết quả thực nghiệm
Các đánh giá tập trung vào việc so sánh nghiêm ngặt, trực tiếp với một mô hình Transformer kiểu GPT tiêu chuẩn (BaselineLM) dưới các ràng buộc huấn luyện giống hệt nhau (seed, optimizer, token budget, parameter scale).
1. Mô hình hóa ngôn ngữ & Quy luật mở rộng (TinyStories, quy mô ~300M)
Thiết lập: Bộ mã hóa GPT-2 BPE (từ vựng: 50.257), seq_len=512, được huấn luyện trong 10.000 bước trên Tesla T4.
| Cấp mô hình | Tham số hoạt động | Loss xác thực cuối cùng | Perplexity (PPL) | Độ phức tạp | Trạng thái |
|---|---|---|---|---|---|
| TUPOI-17M (S) | 16,9 M | 4,1516 | 63,53 | $O(1)$ | Đã xác minh |
| TUPOI-47M (M) | 47,0 M | 4,1078 | 60,81 | $O(1)$ | Đã xác minh |
| BaselineLM (Transformer) | 355,0 M | 3,9280 | 50,80 | $O(N^2)$ | Baseline |
| TUPOI-300M (L) | 304,2 M | 3,8371 | 46,39 | $O(1)$ | Người chiến thắng 🏆 |
Phân tích: TUPOI hội tụ đáng tin cậy sau 10.000 bước và đạt được perplexity xác thực vượt trội (46,39 so với 50,80) trong khi sử dụng ít hơn 14% tham số so với mô hình Transformer cơ sở. Sự phù hợp với quy luật lũy thừa xác nhận rằng TUPOI mở rộng một cách có thể dự đoán được mà không đạt đến giới hạn dung lượng.
2. Dấu chân bộ nhớ trạng thái tự hồi quy ($O(1)$ so với $O(N)$)
Thiết lập: Dấu chân bộ nhớ ngữ cảnh trong quá trình tạo token tự hồi quy tuần tự (FP16).
| Token được tạo ($T$) | KV-Cache của Transformer (24L, 16H) | Trạng thái pha TUPOI $(q, p)$ | Lợi thế bộ nhớ |
|---|---|---|---|
| 512 | 48,00 MB | 6,00 KB | nhẹ hơn $8.000\times$ |
| 2.048 | 192,00 MB | 6,00 KB | nhẹ hơn $32.000\times$ |
| 8.192 | 768,00 MB | 6,00 KB | nhẹ hơn $128.000\times$ |
| 32.768 | 3,00 GB | 6,00 KB | nhẹ hơn $500.000\times$ |
| 65.536 | 6,00 GB (CUDA OOM) | 6,00 KB | nhẹ hơn $1.000.000\times$ 🏆 |
Phân tích: Các mô hình Transformer tiêu chuẩn tích lũy bộ nhớ đệm KV dung lượng O(N), đạt 6,0 GB ở ngữ cảnh 64k. TUPOI duy trì một vector trạng thái cố định 6,00 KB, cho phép tạo luồng vô hạn trên phần cứng tiêu dùng.
3. Thử nghiệm hiệu năng VRAM cao nhất của phần cứng (NVIDIA Tesla T4, FP16)
Thiết lập: Thử nghiệm hiệu năng truyền tiến (forward-pass) đánh giá dung lượng VRAM cao nhất được cấp phát (MB), đo trực tiếp qua `torch.cuda.max_memory_allocated()`.
Độ dài ngữ cảnh | Transformer cơ sở (MB) | VRAM của TUPOI-300M (MB) | VRAM tiết kiệm được | Trạng thái
---|---|---|---|---
512 token | 1.695,0 MB | 1.273,3 MB | -24,9% (-421,7 MB) | ✅ Đã xác minh
1.024 token | 1.743,3 MB | 1.325,3 MB | -24,0% (-418 MB) | ✅ Đã xác minh
2.048 token | 1.791,4 MB | 1.377,5 MB | -23,1% (-414 MB) | ✅ Đã xác minh
4.096 token | 1.889,6 MB | 1.483,6 MB | -21,5% (-406 MB) | ✅ Đã xác minh
8.192 token | 2.272,9 MB | 1.805,4 MB | -20,6% (-467 MB) | ✅ Đã xác minh
Phân tích: TUPOI hoạt động với mức cấp phát bộ nhớ cao nhất thấp hơn từ 400 MB đến 1,2 GB trên tất cả các độ dài chuỗi. Với ngữ cảnh 8.192 token, tổng thay đổi kích hoạt của TUPOI chỉ khoảng 500 MB so với cơ sở trọng số tĩnh (khoảng 1,21 GB).
⚠️ Hạn chế và công việc trong tương lai
Để duy trì tính nghiêm ngặt khoa học, chúng tôi lưu ý các hạn chế hiện tại sau:
Phạm vi cửa sổ ngữ cảnh: Mô hình 300M đã được xác thực với ngữ cảnh phần cứng lên đến 8.192 token. Các ngữ cảnh cực lớn (>128k) yêu cầu các nhân CUDA Flash-Verlet chuyên dụng.
Thử nghiệm hiệu năng tác vụ hạ nguồn: Việc tinh chỉnh có giám sát trên các thử nghiệm hiệu năng suy luận (GSM8k, MetaMathQA) hiện đang được tiến hành.
Mở rộng quy mô đa tỷ: Xác thực hành vi luật lũy thừa vượt qua ngưỡng 1 tỷ tham số vẫn là mục tiêu chính cho các phiên bản tiếp theo.
🔁 Khả năng tái tạo
Kho lưu trữ này chứa tất cả các tập lệnh cần thiết để tái tạo các phát hiện đã báo cáo ở trên.
1. Cài đặt
`git clone https://github.com/narelabs/TUPOI.git`
`cd TUPOI`
`pip install -r requirements.txt`
2. Giao diện dòng lệnh tạo văn bản tương tác (Interactive Text Generation CLI)
`python scripts/generate_cli.py`
3. Chạy thử nghiệm hiệu năng VRAM của phần cứng
`python benchmarks/benchmark_vram.py`
4. Tạo hình ảnh trực quan cho thử nghiệm hiệu năng
`python scripts/plot_benchmarks.py`
`python scripts/generate_dual_axis_charts.py`
📄 Trích dẫn
`@article{tupoi2026,`
` title={TUPOI: Symplectic Post-Transformer Language Model with O(1) Memory},`
` author={NARE LABS (Built by 15 y.o.)},`
` year={2026},`
` journal={arXiv preprint},`
` url={https://github.com/narelabs/TUPOI}`
`}`
⚖️ Giấy phép
Được phân phối theo Giấy phép MIT.

Nguồn tin: Hacker News LLM — Tác giả: IntellegenceIsP. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.