
[AINews] Giá bộ nhớ tăng 500% sau 12 tháng
Ngay cả khi Sama tiếp tục thực hiện Great Pacing và Etched trở thành kỳ lân đôi và Cerebras đã công bố CS4 chạy các mô hình 10T với tốc độ 1000 tok/s, tình trạng thiếu bộ nhớ vẫn tiếp tục không giảm kể từ khi chúng tôi thực hiện nhóm SemiAnalysis vào tháng 2. Phần cứng của Tom: Chúng ta chính thức rơi vào tình thế khó khăn. Hầu như không có cách nào, nếu bạn đang đọc trang này, mà bạn không biết rằng giá bộ nhớ đã hoàn toàn khác với thực tế. Một số người gọi nó là RAMpocalypse; Tôi thích “RAMageddon” hơn. Đúng vậy: bộ dụng cụ DDR5 128GB đắt hơn gấp mười lần.
Ngay cả khi Sama tiếp tục thực hiện Great Pacing và Etched trở thành kỳ lân đôi và Cerebras đã công bố CS4 chạy các mô hình 10T với tốc độ 1000 tok/s, tình trạng thiếu bộ nhớ vẫn tiếp tục không giảm kể từ khi chúng tôi thực hiện nhóm SemiAnalysis vào tháng 2.
Phần cứng của Tom:
Chúng ta chính thức rơi vào tình thế khó khăn. Hầu như không có cách nào, nếu bạn đang đọc trang này, mà bạn không biết rằng giá bộ nhớ đã hoàn toàn khác với thực tế. Một số người gọi nó là RAMpocalypse; Tôi thích “RAMageddon” hơn.
Đúng vậy: bộ 128GB DDR5 đắt hơn gấp mười lần so với mức giá thấp nhất mà chúng tôi từng thấy.
Trên thực tế, tình hình nghiêm trọng đến mức những người mua siêu quy mô được cho là đã chốt gần như toàn bộ năng lực sản xuất DRAM toàn cầu cho năm 2027, giao tiền đặt cọc trước để đảm bảo nguồn cung DRAM quý giá của họ, hiện là một trong những mặt hàng có giá trị cao nhất trên thế giới tính theo trọng lượng; chip DRAM chính thống có giá trị hơn một nửa mỗi kg so với vàng nguyên khối.
Nói cách khác, Định luật Moore nổi tiếng đẩy giá tất cả các đơn vị phần cứng xuống đã bị đảo ngược đối với bộ nhớ:
Bản tin AI ngày 17/8/2026-18/8/2026. Chúng tôi đã kiểm tra 12 subreddits, 544 Twitter và không có Discord nào nữa. Trang web của AINews cho phép bạn tìm kiếm tất cả các số báo trước đây. Xin nhắc lại, AINews hiện là một phần của Không gian tiềm ẩn. Bạn có thể chọn tham gia/không tham gia tần suất email!
Tóm tắt Twitter của AI
Tạm dừng RL biên giới của OpenAI, giám sát mở rộng và chuyển hướng sang “Tạo nhịp độ biên giới”
OpenAI đã làm chậm quá trình đào tạo biên giới để tăng cường kiểm soát an ninh và liên kết: Sự phát triển an toàn/hệ thống lớn nhất trong ngày là OpenAI cho biết họ đã tạm dừng một số khóa đào tạo RL biên giới trong hai tuần và vẫn đang tổ chức đợt chạy RL biên giới lớn nhất theo kế hoạch trong khi tăng cường giám sát, cách ly và lập nhóm đỏ. Sam Altman coi đây là trường hợp mà khả năng vượt xa mức độ sẵn sàng về an toàn/liên kết, trong khi Greg Brockman nhấn mạnh rằng niềm tin vào an toàn sẽ ngày càng quyết định tốc độ mở rộng biên giới. OpenAI cũng làm rõ sự chậm lại chủ yếu ảnh hưởng đến các bản phát hành ở xa hơn chứ không ảnh hưởng đến các mẫu đã gần xuất xưởng.
Các biện pháp kiểm soát cụ thể quan trọng hơn việc nhắn tin rộng rãi: OpenAI chia sẻ nhiều chi tiết triển khai hơn bình thường, bao gồm cách ly khối lượng công việc/mạng mạnh hơn, kiểm tra bảo mật liên tục và giám sát nhiều tầng. Bình luận thứ cấp nêu bật các chi tiết hoạt động thú vị: việc giám sát có thể tăng thêm khoảng 20% chi phí hoạt động, việc giám sát mã thông báo lấy mẫu có thể gửi trang cho các nhóm nghiên cứu/bảo mật/an toàn trong vòng ~30 phút và suy luận sử dụng công cụ cho các hệ thống có rủi ro cao hơn có thể đi kèm với các màn hình hoạt động được đính kèm, theo @eliebakouch. Dù người ta nghĩ gì về việc đóng khung chính sách, điều này đáng chú ý là sự thừa nhận công khai rằng các thiết bị giám sát cơ sở hạ tầng đào tạo/đánh giá và thời gian suy luận hiện đang là điểm nghẽn đối với tiến độ biên giới, chứ không chỉ là tính toán thô.
Các mô hình mở: Động lực Qwen3.8-27B, Lợi ích sau đào tạo của GLM-5.3 và Cuộc tranh luận về mô hình nhỏ
Qwen3.8-27B đã trở thành tâm điểm của cuộc trò chuyện về mô hình mở/địa phương: Một số bài đăng coi Qwen3.8-27B là một khoảnh khắc “biên giới có thể chạy được cục bộ” mới, với @kimmonismus gọi đó là “khoảnh khắc DeepSeek” và Alibaba Qwen kỷ niệm nó đạt vị trí số 1 mô hình địa phương ở Cline sau 4 ngày. Các điểm chuẩn được trích dẫn trong chủ đề bao gồm #7 về Chỉ số tác nhân của Phân tích nhân tạo ở mức 27B, #6 trong số các mô hình trọng lượng mở trên Vals Index v2 và #1 về tiêu chuẩn pháp lý của Harvey trong số các trọng số mở và xếp hạng của chính Cline là mô hình địa phương hàng đầu mới của nó. Sự phản đối cũng mạnh mẽ không kém: @scaling01 lập luận rằng các chiến thắng về điểm chuẩn được phóng đại quá mức so với Opus 4.5 trong việc sử dụng mã hóa thực tế, nhấn mạnh sự phân chia ngày càng tăng giữa thành công trên băng ghế dự bị, hiệu quả chi phí và độ tin cậy về chất lượng trong các nhiệm vụ dài hạn.
Ý nghĩa an toàn của các mô hình địa phương có năng lực ngày càng khó bị loại bỏ: Một bài đăng có mức độ tương tác cao từ @kimmonismus ghi nhận bản dựng MLX "đã bị loại bỏ từ chối" của Qwen3.8-27B chạy cục bộ trên Apple Silicon ở các biến thể 2/4/6/8-bit, khẳng định tầm nhìn, lý luận, cách sử dụng công cụ được bảo toàn và bối cảnh 262K với tỷ lệ từ chối gần như bằng không. Độc lập với những lời hoa mỹ, đây là chủ đề rõ ràng nhất trong tập hợp chỉ ra một sự thay đổi thực sự: các mô hình hữu ích, có thể triển khai cục bộ, không bị kiểm duyệt một phần không còn là giả thuyết nữa.
GLM-5.3 trông giống như một câu chuyện hậu đào tạo/cơ sở hạ tầng, không phải là một câu chuyện mô hình cơ sở: Z.ai đã ra mắt GLM-5.3 thông qua API dành cho mã hóa, mạng phòng thủ và các đặc vụ tầm xa, với mức giá tương đương với GLM-5.2. Phân tích nhân tạo báo cáo rằng nó liên kết với Kimi K3 ở mức 60 trên Chỉ số thông minh, với bước nhảy 246 điểm trên GDPval-AA v2 lên 1770 Elo, trong khi vẫn giữ nguyên tổng 753B / 40B dấu chân MoE hoạt động, bối cảnh 1 triệu và giấy phép MIT khi có trọng số hạ cánh. Cách giải thích thú vị nhất về mặt kỹ thuật đến từ một bản tóm tắt dài của Zhihu được chuyển tiếp bởi @ZhihuFrontier: Lợi ích của GLM-5.3 dường như được thúc đẩy bởi quá trình đào tạo sau mạnh mẽ hơn, đặc biệt là RL không đồng bộ (SAO), đào tạo hộp cát có thể thực thi và chắt lọc chính sách để ngăn chặn sự lãng quên thảm khốc. Nếu đúng thì đây là điểm dữ liệu có ý nghĩa cho ý tưởng rằng việc mở rộng quy mô khả năng tác nhân đang chuyển từ số lượng tham số sang hệ thống RL + chất lượng môi trường.
Suy luận và hạ tầng hệ thống: Mã nguồn mở Mojo, Kết nối TensorRT, Bộ lưu trữ Git của con trỏ và Giải mã nhanh hơn
Mojo hiện là nguồn mở theo Apache 2.0: Thông báo của Mô-đun đã thu hút sự chú ý rộng rãi, với việc công ty chính thức cung cấp nguồn mở cho Mojo và cũng định vị nền tảng rộng hơn của mình như một lớp khả năng di động trên các bộ tăng tốc, bao gồm cả bộ tăng tốc AI của trung tâm dữ liệu Qualcomm. Đối với các kỹ sư cơ sở hạ tầng, tầm quan trọng của việc “cường điệu hóa ngôn ngữ mới” ít hơn so với sự kết hợp giữa tính mở của chuỗi công cụ cộng với tính trừu tượng của phần cứng.
NVIDIA đã nén quá trình triển khai từ mô hình sang TensorRT thành “hai lệnh”: NVIDIA đã khởi chạy TensorRT Model Connect trong bản xem trước công khai, hứa hẹn chuyển đổi trực tiếp từ các mô hình Hugging Face được hỗ trợ sang suy luận TensorRT từ đầu đến cuối mà không cần xuất ONNX trung gian, với đầu ra có thể triển khai thông qua API C++ gốc. Bài đăng cũng khẳng định pr

Nguồn tin: Latent Space — Tác giả: Latent.Space. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.