
Dạy mọi người câu cá để kiếm token
Dịch vụ dọn phòng: Không có lồng tiếng cho bài đăng này khi tôi đang đi du lịch. Sự so sánh lâu đời nhất mà mọi người cố gắng thực hiện là những gì đang diễn ra với các mô hình mở so với các dự án phần mềm nguồn mở cơ bản như hệ điều hành Linux. Có những sự tương tự khá rõ ràng, nhưng chúng vẽ ra một con đường hẹp phía trước cho bản chất tự duy trì của hệ sinh thái mô hình nguồn mở, nơi mà khi Linux đủ lớn, nó sẽ tự hoàn thiện thành công cụ tốt nhất có thể cho nhiều công việc. Mô hình ngôn ngữ nguồn mở - tức là chỉ những mô hình đi kèm với công thức đào tạo, dữ liệu, mã, v.v. đầy đủ.
Dịch vụ dọn phòng: Không có lồng tiếng cho bài đăng này khi tôi đang đi du lịch.
Sự so sánh lâu đời nhất mà mọi người cố gắng thực hiện là những gì đang diễn ra với các mô hình mở so với các dự án phần mềm nguồn mở cơ bản như hệ điều hành Linux. Có những sự tương tự khá rõ ràng, nhưng chúng vẽ ra một con đường hẹp phía trước cho bản chất tự duy trì của hệ sinh thái mô hình nguồn mở, nơi mà khi Linux đủ lớn, nó sẽ tự hoàn thiện thành công cụ tốt nhất có thể cho nhiều công việc. Mô hình ngôn ngữ nguồn mở - tức là chỉ các mô hình đi kèm với công thức đào tạo, dữ liệu, mã, v.v. đầy đủ - gần giống với hệ điều hành nguồn mở hơn. Các mô hình trọng số mở mà bạn sử dụng – những mô hình chỉ có trọng số mô hình và mã suy luận để chạy chúng – gần giống với các phiên bản phần mềm cụ thể mà bạn cài đặt trong dự án được xây dựng dựa trên chúng.
Chia sẻ
Trọng lượng mô hình trung bình rất nhất thời, nhưng chúng vẫn có thời hạn sử dụng lâu dài, giống như nhiều phần mềm được sử dụng nhiều. Đó là lý do tại sao nhiều công ty vẫn đang sử dụng quy trình làm việc được xây dựng trên Llama 3, bất chấp các hành vi tác nhân đã phổ biến nhiều năm sau đó. Công thức nguồn mở, điển hình trong thời hiện đại là các mô hình Olmo mà tôi đã giúp xây dựng tại Ai2, cùng với các mô hình tiền nhiệm như Pythia từ EleutherAI, là một quy trình sử dụng nhiều tài nguyên mà bất kỳ công ty nào cũng có thể chọn, sửa đổi và nhấn “chạy” để tạo ra một bộ trọng số mô hình mới. Trong trường hợp tốt nhất, cộng đồng cũng có thể đóng góp những cải tiến về dữ liệu hoặc mã đào tạo cho mô hình tiếp theo! Đây là lý do tại sao Nvidia đang đầu tư rất nhiều vào các mô hình gần như nguồn mở – đối với các mô hình Nemotron, họ phát hành tất cả dữ liệu mà họ có thể hợp pháp và mã đào tạo, v.v. Nvidia muốn một thế giới nơi vô số người có thể chế tạo máy mã thông báo, vì vậy trí thông minh không bị độc quyền. Đây là một thế giới có nhu cầu suy luận rất lớn ở nhiều công ty, tất cả đều muốn mua sản phẩm của Nvidia.
AI nguồn mở có một tương lai khó khăn vì việc xây dựng những mô hình tốt nhất đòi hỏi rất nhiều vốn. Khả năng xây dựng các mô hình cạnh tranh đã trở nên dễ tiếp cận hơn trong ngành lâu hơn nhiều người mong đợi. Kỳ vọng mặc định của nhiều người là các mô hình đào tạo quá đắt và công thức nguồn mở còn quá xa, vì vậy việc xây dựng một phòng thí nghiệm mới tập trung vào một số phần của LLM đào tạo sẽ không thể thực hiện được.
Có hai tương lai từ đây. Đầu tiên là nếu “nó hoạt động” – nếu công thức nguồn mở phù hợp với Nvidia, họ sẽ tạo ra nhu cầu về chip (và lợi nhuận) của mình nhiều hơn chi phí xây dựng mô hình. Hiện tại có thông tin cho rằng Nvidia đang chi 26 tỷ USD cho nỗ lực này. Không rõ liệu điều này có hiệu quả hay không, hay liệu việc thâm dụng vốn của AI sẽ khiến ngày càng nhiều công ty rời khỏi cuộc chơi đào tạo hay không. Chúng tôi chưa thấy nhiều dấu hiệu cho thấy sự khởi đầu này. Trên thực tế, việc các công ty rút lui – như Databricks và 01.ai – có vẻ như là những điều bất thường.
Hệ sinh thái nguồn mở sẽ ngày càng phụ thuộc vào nguồn tài chính của Nvidia trong những năm tới. Đây là một cơ hội tồn tại, trong vòng vài năm tới, lợi nhuận của phương pháp này sẽ quay trở lại với họ hoặc một công ty mô hình mở khác cần phát triển các vòng phản hồi tài chính giống như nền tảng về tính cởi mở của họ. Phần thưởng kinh tế này cần phải tỷ lệ thuận với lợi nhuận do API của Anthropic và OpenAI tạo ra để theo kịp tốc độ phát triển mô hình ngôn ngữ trong nhiều thập kỷ. Điều này có thể được thúc đẩy bởi khả năng cạnh tranh về hiệu suất hoặc bởi hệ thống AI.
om chỉ lớn đến mức các công ty đào tạo, suy luận và tinh chỉnh mô hình mở đều có nhu cầu rất lớn.
Tương lai thứ hai là nếu một trong hai con đường tích cực về mặt tài chính này không diễn ra, các mô hình mở sẽ rẽ sang một con đường phát triển khác với các mô hình đóng hàng đầu - một tập trung hơn vào hiệu quả, khả năng sửa đổi, chuyên môn hóa, v.v. Tôi nghĩ điều này là kết quả rất có thể xảy ra - các mô hình mở vẫn cực kỳ hữu ích, nhưng lấp đầy một hệ sinh thái đuôi dài so với các đối tác đóng có cổ phần sở hữu độc quyền trong các lĩnh vực có giá trị nhất như hợp tác công việc tri thức, khám phá thuốc, SWE, v.v. Cái đuôi dài giống như các đại lý dành riêng cho doanh nghiệp điều hành tại chỗ với dữ liệu riêng tư về các nhiệm vụ kinh doanh lặp đi lặp lại.
Một phần lý do tại sao tôi nghĩ việc đào tạo nguồn mở này sẽ khó bắt kịp là vì việc đào tạo ngày càng phức tạp và trừu tượng hơn. Hệ sinh thái mô hình mở hiện tại được thúc đẩy bởi sự bùng nổ mối quan tâm đến các mô hình mở sau đào tạo. Những người này sử dụng các mô hình như DeepSeek V4 Flash, Inkling Small hoặc GLM 5.X và tinh chỉnh chúng cho các nhiệm vụ cụ thể của họ (ví dụ: trong Tinker, API tinh chỉnh phổ biến nhất hiện nay).
Interconnects AI là một ấn phẩm được người đọc hỗ trợ. Hãy cân nhắc việc trở thành người đăng ký.
Trong vài năm qua, đào tạo sau phần lớn đề cập đến toàn bộ quá trình sửa đổi mô hình cơ sở để làm cho nó trở nên thông minh và có thể sử dụng được. Có một sự thay đổi đang diễn ra khi khả năng đào tạo một mô hình cơ sở trở thành một nhà lý luận tổng quát đang trở nên mờ mịt giống như các phương pháp đào tạo trước trên quy mô lớn từ vài năm trước. Điều này có thể đi xa đến mức thay đổi từ vựng về đào tạo trước, giữa, sau đào tạo đã được thiết lập tiêu chuẩn trong vài năm. Nó có thể trở thành một thứ gì đó gần giống với đào tạo trước, đào tạo lý luận và đào tạo sau.
Vì người ta ít quan tâm đến việc đào tạo toàn bộ mô hình nên cũng ít quan tâm đến việc đầu tư vào AI nguồn mở. Đây là những gợi ý duy nhất mà chúng tôi sẽ nhận được, nhưng chúng tôi không thể làm gì nhiều để chống lại sức nặng kinh tế của những tình huống này. Xu hướng này là bước tiếp theo khiến số lượng người xây dựng mô hình mở phát hành các mô hình cơ sở (phiên bản mô hình trước khi đào tạo lý luận cốt lõi) tiếp tục giảm. Nó đi đôi với việc các nhà xây dựng mô hình mở đang thử nghiệm giấy phép chia sẻ doanh thu để sử dụng tiếp theo trong các sản phẩm hoặc suy luận. Đây là những thử nghiệm nhằm duy trì nguồn tài chính khả thi để xây dựng các mô hình trọng lượng mở gần biên giới – rất nhiều
Nguồn tin: Interconnects Newsletter — Tác giả: Nathan Lambert. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.