
Kog đang đi sâu hơn để tận dụng tối đa khả năng suy luận từ các GPU.
Theo startup Kog của Pháp, quan niệm cho rằng bộ xử lý đồ họa (GPU) không phù hợp với các quy trình làm việc dựa trên tác nhân (agentic workflows) có thể là một sự hiểu lầm.
Cuộc đua tăng tốc suy luận AI đang diễn ra sôi nổi, và thị trường đã chào đón nồng nhiệt Cerebras cùng các chip chuyên dụng của hãng trong đợt IPO vào tháng 5. Tuy nhiên, startup Kog của Pháp lại đặt cược rằng vẫn còn rất nhiều sức mạnh có thể khai thác từ các GPU thông thường.
Startup này đã xuất hiện trên trang nhất của Hacker News vào tháng 5 với bản xem trước công nghệ nhằm chứng minh rằng “giải mã một yêu cầu cực nhanh là khả thi trên các GPU trung tâm dữ liệu tiêu chuẩn mà các doanh nghiệp đã sở hữu” – chẳng hạn như các GPU AMD MI300X và Nvidia H200 mà họ đã sử dụng cho bản demo của mình.
Một số người thất vọng khi biết điều này không áp dụng cho GPU trong máy tính xách tay, nhưng những người khác lại nhìn thấy tiềm năng. Với tốc độ và chi phí suy luận hiện đang là nút thắt cổ chai quan trọng, lời hứa của Kog về việc mở khóa các khả năng mới trên phần cứng hiện có bằng cách tối ưu hóa phần mềm đã thu hút nhiều hơn những người quan sát. Giám đốc điều hành Gaël Delalleau chia sẻ với TechCrunch: “Chúng tôi đã có 200 khách hàng tiềm năng rõ ràng”.
Dựa trên phản hồi ban đầu, nhà sáng lập đơn độc này kỳ vọng kỹ thuật phần mềm sẽ là trường hợp sử dụng đầu tiên. Những người dùng Claude Code kỳ cựu đều biết rằng đôi khi họ phải chờ hàng giờ để nhận kết quả. Bản thân Anthropic cũng hiểu rằng tốc độ đáng giá tiền, và tính phí gấp nhiều lần cho Chế độ nhanh (Fast Mode) của Claude.
Kog hy vọng sẽ nhắm mục tiêu đến những khách hàng không hài lòng với những sự chậm trễ đó, thường là do họ phụ thuộc vào quy trình làm việc AI cho các tác vụ chuyên nghiệp. Tuy nhiên, startup này cũng có các đối tác thiết kế cho phép người dùng tạo trò chơi và ứng dụng bằng một lời nhắc, và đối với họ, một kết quả nhanh hơn nhờ Công cụ suy luận Kog (Kog Inference Engine - KIE) sẽ đồng nghĩa với nhiều doanh thu hơn, ông Delalleau cho biết.
Công ty nhận ra thị trường này chưa thực sự trưởng thành. Trong khi quan sát nhu cầu, Kog nhận thấy rằng các khách hàng tiềm năng của họ chưa sẵn sàng tinh chỉnh các mô hình nhỏ. “Và đó là lý do tại sao kể từ khi ra mắt, chúng tôi đã hoàn toàn tập trung vào việc đẩy nhanh quá trình phát triển các mô hình lớn hơn để đáp ứng nhu cầu mà chúng tôi đã thấy.”
Điều này đặt ra một bước nhảy vọt lớn cho Kog để thực hiện lời hứa “suy luận LLM nhanh hơn 30 lần”. Bản demo của họ đã thể hiện một con số ấn tượng là 3.000 token mỗi yêu cầu mỗi giây (TPS) – nhưng với một mô hình nhỏ được xây dựng chuyên dụng chỉ với khoảng 2 tỷ tham số, Laneformer 2B hiện đã được mã nguồn mở.
Mâu thuẫn với những người hoài nghi, ông Delalleau tự tin rằng cách tiếp cận tương tự có thể hoạt động tốt với các LLM, vốn có kích thước có thể là một thách thức đối với các chip suy luận. Ông nói: “GPU có một tương lai tươi sáng”. Đối với Giám đốc điều hành của Kog, ý tưởng rằng chúng không phù hợp để giải mã đã trở thành một quan niệm sai lầm; các GPU mới hơn có ngày càng nhiều băng thông bộ nhớ mà chỉ cần được khai thác.
Kog không đơn độc trong suy nghĩ rằng tối ưu hóa phần mềm có thể giúp GPU làm được nhiều hơn những gì được quảng cáo. ZML, cũng đến từ Pháp, đã phát hành phần mềm độc lập với phần cứng, bỏ qua CUDA của Nvidia để hỗ trợ suy luận nhanh trên các chip cạnh tranh. Nhưng ông Delalleau cho biết Kog giống với phòng thí nghiệm Hazy Research của Đại học Stanford hơn, với trọng tâm sâu hơn vào việc tăng tốc GPU.
Bản thân ông Delalleau không phải là một nhà nghiên cứu, và startup đầu tiên của ông, Stribe (cựu thành viên TechCrunch50 2009), không liên quan gì đến công ty mới của ông – ngoại trừ người đồng sáng lập cũ nay là nhà đầu tư mạo hiểm Kamel Zeroual, người có công ty Varsity VC đã đồng dẫn đầu vòng hạt giống của Kog. Tuy nhiên, trọng tâm sâu sắc của startup này bắt nguồn từ nền tảng độc đáo của ông.
Sau khi học vật lý chất rắn tại Trường Bách khoa Pháp (École Polytechnique), ông đã làm việc trong lĩnh vực an ninh mạng tấn công – còn được gọi là tấn công mũ trắng (white hat hacking). Theo ông Delalleau, điều này đã định hình tư duy mà ông hiện đang khuyến khích đội ngũ của mình áp dụng. Về mặt khoa học, “có tư duy hiểu các định luật vật lý và các định luật của GPU để tận dụng tối đa chúng”.
Đối với hoạt động tấn công mạng, người từng bốn lần lọt vào vòng chung kết giải đấu CTF của DEFCON cho biết điều đó đã dạy ông “phân tích ngược mọi thứ ở cấp độ rất thấp – đến ngôn ngữ hợp ngữ (assembly language) và mã nhị phân (binary code) – để hiểu cách thức hoạt động của chúng, và cố gắng sử dụng chúng để đạt được một mục tiêu mà chúng không nhất thiết được thiết kế cho”.
Nhược điểm của phương pháp này là nó đòi hỏi nhiều thao tác thủ công và tốn thời gian. “Đối với mỗi GPU mới, chúng tôi sẽ dành vài tuần hoặc thậm chí vài tháng để thực sự đi sâu vào chi tiết và tiến hành nghiên cứu kỹ thuật GPU trên phần cứng đó”. Với đội ngũ 11 người, điều này giới hạn số lượng chip mà Kog có thể làm việc, ít nhất là trong tương lai gần.
Về lâu dài, Kog hy vọng sẽ đưa phương pháp luận của mình vào các quy trình dựa trên tác nhân (agent-based pipelines) để có thể hỗ trợ nhiều chip và mô hình hơn. Khi châu Âu tìm cách xây dựng năng lực riêng của mình trên hai lĩnh vực này, điều này có thể tạo thêm động lực chủ quyền cho công ty khởi nghiệp, vốn đã được Scaleway hỗ trợ và được Bpifrance của Pháp cùng chương trình French Tech 2030 hậu thuẫn.
Tuy nhiên, hiện tại, Kog cần chứng minh cho thế giới thấy rằng phương pháp của họ hiệu quả trên các mô hình ngôn ngữ lớn (LLM). Điều này cũng sẽ là chìa khóa để đảm bảo thêm nguồn tài trợ. Ông Delalleau cho biết: “Khi chúng tôi triển khai mô hình lớn đầu tiên của mình với tốc độ nhanh gấp 10 lần, mà tôi nghĩ sẽ vào tháng 9, chúng tôi sẽ có thể bắt đầu chứng minh sức hút của khách hàng và từ đó, huy động vốn vòng Series A”.

Nguồn tin: TechCrunch AI — Tác giả: Anna Heim. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.