
Không có câu hỏi ngớ ngẩn: Kiến trúc ngữ cảnh AI là gì? Tại sao không tự xây dựng?
Trong chuyên mục "No Dumb Questions" (Không có câu hỏi ngớ ngẩn), Phoebe đã hỏi Giám đốc kỹ thuật Doug Whitley và Giám đốc sản phẩm Ash Zade của Stack mọi điều cô muốn biết về kiến trúc ngữ cảnh AI. Kiến trúc này chính xác là gì? Tại sao nó lại quan trọng đến vậy? Điều gì tạo nên một kiến trúc ngữ cảnh AI tốt? Tại sao phải mua khi có thể tự xây dựng?
Ngày 14 tháng 8 năm 2026
Không có câu hỏi ngớ ngẩn: Kiến trúc ngữ cảnh AI là gì? Tại sao không tự xây dựng?
Trong chuyên mục "Không có câu hỏi ngớ ngẩn" này, Phoebe đã hỏi Quản lý kỹ thuật của Stack, ông Doug Whitley và Quản lý sản phẩm Ash Zade mọi điều cô muốn biết về kiến trúc ngữ cảnh AI. Chính xác thì đó là gì? Tại sao nó lại quan trọng đến vậy? Điều gì tạo nên một kiến trúc ngữ cảnh AI tốt? Tại sao phải mua khi có thể tự xây dựng?
Phoebe Sajor: Chào Doug, chào Ash, cảm ơn hai anh đã tham gia chuyên mục "Không có câu hỏi ngớ ngẩn" này. Để bắt đầu – chính xác thì kiến trúc ngữ cảnh trong AI là gì và tại sao chúng ta lại quan tâm đến nó?
Doug Whitley: Về cơ bản, nó giống như kiến trúc ngữ cảnh thông thường khi nói về kiến trúc thực tế trong các tòa nhà. Kiến trúc ngữ cảnh AI là việc sắp xếp mọi thứ xung quanh AI vào hệ thống – những gì bạn đang xem, làm việc và nhìn thấy. Rất dễ bị cuốn vào các chi tiết nhỏ khi nói đến AI. Bạn có thể muốn có một ngữ cảnh rất tập trung mà bạn đang giữ trong hệ thống của mình. Ví dụ, với AI, tôi không nhất thiết phải biết hàng nghìn nhật ký đã tạo nên công việc tôi đang làm, nhưng tôi cần biết thông tin trong một tập hợp nhật ký rất cụ thể khi tôi đang cố gắng giải quyết một vấn đề liên quan đến chúng.
Ash Zade: Với tư cách là một Quản lý sản phẩm, tôi coi kiến trúc ngữ cảnh AI là những rào cản và ràng buộc mà chúng ta có thể cung cấp cho các tác nhân AI. Điều bạn đang cố gắng làm là loại bỏ việc ra quyết định mơ hồ và các biến số khỏi các tác nhân AI để người dùng có thể có những kết quả dễ đoán hơn. Nó có thể trông giống như việc thiết lập một hệ thống nói với tác nhân AI của bạn, “Chỉ xem xét dữ liệu này và với dữ liệu đó, chỉ thực hiện ba điều này. Nếu bạn gặp khó khăn, hãy làm hai điều này.” Vì vậy, tác nhân không chỉ có ngữ cảnh giới hạn cần thiết để hoạt động, mà còn có ngữ cảnh về những việc cần làm khi gặp phải các tình huống mới.
Phoebe Sajor: Gần đây tôi đã phỏng vấn Michael Foree trong chương trình này và anh ấy đã dạy tôi một chút về kỹ thuật ngữ cảnh. Kiến trúc ngữ cảnh khác với cơ sở hạ tầng ngữ cảnh như thế nào? Kiến trúc ngữ cảnh khác với kỹ thuật ngữ cảnh như thế nào? Tất cả chúng hoạt động cùng nhau ra sao?
Doug Whitley: Cách tốt nhất để hiểu là bắt đầu với cơ sở hạ tầng ngữ cảnh, đó là khi chúng ta bắt đầu đi sâu vào các cách bạn thực sự phục vụ ngữ cảnh. Cơ sở hạ tầng là cách bạn cung cấp một thứ gì đó – như ngữ cảnh – hoặc cách bạn tổ chức những gì bạn sẽ cung cấp. Vì vậy, đối với cơ sở hạ tầng ngữ cảnh, bạn sẽ thấy những thứ như thư viện ngữ cảnh và cơ sở hạ tầng ngữ cảnh cụ thể cho RAG. Đó là phương thức lưu trữ, hiển thị và cung cấp ngữ cảnh cho một tác nhân AI để nó có thể giải quyết vấn đề cho bạn.
Khi chúng ta nói về kiến trúc so với kỹ thuật – bất kể từ ngữ cảnh đứng trước nó – ranh giới trở nên mờ nhạt hơn một chút. Chúng thực sự đi đôi với nhau, nhưng kiến trúc mang tính triết lý hơn một chút. Kiến trúc đặt câu hỏi tại sao chúng ta có thể cố gắng làm mọi thứ theo những cách nhất định, tại sao chúng ta có thể cố gắng kết hợp mọi thứ để đạt được những mục tiêu nhất định. Kiến trúc là thiết kế. Ví dụ, các mẫu thiết kế tiêu chuẩn mà các kỹ sư sử dụng là kiến trúc. Kỹ thuật thực sự là nơi mọi thứ đi vào thực tế – nơi bạn thực sự xây dựng mọi thứ. Bạn có thể quyết định sử dụng thuật toán cụ thể này vì nó rất hiệu quả hoặc bạn có thể sử dụng các ngôn ngữ nhất định vì bạn đang xây dựng một thứ gì đó với RAG.
Phoebe Sajor: Vậy RAG và MCP phù hợp với cuộc thảo luận về hạ tầng, kiến trúc và kỹ thuật AI như thế nào?
Doug Whitley: Khi nói về MCP, đó là kiến trúc. MCP là một giao thức được định nghĩa với các yêu cầu cụ thể, nhưng cách bạn triển khai nó – cách bạn thiết kế nó vào hệ thống – hoàn toàn tùy thuộc vào bạn. Bạn có thể triển khai MCP bằng bất kỳ ngôn ngữ nào, hoặc bạn có thể chọn chỉ triển khai một số tính năng máy chủ MCP nhất định hoặc chỉ hỗ trợ một số máy khách MCP nhất định. Bạn đang đưa ra các quyết định về thiết kế của hệ thống AI. RAG là sự kết hợp của cả ba yếu tố này. Bạn sẽ có một loại hạ tầng nào đó ở phía sau của RAG – đó có thể là việc lập chỉ mục của bạn, có thể là một kho lưu trữ ngữ cảnh mà bạn đã thiết lập các truy vấn hiệu suất cao, hoặc một thứ gì đó khác cung cấp ngữ cảnh và làm cho nó có thể tìm kiếm được. Có thể đó là danh sách các quy tắc và quy trình của bạn cho một tác nhân mã hóa được lưu trong các tệp Markdown. Cách bạn lưu trữ và cung cấp ngữ cảnh đó cho mô hình ML hoặc LLM của bạn sẽ là hạ tầng. Nhưng RAG cũng là kỹ thuật. Đối với RAG, chúng ta có thể xây dựng nó bằng .NET, chúng ta có thể xây dựng nó bằng Python, và nếu chúng ta muốn thử thách hơn, chúng ta sẽ xây dựng nó bằng Rust. Chúng ta có thể xây dựng nó theo nhiều cách khác nhau, nhưng khi làm vậy, chúng ta phải tuân theo một kiến trúc.
Hãy hình dung thế này: nếu chúng ta đang chế tạo một chiếc ô tô, thì việc chúng ta chế tạo một chiếc ô tô ngay từ đầu đã là một quyết định kiến trúc. Chúng ta quyết định muốn một chiếc ô tô, không phải một chiếc thuyền, không phải một chiếc xe tay ga, không phải một chiếc xe đạp. Hãng và mẫu xe là khía cạnh kỹ thuật của nó. Nơi chúng ta mua các bộ phận là hạ tầng.
Phoebe Sajor: Ash, từ góc độ sản phẩm PM, kiến trúc ngữ cảnh giúp các tác nhân AI hoạt động tốt hơn chính xác như thế nào?
Ash Zade: Tôi sẽ mượn phép so sánh về ô tô của Doug. Chúng ta có thể yêu cầu một tác nhân đi tìm hiểu mọi thứ có thể về các lựa chọn lốp xe khác nhau và đưa ra khuyến nghị. Nếu tác nhân đó vào thư viện và tìm kiếm lốp xe, nó sẽ tìm thấy thông tin về lốp máy bay, xe đạp và xe cút kít. Nó sẽ tìm thấy các kết quả phù hợp cho lốp xe ở bất cứ đâu vì tất cả đều là lốp xe. Điều đó hợp lệ. Nhưng nếu chúng ta đang chế tạo một chiếc ô tô, chúng ta chỉ quan tâm đến lốp ô tô. Tuy nhiên, dù bạn có cố gắng thiết lập rào chắn cho tác nhân chỉ tìm kiếm lốp ô tô đến mức nào, nếu bạn làm điều đó trong một lời nhắc, bạn không thể đảm bảo rằng nó sẽ chỉ trả về lốp ô tô. Điều bạn muốn làm là đặt giới hạn về thông tin bạn cho phép tác nhân truy cập. Khi bạn kiểm soát những gì nó có quyền truy cập, nó sẽ không đi chệch hướng và mang về thông tin về xe đạp. Đây là kiến thức tôi muốn bạn quan tâm và sử dụng trong nhiệm vụ tôi giao cho bạn.
Một phần khác của việc xây dựng ngữ cảnh là bộ nhớ tác nhân – đảm bảo tác nhân ghi nhớ công việc nó đã thực hiện. Nó đã kiểm tra lốp xe thể thao, lốp xe van và lốp xe tải. Bạn
Nguồn tin: Stack Overflow Blog AI — Tác giả: Phoebe Sajor. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.