
New Archestra's OpenAPPA đạt hiệu suất tối đa trên hai tiêu chuẩn bảo mật lớn với tỷ lệ tấn công thành công 0%
Archestra đã phát hành OpenAPPA, một công cụ bảo mật mã nguồn mở được thiết kế để ngăn chặn việc rò rỉ dữ liệu do tấn công tiêm nhiễm câu lệnh (prompt injection) hoặc ảo giác mô hình (model hallucination). Nhóm phát triển báo cáo không có cuộc tấn công nào thành công khi chạy các tiêu chuẩn bảo mật Bench-Corp (20 quy trình làm việc doanh nghiệp đa bước) và AgentThreatBench, so với 10% đối với chế độ tự động của Claude Code và 31% đối với Microsoft FIDES. Theo Bruno Couriol
Trang chủ InfoQ
Tin tức
OpenAPPA của New Archestra đạt hiệu suất tối đa trên hai tiêu chuẩn bảo mật lớn với tỷ lệ tấn công thành công 0%
AI, ML & Kỹ thuật dữ liệu
OpenAPPA của New Archestra đạt hiệu suất tối đa trên hai tiêu chuẩn bảo mật lớn với tỷ lệ tấn công thành công 0%
Ngày 03/10/2026
Thời gian đọc: 4 phút
Bởi
Bruno Couriol
Theo dõi chúng tôi trên
Youtube 232K người theo dõi
Linkedin 26K người theo dõi
Instagram Mới
RSS 19K người đọc
X 57,1K người theo dõi
Facebook 21K lượt thích
Bluesky Mới
Nghe bài viết này - 0:00
Âm thanh sẵn sàng phát
Trình duyệt của bạn không hỗ trợ phần tử âm thanh.
0:00
0:00
Bình thường 1.25x 1.5x
Thích
Danh sách đọc
Archestra đã phát hành OpenAPPA, một công cụ bảo mật mã nguồn mở được thiết kế để ngăn chặn việc rò rỉ dữ liệu do tấn công tiêm nhiễm lời nhắc (prompt injection) hoặc ảo giác mô hình (model hallucination). OpenAPPA hoạt động bên ngoài vòng lặp lời nhắc và thực thi của tác nhân (agent). Cấu hình của nó mô tả các khái niệm như nguồn dữ liệu, đối tượng, mức độ tin cậy và quyền hạn, cùng với các quy tắc thực thi bảo mật xác định liên quan. Nhóm phát triển báo cáo không có cuộc tấn công nào thành công khi chạy các tiêu chuẩn bảo mật Bench-Corp (20 quy trình làm việc doanh nghiệp đa bước) và AgentThreatBench, so với 10% đối với chế độ tự động của Claude Code và 31% đối với Microsoft FIDES.
Tài liệu của OpenAPPA giải thích lý do tại sao phương pháp tiếp cận ngẫu nhiên đối với việc thực thi chính sách tự động lại thất bại:
Giải pháp của ngành công nghiệp cho tình trạng mệt mỏi phê duyệt là một mô hình thứ hai đánh giá từng lệnh gọi công cụ: chế độ tự động của Claude Code, tính năng tự động xem xét của Codex và các chế độ tự động khác.
Theo thiết kế, chúng không thể theo dõi luồng dữ liệu giữa các lệnh gọi công cụ. Vì các bộ phân loại bản thân chúng có thể bị tiêm nhiễm lời nhắc, nên các hệ thống che giấu đầu ra công cụ khỏi chúng, do đó bộ đánh giá không bao giờ nhìn thấy dữ liệu.
Do thiết kế xác suất của chúng, ngay cả những mô hình tốt nhất cũng chỉ đạt tối đa 99,3%: với hàng triệu lệnh gọi, 0,7% là rất nhiều vụ vi phạm.
[…] Các bộ quy tắc cuối cùng hoặc quá chặt chẽ đến mức làm hỏng tác nhân, hoặc quá phức tạp đến mức không ai có thể kiểm tra những gì chúng cho phép.
Một mặt, các tác nhân đã chứng tỏ khả năng vượt qua các phương pháp đơn giản nhưng phổ biến như danh sách cho phép (allowlist) hoặc danh sách từ chối (denylist) công cụ: một lệnh `rm -rf` bị từ chối có thể được thay thế bằng một tập lệnh Python tương đương. Mặt khác, việc mở rộng danh sách từ chối hoặc các chính sách hạn chế quá mức để bảo vệ chống lại các tác nhân quá nhiệt tình sẽ dẫn đến giảm tiện ích (ví dụ: mặc dù tác nhân không làm rò rỉ dữ liệu, nhưng nó không thực hiện thành công nhiệm vụ do các hạn chế). Kho lưu trữ GitHub của OpenAPPA nhắc nhở các nhà phát triển:
Bảo mật tác nhân có hai khía cạnh: một tác nhân cho phép các luồng trái phép là không an toàn, và một tác nhân từ chối công việc hợp lệ là vô dụng.
Archestra tìm cách giải quyết sự căng thẳng giữa việc thực thi nghiêm ngặt và tiện ích hoạt động bằng cái mà họ gọi là Đại số Chính sách Quyền hạn Tác nhân (Agentic Permissions Policy Algebra - APPA), được mô tả trong một bài báo của Arseny Kravchenko, Vadim Liventsev, Innokentii Konstantinov, Ildar Iskhakov và Matvey Kukuy.
OpenAPPA triển khai phương pháp này với một công cụ có thể cắm thêm, được thực thi bên ngoài vòng lặp của tác nhân, do đó đánh bại mọi nỗ lực của mô hình ngôn ngữ cơ bản nhằm kiểm tra, thương lượng hoặc bỏ qua các quy tắc chính sách. Các chính sách bảo mật có dạng một tệp cấu hình `appa.toml` duy nhất, chi tiết các nguồn dữ liệu, đối tượng, mức độ tin cậy và quyền hạn.
OpenAPPA cùng lúc gắn nhãn và giám sát cả đối tượng (tập hợp người tiêu dùng được ủy quyền) và độ tin cậy (mức độ xác minh dữ liệu). Các nhãn được kết hợp một cách đơn điệu bằng cách sử dụng đại số mạng tinh thể (lattice algebra); các nhãn chỉ có thể trở nên hạn chế hơn; việc đọc các bản ghi bị hạn chế sẽ thu hẹp đối tượng; việc đọc các trang web bên ngoài chưa được kiểm duyệt sẽ làm giảm độ tin cậy.
Mỗi hợp đồng công cụ định nghĩa ba thuộc tính hoạt động chính: `requires` (tư cách thành viên đối tượng và mức độ tin cậy cần thiết để chạy công cụ), `delta` (các hạn chế được áp dụng khi công cụ trả về dữ liệu) và `effects` (dấu vết kiểm toán của các hành động thành công).
Trong ví dụ sau, việc đọc một phiếu yêu cầu thông qua `get_ticket_from_crm` hạn chế đối tượng của quỹ đạo thành "internal" (nội bộ). Lệnh gọi `process_internal_data` tiếp theo yêu cầu đối tượng phải nằm trong "internal".
```
[[policy.tool]]
name = "get_ticket_from_crm"
delta = { audience = ["internal"] }
[[policy.tool]]
name = "publish_update"
requires = { audience = { contains = ["
```
[[policy.tool]]
name = "process_internal_data"
requires = { audience = { within = ["internal"] } }
Trong ví dụ sau, kết quả của công cụ read_web_page được đánh dấu là đáng ngờ. Khi nhận được kết quả từ công cụ read_web_page, OpenAPPA chặn apply_db_migration vì công cụ này yêu cầu dữ liệu đáng tin cậy.
[policy]
version = 2
trust_chain = ["suspicious", "trusted"]
[[policy.tool]]
name = "read_web_page"
delta = { trust = "suspicious" }
[[policy.tool]]
name = "apply_db_migration"
requires = { trust = "trusted" }
OpenAPPA còn có ngữ nghĩa phục hồi rõ ràng. Khi một tác nhân cố gắng thực hiện một hành động bất hợp pháp, công cụ sẽ dừng việc điều phối và cung cấp các lộ trình có cấu trúc để tiếp tục. Các bộ lọc có thể chỉnh sửa tải trọng, ví dụ như loại bỏ thông tin nhận dạng cá nhân, để mở rộng an toàn đối tượng được phép. Các cơ quan có thẩm quyền định tuyến yêu cầu đến các nhà điều hành con người hoặc API xác minh nội bộ để phê duyệt một hành động duy nhất. Các nhánh con dùng một lần (Disposable Child Branches) cho phép cách ly theo yêu cầu: khi một tác nhân phải tiếp nhận dữ liệu không đáng tin cậy, công cụ sẽ cách ly việc đọc trong một nhánh tác nhân con tạm thời, chỉ trả về các đầu ra đã được xác nhận lược đồ và làm sạch cho tác nhân cha.
Các điểm chuẩn Bench-Corp và OWASP AgentThreatBench cho thấy OpenAPPA duy trì hiệu quả cao trong khi tuân thủ các ràng buộc bảo mật nghiêm ngặt, báo cáo tỷ lệ tấn công thành công là 0% và tỷ lệ hoàn thành nhiệm vụ là 89%. Chế độ tự động gốc của Claude Code cho tỷ lệ tấn công thành công là 10%.
Nguồn tin: InfoQ AI — Tác giả: Bruno Couriol. Bản dịch tiếng Việt do AI thực hiện, có thể có sai sót.