APort Vault: Benchmarking AI Agent Payment Authorization with the Open Agent Passport
Nghiên cứu giới thiệu APort Vault, một benchmark đánh giá việc ủy quyền thanh toán cho các AI agent có khả năng dùng công cụ thông qua việc phát lại 4.371 cuộc tấn công thực tế. Benchmark này chạy trên 14 mô hình từ 8 phòng thí nghiệm với năm cấu hình chính sách khác nhau, có hoặc không có lớp kiểm tra xác thực trước hành động dựa trên đặc tả Open Agent Passport (OAP). Tổng cộng có 225.964 lượt đánh giá được thực hiện. Kết quả cho thấy lớp kiểm tra bảo mật dựa trên OAP giúp ngăn chặn hoàn toàn các khoản chuyển tiền tới các người nhận không được phép, chứng minh hiệu quả của các biên giới ủy quyền được lập trình cấu trúc.
Thực hiện tổng cộng 225.964 lượt đánh giá trên 14 mô hình từ 8 phòng thí nghiệm khác nhau.
Ở Cấp độ 2 đến 4, các khoản chuyển đến người nhận không có trong hộ chiếu là 140 trên 76.842 trường hợp khi dùng mô hình đơn lẻ, nhưng giảm xuống 0 trên 69.297 trường hợp khi áp dụng lớp chính sách OAP.
Chính sách bảo mật đã từ chối 187 trong số 25.640 lệnh chuyển tiền mà nó đánh giá, trong đó có 148 lệnh bị chặn do người nhận nằm trong danh sách cấm.