Một mô hình ngôn ngữ xử lý các hướng dẫn và dữ liệu dưới dạng văn bản hoặc nội dung đa phương tiện. Sự linh hoạt này tạo ra một sự mơ hồ cơ bản: một tài liệu được tham khảo có thể chứa một câu giống như một hướng dẫn. Một đại lý có thể diễn giải dữ liệu bên ngoài như một lệnh, cố gắng truy cập vào một công cụ hoặc tiết lộ thông tin.
Tấn công prompt không được giải quyết chỉ bằng một prompt hệ thống cứng rắn hơn. Mô hình vẫn là một thành phần xác suất. An ninh bao gồm việc hạn chế quyền lực của nó, cô lập các nguồn, kiểm tra các hành động và ngăn một lỗi giải thích tạo ra tác động.
Tiêm trực tiếp và gián tiếp
Một tiêm trực tiếp được người dùng nhập vào trong cuộc trò chuyện để vượt qua các quy tắc. Một tiêm gián tiếp được giấu trong email, trang web, tài liệu, hình ảnh hoặc kết quả của công cụ mà hệ thống tham khảo.
Tiêm nhiễm gián tiếp đặc biệt quan trọng đối với các tác nhân: nội dung độc hại có thể đến từ một nguồn mà người dùng tin là hợp pháp. Mô hình không nên dành cho nó cùng mức độ tin cậy như đối với các chính sách của hệ thống.
Những hậu quả có thể xảy ra
Theo các công cụ và dữ liệu có sẵn, một mũi tiêm có thể gây ra:
- tiết lộ thông tin bối cảnh;
- gửi đến một điểm đến bên ngoài;
- hành động không được phép;
- sửa đổi dữ liệu ;
- ghi nhớ một hướng dẫn kéo dài;
- sử dụng lạm dụng một nguồn tài nguyên ;
- câu trả lời gây hiểu lầm;
- né tránh một xác nhận;
- bão hòa hoặc chi tiêu quá mức.
Một chatbot không có công cụ thì phạm vi ảnh hưởng sẽ kém hơn so với một tác nhân có khả năng gửi email hoặc thực thi mã. Rủi ro được đo lường bằng quyền lực, không chỉ bằng khả năng xảy ra một câu trả lời sai.
Vẽ bản đồ các ranh giới của niềm tin
Sơ đồ phải phân biệt:
- hướng dẫn hệ thống và chính sách;
- nhập liệu của người dùng ;
- nội dung đã được phục hồi;
- ký ức ;
- xuất mô hình;
- công cụ ;
- bí mật ;
- dịch vụ bên ngoài;
- xác nhận của con người.
Mỗi luồng xác định rõ nguồn gốc, mức độ tin cậy, các chuyển đổi và các hành động mà nó có thể ảnh hưởng. Nội dung không đáng tin cậy không bao giờ được phép thay đổi chính sách hoặc danh sách công cụ.
Các lớp phòng thủ độc lập hạn chế hậu quả của việc chèn lệnh nhanh.
Tách riêng hướng dẫn và dữ liệu
Hệ thống xác định rõ ràng các nội dung được thu thập và chỉ ra cho mô hình rằng chúng không phải là hướng dẫn. Kỹ thuật này giảm một số rủi ro, nhưng không phải là bảo đảm.
Sự bảo vệ thực sự đến từ kiến trúc: ngay cả khi mô hình tuân theo một chỉ dẫn độc hại, nó cũng không có quyền truy cập hoặc quyền hạn cần thiết để tạo ra tác động.
Các kết quả đầu ra của một mô hình tự chúng không đáng tin cậy khi chúng cung cấp dữ liệu cho một công cụ. Chúng phải được xác thực như bất kỳ đầu vào bên ngoài nào khác.
Thu gọn ngữ cảnh
Càng nhiều dữ liệu được mô hình nhận, diện tích tiếp xúc và rủi ro rò rỉ càng tăng. RAG chỉ nên lấy các đoạn cần thiết và được phép. Các bí mật không được thêm vào bối cảnh chỉ vì tiện lợi.
Bộ nhớ giữ lại tối thiểu và có thời hạn. Các cuộc trò chuyện của nhiều người dùng hoặc thư mục được tách biệt. Dữ liệu cũ được đọc lại từ nguồn của chúng trước khi thực hiện một hành động.
Thiết kế các công cụ với ít đặc quyền hơn
Một công cụ phải:
- thực hiện một hành động cụ thể;
- xác minh danh tính;
- xác nhận một sơ đồ nghiêm ngặt;
- giới hạn phạm vi ;
- áp dụng các quy tắc nghiệp vụ;
- là idempotent ;
- ghi nhật ký
- trả về một kết quả có cấu trúc.
Các công cụ chung của shell, SQL, trình duyệt tự do hoặc yêu cầu HTTP tùy ý bị cấm theo mặc định. Khi mã phải được thực thi, nó sẽ được thực hiện trong một môi trường cách ly, tạm thời và không có quyền truy cập mạng không cần thiết.
Kiểm soát các điểm đến
Khả năng gửi, tải xuống và xuất bản là các kênh rút dữ liệu. Người nhận, tên miền, kho chứa, URL và loại tệp bị giới hạn bởi một chính sách độc lập.
Nhân viên không thể tự tạo một điểm đến được phép. Các điểm đến mới đòi hỏi một hành động hành chính riêng biệt.
Bảo vệ bí mật
Các khóa không có mặt trong prompt và cũng không được trả về bởi các công cụ. Một dịch vụ phía máy chủ thực hiện cuộc gọi và giới hạn các thao tác. Nhật ký che giấu các bí mật và các tham số nhạy cảm.
Các tài khoản kỹ thuật có quyền hạn tối thiểu, được luân chuyển và giám sát. Một rò rỉ được cho là sẽ kích hoạt việc thu hồi nhanh chóng.
Xác nhận các đầu ra có cấu trúc
Một cuộc gọi công cụ phải tuân theo một sơ đồ: loại, giá trị, định dạng, độ dài và mối quan hệ. Các trường không xác định sẽ bị từ chối. Các giá trị quan trọng sẽ được tính lại hoặc đọc lại từ nguồn.
Một JSON hợp lệ không nhất thiết được phép. Trình điều khiển chính sách kiểm tra người dùng, tài nguyên, số tiền, địa điểm và bối cảnh.
Thêm các phê duyệt tương xứng
Các hành động có thể đảo ngược và yếu có thể được thực hiện tự động. Các hành động nhạy cảm được xem trước và xác nhận. Các hành động có tác động lớn cần được phê duyệt độc lập.
Việc xác thực liên quan đến các tham số chính xác và có thời hạn. Một hướng dẫn bên ngoài không thể tạo ra sự phê duyệt ngầm định.
Cô lập việc điều hướng và mã
Một tác nhân tra cứu web hoặc chạy mã phải sử dụng một sandbox với:
- hệ thống tệp tạm thời;
- mạng hạn chế ;
- thời gian và nguồn lực có hạn;
- không có chìa khóa chung;
- tải xuống được kiểm soát;
- kết quả được lọc;
- nhật ký hoạt động.
Các tài liệu hoạt động, tập lệnh và macro không được thực thi trong bối cảnh chính.
Bảo mật bộ nhớ
Một mũi tiêm có thể yêu cầu ghi lại một quy tắc cho các cuộc trò chuyện trong tương lai. Các ghi nhớ được tách riêng, có giới hạn và đôi khi phải được xác nhận. Mỗi mục đều có nguồn gốc, ngày tháng, chủ sở hữu và phạm vi.
Hệ thống có thể phân biệt sở thích người dùng, các sự kiện đã được kiểm chứng và các tóm tắt được tạo ra. Một kết quả của mô hình sẽ không trở thành sự thật lâu dài nếu không có quy tắc.
Kiểm tra các đầu nối và MCP
Một máy chủ công cụ từ xa là một nhà cung cấp mã và dữ liệu. Nó phải được lập danh mục, xác thực, đánh giá và giới hạn. Siêu dữ liệu của một công cụ không tự động đáng tin cậy.
Các mã thông báo là riêng cho máy chủ và người dùng. Các chuyển hướng, sự đồng ý, thay đổi khả năng và các bản cập nhật được giám sát. Một máy chủ không thể yêu cầu các bí mật dành cho máy chủ khác.
Phát hiện mà không phụ thuộc vào việc phát hiện
Các bộ lọc có thể phát hiện một số cách diễn đạt, lĩnh vực hoặc hành vi nhất định. Chúng hữu ích cho việc cảnh báo, nhưng một kẻ tấn công có thể thay đổi hình thức. Chính sách phải luôn an toàn ngay cả khi việc phát hiện thất bại.
Các bất thường về khối lượng, đích đến, công cụ, chi phí và từ chối được giám sát. Một cơ chế ngắt nhanh chóng vô hiệu hóa một khả năng.
Kiểm tra một cách đối kháng
Red teaming bao gồm:
- nội dung không đáng tin cậy trong mỗi nguồn;
- các nỗ lực thay đổi vai trò;
- yêu cầu giữ bí mật;
- dụng cụ nối chuỗi;
- dữ liệu được mã hóa;
- ký ức ;
- ngôn ngữ và định dạng;
- lỗi và hết thời gian;
- sự tán thành;
- điểm đến.
Các bài kiểm tra phải được cho phép, cô lập và hướng tới các kiểm soát. Các trường hợp được phát hiện trở thành các hồi quy tự động mà không giữ dữ liệu nhạy cảm.
Chuẩn bị sự cố
Kế hoạch dự kiến cắt công cụ, thu hồi mã thông báo, lưu giữ bằng chứng, phân tích hành động, thông báo và khôi phục. Nhật ký liên kết danh tính, nội dung, mẫu, công cụ, tham số và kết quả.
Một lỗi trong mô hình có thể kích hoạt một hành động kinh doanh; do đó, đội an ninh và đội sản phẩm cần phải chia sẻ các quy trình.
Chấp nhận rủi ro còn lại
Không có sự kết hợp nào đảm bảo rằng một mô hình sẽ không bao giờ tuân theo một hướng dẫn. Mục tiêu là lỗi này không cho phép thực hiện một hành động bị cấm hoặc gây ra rò rỉ đáng kể.
Một số khả năng vẫn quá rủi ro và cần bị loại trừ, giới hạn ở một đề xuất hoặc chỉ dành cho môi trường biệt lập.
An ninh đến từ biên giới
Một hệ thống an toàn xem mô hình như một trình thông dịch không đáng tin cậy, hữu ích nhưng hạn chế. Các chính sách, quyền hạn, xác thực và công cụ vẫn mang tính xác định và có thể kiểm tra được.
Partitech có thể thực hiện mô hình hóa mối đe dọa, thiết kế các biện pháp kiểm soát, bảo mật các kết nối và triển khai các thử nghiệm cho các đại lý và RAG. Phòng thủ nhiều lớp bảo vệ hệ thống ngay cả khi mô hình bị sai.
Hãy nói về dự án của bạn
Kiểm toán an ninh của RAG hoặc các đại lý của bạn với Partitech. Liên hệ Partitech.