Một RAG cổ điển nhận một câu hỏi, truy xuất các đoạn trích rồi tạo ra câu trả lời. Chuỗi này nhanh, dễ hiểu và phù hợp với nhiều mục đích tài liệu. Một RAG tác nhân thì thêm một vòng lặp: mô hình phân tích câu hỏi, chọn một nguồn hoặc công cụ, xem xét kết quả, diễn đạt lại và tiếp tục cho đến khi đạt tiêu chí dừng.
Tự chủ này có thể giải quyết các vấn đề nhiều bước. Nó cũng tăng số lượng lời gọi, sự biến thiên và bề mặt tấn công. Mục tiêu không phải là làm cho mọi RAG trở nên mang tính tác nhân, mà là dành lập kế hoạch cho những nhiệm vụ cần đến nó.
RAG cổ điển như đường cơ sở
Một kiến trúc đơn giản bao gồm:
- chuẩn hóa câu hỏi;
- tìm kiếm toàn văn, theo vector hoặc kết hợp ;
- lọc quyền;
- xếp hạng lại có thể có;
- xây dựng bối cảnh ;
- thế hệ với trích dẫn ;
- kiểm soát định dạng.
Nó có thể được kiểm tra từng bước. Độ trễ và chi phí có thể dự đoán trước. Phần lớn các vấn đề đến từ chất lượng của tập hợp dữ liệu, việc phân tách hoặc tìm kiếm, chứ không phải do thiếu tác nhân.
Những hạn chế của một nghiên cứu đơn lẻ
Một câu hỏi duy nhất trở nên không đủ khi câu hỏi yêu cầu:
- so sánh nhiều thực thể;
- liên kết các sự kiện theo thời gian;
- tham khảo các nguồn khác nhau;
- tính toán từ kết quả ;
- giải quyết một sự mơ hồ;
- xác minh một tuyên bố;
- liên kết nghiên cứu và công cụ nghề nghiệp.
Một câu hỏi như « những điều khoản nào đã thay đổi giữa hai phiên bản và ảnh hưởng gì đến các hồ sơ đang mở? » cần nhiều bước và nhiều nguồn.
Trước đại lý: các chiến lược trung gian
Tái diễn đạt có kiểm soát
Một quy tắc hoặc một mô hình tạo ra vài biến thể, sau đó các kết quả được hợp nhất. Số lần gọi vẫn được giới hạn.
Phân tích theo một mẫu
Để so sánh, hệ thống tạo một câu hỏi phụ cho từng thực thể rồi tập hợp các câu trả lời. Cấu trúc này được biết và có thể kiểm tra.
Định tuyến
Một bộ phân loại chọn chỉ số, ngôn ngữ hoặc công cụ. Nó không lập kế hoạch một cách tự do.
Sắp xếp lại và ngữ cảnh lân cận
Đôi khi, đoạn trích phù hợp đã tồn tại trong các ứng viên. Chỉ cần cải thiện thứ hạng là đủ.
Những kỹ thuật này mang lại một phần lợi ích với ít biến động hơn.
Những gì một đại lý RAG thêm vào
Một tác nhân duy trì một trạng thái tìm kiếm, chọn hành động tiếp theo và đánh giá xem thông tin có đủ hay không. Nó có thể:
- yêu cầu làm rõ;
- chọn một nguồn ;
- tạo một truy vấn;
- gọi một API;
- đọc một kết quả ;
- phát hiện một thiếu sót;
- xác minh một khẳng định;
- tổng hợp với nguồn gốc.
Các hành động phải ở trong một danh mục có giới hạn và kế hoạch không bao giờ là một sự cho phép.
Các tiêu chí biện minh cho một vòng lặp đại lý
Biến đổi đường đi
Các câu hỏi đòi hỏi những bước khác nhau mà không thể được mã hóa một cách đơn giản.
Nhiều nguồn
Tài liệu, cơ sở dữ liệu, web được cho phép và công cụ chuyên môn phải được phối hợp.
Có thể kiểm tra
Hệ thống có thể kiểm soát một khoản tiền, một trích dẫn, một sự nhất quán hoặc sự hiện diện của một bằng chứng.
Giá trị đủ
Lợi ích từ các vấn đề phức tạp bù đắp cho độ trễ và chi phí.
Khoan dung với sự không chắc chắn
Kết quả được đọc lại hoặc sử dụng trong một quyết định mà các biện pháp kiểm soát được điều chỉnh phù hợp.
Trò chơi đánh giá
Các trường hợp nhiều bước cho phép đo xem vòng lặp thực sự có mang lại cải thiện hay không.
Bốn cấp độ của RAG, từ truy hồi đơn lẻ đến tìm kiếm tác nhân lặp lại có kiểm tra.
Thiết kế kế hoạch như một trạng thái rõ ràng
Kế hoạch không chỉ nên tồn tại trong một văn bản ẩn. Hệ thống giữ các bước có cấu trúc: mục tiêu, hành động, tham số, kết quả, bằng chứng, trạng thái và quyết định tiếp theo.
Biểu diễn này cho phép:
- giới hạn số bước;
- tái bắt đầu ;
- hiển thị cho người dùng;
- kiểm toán ;
- so sánh;
- sự gián đoạn.
Những lập luận riêng tư của mô hình không cần thiết. Chỉ cần giữ các quyết định vận hành và các lý do ngắn gọn.
Chọn các công cụ có giới hạn
Một công cụ tìm kiếm nhận một truy vấn, các bộ lọc và một số lượng tối đa. Một máy tính thực hiện một phép toán đã định. Một quyền truy cập nghiệp vụ tuân thủ các quyền. Đại lý không nhận được shell, SQL hoặc trình duyệt không giới hạn.
Mỗi công cụ trả về dữ liệu có cấu trúc, nguồn gốc và các lỗi. Kết quả được coi là không đáng tin cậy cho đến khi được xác nhận.
Định nghĩa các tiêu chí dừng
Một vòng lặp vô hạn có thể tiếp tục tìm kiếm, tiêu thụ và tích tụ tiếng ồn. Các tiêu chí bao gồm:
- số bước tối đa;
- ngân sách token hoặc chi phí;
- thời lượng;
- bằng chứng đầy đủ;
- không có thông tin mới;
- niềm tin tối thiểu;
- cần làm rõ;
- hành động bị cấm.
Khi tiêu chí không đạt được, hệ thống sẽ tạo ra phản hồi một phần hoặc từ chối rõ ràng.
Kiểm tra thay vì tự thuyết phục bản thân
Hỏi cùng một mô hình xem nó có hài lòng hay không không cấu thành bằng chứng. Các kiểm tra hữu ích là bên ngoài: các tài liệu tham khảo hiện có, tính toán, sơ đồ, ràng buộc nghiệp vụ, phương pháp nghiên cứu thứ hai hoặc xem xét của con người.
Một mô hình có thể đóng vai trò quan trọng, nhưng các phán quyết của nó được hiệu chỉnh dựa trên các trường hợp của con người và không thay thế được các kiểm tra xác định.
Quản lý các trích dẫn nhiều bước
Mỗi khẳng định cuối cùng phải được liên kết với các đoạn văn và kết quả hỗ trợ cho nó. Hệ thống giữ lại nguồn gốc ở mỗi bước và tránh việc một tóm tắt trung gian làm mất các tham chiếu.
Khi một phép tính sử dụng nhiều nguồn, hiển thị các mục nhập, các phiên bản và công thức. Các mâu thuẫn được báo cáo.
An ninh
Vòng lặp làm tăng khả năng tiếp xúc với prompt injection: mỗi tài liệu và phản hồi của công cụ có thể cố gắng ảnh hưởng đến kế hoạch. Dữ liệu vẫn được tách biệt khỏi các chính sách. Các công cụ và điểm đến được kiểm soát bởi một lớp độc lập.
Ngữ cảnh của mỗi bước là tối thiểu. Các bí mật không bao giờ có sẵn cho mô hình. Các cuộc gọi web hoặc mã được thực thi trong một môi trường tách biệt.
Độ trễ và trải nghiệm người dùng
Một nghiên cứu tác nhân có thể mất vài giây hoặc vài phút. Giao diện hiển thị trạng thái hữu ích: các nguồn đang xử lý, bước hiện tại, khả năng hủy và kết quả tạm thời. Nó không hiển thị lý luận giả tạo kiểu kịch.
Các nhiệm vụ dài có thể bất đồng bộ, với thông báo và tiếp tục. Bộ nhớ đệm tái sử dụng các kết quả phụ ổn định khi quyền hạn và độ mới cho phép.
Chi phí
Chi phí thay đổi theo số bước, số truy vấn, số token và số lần sắp xếp lại. Một ngân sách cho mỗi nhiệm vụ và một mô hình định tuyến ngăn chặn các vòng lặp tốn kém.
Các câu hỏi đơn giản nên đi theo con đường trực tiếp. Một bộ phân loại hoặc các quy tắc có thể dành tác nhân cho những ý định phức tạp.
Đánh giá đóng góp
So sánh RAG agentique với một đường cơ sở mạnh, không phải với một nguyên mẫu yếu. Đo lường:
- tỷ lệ phản hồi đúng;
- che phủ bằng chứng;
- chất lượng từ chối;
- số bước ;
- độ trễ ;
- chi phí;
- ổn định;
- lỗi công cụ ;
- sự hài lòng.
Phân tích theo loại câu hỏi cho thấy đâu là nơi tác nhân hữu ích và đâu là nơi nó làm giảm trải nghiệm.
Triển khai dần dần
Bắt đầu ở chế độ quan sát: tác nhân đề xuất một kế hoạch mà không hành động, sau đó so sánh với phương pháp hiện tại. Tiếp theo, kích hoạt một vài công cụ ở chế độ đọc, ngân sách nghiêm ngặt và đánh giá bởi con người.
Các trường hợp thất bại cung cấp dữ liệu cho quá trình đánh giá tiếp theo. Giới hạn chỉ được tăng lên nếu lợi ích được chứng minh.
Sự đơn giản như một kiến trúc mặc định
Một RAG cổ điển được thiết kế tốt vẫn là lựa chọn tốt nhất cho cơ sở tri thức và các câu hỏi trực tiếp. Việc nghiên cứu theo hướng tác nhân trở nên phù hợp khi nhiệm vụ thực sự yêu cầu một cuộc khám phá biến đổi và có thể kiểm chứng.
Partitech có thể xây dựng một baseline RAG, thiết kế các vòng lặp tìm kiếm, bảo mật các công cụ và triển khai các đánh giá so sánh. Mục tiêu là chỉ thêm tính tự chủ ở nơi nó cải thiện chất lượng hữu ích.
Hãy nói về dự án của bạn
Đánh giá lợi ích của một tác nhân RAG trên các trường hợp thực tế của bạn với Partitech. Liên hệ Partitech.