Trao đổi về dự án
Kiến trúc IA

RAG, tinh chỉnh hay kỹ thuật gợi ý: chọn phương pháp chuyên biệt hóa phù hợp cho một mô hình

RAG cung cấp kiến thức tại thời điểm trả lời. Fine-tuning chủ yếu thay đổi hành vi đã học. Prompt định khung cho một nhiệm vụ. Nhầm lẫn chúng dẫn đến các dự án tốn kém và khó đánh giá.

RAG, tinh chỉnh hay kỹ thuật gợi ý: chọn phương pháp chuyên biệt hóa phù hợp cho một mô hình

Một công ty muốn điều chỉnh một mô hình phù hợp với lĩnh vực của mình. Ba giải pháp thường được đề xuất là: cải thiện prompt, kết nối cơ sở dữ liệu thông qua RAG hoặc huấn luyện mô hình dựa trên các ví dụ. Chúng không giải quyết cùng một vấn đề.

Prompt đưa ra các hướng dẫn vào lúc gọi. RAG lấy thông tin bên ngoài và thêm chúng vào ngữ cảnh. Fine-tuning điều chỉnh các tham số của mô hình để củng cố một hành vi. Một kiến trúc trưởng thành có thể kết hợp cả ba, nhưng chỉ sau khi đã xác định nguyên nhân của các lỗi.

Bắt đầu với một đường cơ sở

Trước khi thêm một công nghệ, hãy xây dựng một phiên bản tối thiểu với:

  • một mô hình tham chiếu;
  • một prompt rõ ràng;
  • một đầu ra có cấu trúc nếu cần thiết;
  • từ hai mươi đến một trăm trường hợp thử nghiệm đại diện;
  • các chỉ số;
  • một phân tích lỗi.

Không có đường cơ sở, không thể biết liệu RAG hay tinh chỉnh có mang lại cải thiện hay không. Nhóm có nguy cơ chỉ đo lường nhận thức dựa trên một vài minh chứng thuận lợi.

Kỹ thuật tạo prompt: xác định phạm vi nhiệm vụ

Một lời nhắc tốt xác định rõ:

  • vai trò mong đợi;
  • nhiệm vụ;
  • dữ liệu đầu vào;
  • các ràng buộc;
  • định dạng đầu ra;
  • các tiêu chí từ chối;
  • ví dụ nếu cần thiết;
  • các công cụ sẵn có.

Lời nhắc thích hợp khi kiến thức cần thiết đã có trong mô hình hoặc được cung cấp trong đầu vào. Nó phù hợp để biến đổi văn bản, trích xuất các trường, phân loại, tóm tắt hoặc áp dụng một thủ tục ngắn.

Các lợi ích của nó là tốc độ, chi phí triển khai thấp và dễ dàng lặp lại. Các hạn chế của nó xuất hiện khi các hướng dẫn trở nên rất dài, mâu thuẫn hoặc khó duy trì. Một prompt không cập nhật kiến thức nội bộ của mô hình và không đảm bảo thông tin nghiệp vụ chính xác.

RAG: đưa kiến thức vào đúng lúc trả lời

Tạo sinh tăng cường truy xuất tìm kiếm các đoạn văn liên quan trong các nguồn rồi truyền chúng cho mô hình. Nó phù hợp khi thông tin:

  • thay đổi thường xuyên;
  • thuộc về công ty;
  • phải được nhắc đến;
  • quá nhiều để có thể cố định trong một lời nhắc;
  • có quyền truy cập;
  • phải được gỡ bỏ mà không cần huấn luyện lại.

Một RAG không chỉ là một cơ sở vectơ đơn giản. Cần quản lý việc nhập liệu, cắt nhỏ, siêu dữ liệu, tìm kiếm, xếp hạng lại, quyền, trích dẫn, đánh giá và cập nhật.

Những khuyết điểm của nó thường xuất phát từ nghiên cứu, không phải từ mô hình: tài liệu kém, đoạn văn không đầy đủ, bộ lọc truy cập, từ vựng khác nhau hoặc thông tin bị thiếu.

Tinh chỉnh: học một hành vi

Việc tinh chỉnh (fine-tuning) huấn luyện mô hình trên các cặp ví dụ để tăng xác suất của một hành vi. Nó có thể liên quan đến:

  • tuân thủ một định dạng chính xác;
  • áp dụng một phong cách nhất quán;
  • phân loại theo một hệ thống phân loại ổn định;
  • cải thiện một ngôn ngữ hoặc biệt ngữ;
  • rút ngắn độ dài của prompt;
  • học các quyết định lặp đi lặp lại từ các ví dụ chất lượng.

Nó thường không phải là giải pháp tốt nhất để ghi nhớ tài liệu thay đổi. Các sự kiện trở nên khó cập nhật và trích dẫn. Một mô hình được tinh chỉnh cũng có thể tái hiện các lỗi, thiên vị hoặc dữ liệu nhạy cảm từ tập hợp dữ liệu.

Nỗ lực chính nằm ở việc lựa chọn, chú thích, quyền, tách tập huấn luyện/kiểm tra và đánh giá, không phải trong việc khởi chạy lệnh huấn luyện.

Câu hỏi trung tâm: kiến thức hay hành vi?

Khi mô hình không biết quy trình trong ngày, nó thiếu kiến thức: RAG thường được ưu tiên. Khi nó biết các yếu tố nhưng không theo đúng định dạng hoặc nhầm lẫn một phân loại, nguyên nhân là do hành vi: prompt hoặc fine-tuning có thể giúp.

Một số vấn đề là hỗn hợp. Một trợ lý hỗ trợ phải tìm lại quy trình đúng rồi soạn thảo một phản hồi phù hợp với tông của công ty. RAG cung cấp nội dung; prompt hoặc fine-tuning định hướng hình thức.

Cây quyết định giữa prompt, RAG, điều chỉnh tinh và phương pháp kết hợp theo kiến thức, hành vi, độ mới và bằng chứng.

So sánh các phương pháp tiếp cận

Tiêu chí Prompt RAG Tinh chỉnh
Triển khai nhanh trung bình đến quan trọng quan trọng
Cập nhật sự thật mỗi lần gọi thông qua tái lập chỉ mục huấn luyện mới
Trích dẫn giới hạn trong các nguồn được cung cấp tự nhiên nếu được thiết kế không nguyên bản
Dữ liệu yêu cầu một vài ví dụ tài liệu có thể khai thác ví dụ giám sát chất lượng
Kiểm soát truy cập trong ứng dụng đến mức tìm kiếm khó ở cấp độ kiến thức đã học
Chi phí vận hành bối cảnh đôi khi dài tìm kiếm + bối cảnh mô hình tùy chỉnh + suy luận
Gỡ lỗi prompt và kết quả tìm kiếm rồi sinh dữ liệu, huấn luyện và suy luận
Tính di động tương đối cao phụ thuộc vào chuỗi phụ thuộc nhà cung cấp và định dạng

Bảng này đưa ra các xu hướng. Thước đo chuẩn thực tế về nhiệm vụ vẫn quyết định.

Ngữ cảnh dài không phải lúc nào cũng thay thế RAG

Các mô hình nhận các bối cảnh ngày càng dài hơn. Thật hấp dẫn khi gửi tất cả các tài liệu. Cách tiếp cận này có thể hiệu quả cho một hồ sơ đơn lẻ, nhưng nó có những giới hạn: chi phí, độ trễ, nhiễu, kiểm soát truy cập, lặp lại dữ liệu và khó đảm bảo rằng đoạn văn đúng sẽ được sử dụng.

RAG giảm bối cảnh xuống các yếu tố liên quan và cho phép một chỉ mục chia sẻ. Đối với các tập nhỏ, một chiến lược lai có thể trước tiên lọc theo siêu dữ liệu rồi gửi nhiều tài liệu đầy đủ.

RAG không sửa tất cả các hành vi

Thêm nhiều tài liệu hơn không giải quyết được một mô hình từ chối sai, không tuân thủ JSON hoặc sử dụng giọng điệu không đúng. Cần tách các chỉ số ra:

  • nhắc lại và làm rõ nghiên cứu;
  • trung thành với nguồn;
  • độ chính xác của câu trả lời;
  • định dạng;
  • phong cách;
  • từ chối;
  • độ trễ;
  • chi phí.

Phân tích này cho thấy đòn bẩy nào cần thay đổi.

Việc tinh chỉnh đòi hỏi một tập hợp dữ liệu được quản lý

Các ví dụ phải là:

  • đại diện cho sản xuất;
  • chính xác;
  • nhất quán giữa các người chú thích;
  • được phép;
  • không có dữ liệu không cần thiết;
  • tách biệt với bộ kiểm tra;
  • có phiên bản.

Một tập hợp các câu trả lời lịch sử có thể chứa những thói quen xấu mà người ta muốn loại bỏ. Nó phải được làm sạch, không chỉ đơn giản là xuất ra.

Dự kiến một mô hình thẻ nội bộ: phiên bản cơ bản, dữ liệu, tham số, giới hạn, kết quả, rủi ro và quy trình rút.

Một chiến lược lai phổ biến

Một ứng dụng mạnh mẽ có thể theo dõi chuỗi này:

  1. một prompt hệ thống ngắn định nghĩa các quy tắc;
  2. một bộ phân loại hoặc bộ định tuyến chọn nhiệm vụ;
  3. RAG truy xuất các nguồn được phép;
  4. một mô hình có thể được tinh chỉnh tạo ra định dạng mong đợi;
  5. một bộ xác thực kiểm tra sơ đồ và trích dẫn;
  6. một con người phê duyệt các trường hợp nhạy cảm.

Mỗi viên gạch phải chứng minh được độ phức tạp của nó. Thêm một mô hình tinh chỉnh trước khi lỗi được ổn định sẽ làm cho kiến trúc khó bảo trì hơn.

Xây dựng một trải nghiệm so sánh

Quyết định có thể được đưa ra trong bốn lần lặp lại.

Lặp 1: nhắc nhở tham chiếu

Đo lường chất lượng mà không cần truy xuất hay huấn luyện. Xác định các lỗi về kiến thức, định dạng, lý luận và an toàn.

Lặp lại 2: RAG tối thiểu

Lập chỉ mục một tập hợp dữ liệu hạn chế, xác định các câu hỏi tham khảo và đo lường việc truy xuất rồi trả lời. Không bắt đầu với toàn bộ tài liệu.

Lặp lại 3: tinh chỉnh theo mục tiêu

Chỉ khi một hành vi lặp đi lặp lại không chịu tuân theo các gợi ý và nếu các ví dụ có sẵn. So sánh với chuẩn cơ bản trên một trò chơi chưa từng thấy.

Lặp 4: kết hợp và khai thác

Đo độ trễ, chi phí, sai lệch, khả năng đảo ngược và khả năng cập nhật. Điểm cao nhất ngoài môi trường sản xuất không phải lúc nào cũng là giải pháp vận hành tốt nhất.

Khi nào không nên sử dụng fine-tuning

Tránh tinh chỉnh khi:

  • các sự kiện thay đổi hàng tuần;
  • cần phải trích dẫn nguồn;
  • tập hợp tài liệu nhỏ hoặc mâu thuẫn;
  • quyền lợi không chắc chắn;
  • lỗi do nghiên cứu;
  • nhu cầu có thể được giải quyết bằng một sơ đồ đầu ra;
  • không có đánh giá đáng tin cậy nào tồn tại.

Khi nào không xây dựng RAG

Một RAG là quá mức đối với một nhiệm vụ chuyển đổi mà không có kiến thức bên ngoài, chỉ với một vài quy tắc ổn định hoặc một tài liệu duy nhất được cung cấp cho mỗi lần gọi. Nó thêm vào việc nhập dữ liệu, lập chỉ mục, bảo mật và giám sát.

Điều khiển theo chi phí cho mỗi nhiệm vụ thành công

So sánh tổng chi phí: chuẩn bị dữ liệu, hạ tầng, cuộc gọi, chú thích, tái lập chỉ mục, huấn luyện, kiểm tra, sự cố và bảo trì. Một giải pháp rẻ hơn theo mỗi token có thể tốn kém hơn nếu nó thất bại nhiều hơn hoặc cần đánh giá thủ công nặng nề.

Chỉ số hữu ích là chi phí cho mỗi nhiệm vụ được chấp nhận, với mức chất lượng mong đợi.

Chọn một phương pháp có thể đảo ngược

Lưu giữ các prompt, tập hợp dữ liệu, đánh giá và sơ đồ độc lập với nhà cung cấp. Phiên bản hóa các cấu hình và dự kiến một lớp thích nghi. Một mô hình hoặc API có thể phát triển, bị rút khỏi hoặc thay đổi giá.

Partitech có thể xây dựng đường cơ sở, quy trình RAG, tập hợp dữ liệu tinh chỉnh và đánh giá so sánh. Quyết định lúc đó không dựa trên một xu hướng hay một minh họa riêng lẻ, mà dựa trên các lỗi được đo lường, dữ liệu được kiểm soát và chi phí vận hành thực tế.

Hãy nói về dự án của bạn

Xây dựng một bảng so sánh benchmark giữa prompt, RAG và fine-tuning trên dữ liệu của bạn với Partitech. Liên hệ Partitech.

Chia sẻ bài viết