Các mô hình ngôn ngữ tạo ra các kết quả đầu ra khác nhau và chất lượng của chúng phụ thuộc vào bối cảnh, lệnh nhắc, công cụ và dữ liệu. Một bài kiểm tra thủ công trên mười ví dụ dễ chịu không cho phép chọn một kiến trúc hay đảm bảo một bản cập nhật. Cần có một kỷ luật đánh giá tương đương với kiểm thử phần mềm, phù hợp với các phản hồi xác suất.
Mục tiêu không phải là giảm mọi phẩm chất thành một điểm số. Mục tiêu là làm cho các lỗi trở nên rõ ràng, so sánh các phiên bản trên cùng các trường hợp và xác định những gì cản trở việc triển khai sản xuất.
Phân biệt benchmark và đánh giá sản phẩm
Một chuẩn đánh giá công khai đo lường năng lực chung trên một tập hợp dữ liệu nhất định. Nó giúp hiểu một mô hình, nhưng không nhất thiết đại diện cho từ vựng, định dạng, ngôn ngữ và rủi ro của doanh nghiệp.
Một đánh giá sản phẩm sử dụng:
- nhiệm vụ thực tế ;
- dữ liệu đại diện ;
- ràng buộc định dạng;
- công cụ và RAG;
- chính sách từ chối;
- ngưỡng nghề nghiệp ;
- chi phí và độ trễ.
Mô hình công khai tốt nhất có thể không phù hợp bằng một mô hình nhỏ hơn trên một nhiệm vụ giới hạn.
Phân tích hệ thống
Một câu trả lời cuối cùng phụ thuộc vào nhiều thành phần: phân loại ý định, truy xuất, nhắc, mô hình, công cụ và xử lý sau. Đánh giá chúng riêng lẻ giúp xác định sự suy giảm.
Đối với RAG, đo lường khả năng truy hồi và tạo sinh. Đối với một tác nhân, đo lường việc chọn công cụ, tham số, tuân thủ quyền hạn và kết quả. Đối với một trích xuất, phân biệt nhận diện tài liệu và giá trị của các trường.
Xây dựng một bộ trường hợp đại diện
Trò chơi phải bao gồm:
- trường hợp thường gặp;
- trường hợp có giá trị cao;
- các công thức đa dạng;
- ngôn ngữ ;
- dữ liệu không đầy đủ;
- sự mơ hồ;
- từ chối dự kiến;
- cuộc tấn công ;
- trường hợp có lịch sử thất bại.
Mỗi trường hợp có một mã định danh, một ý định, các đầu vào, một kết quả hoặc một mục tiêu mong đợi, một mức độ rủi ro và các thẻ. Các ví dụ sản xuất được ẩn danh và chọn theo một chính sách.
Kim tự tháp kết hợp kiểm soát quyết định, đánh giá thành phần, kịch bản đầy đủ, xem xét của con người và theo dõi trong sản xuất.
Định nghĩa các tiêu chuẩn chất lượng
Theo nhiệm vụ, đánh giá:
- độ chính xác của sự thật hoặc giá trị ;
- tính đầy đủ của các yếu tố cần thiết ;
- trung thành với các nguồn;
- định dạng và cấu trúc ;
- sự thích hợp ;
- tính hữu ích cho hành động;
- phong cách và giọng điệu ;
- an toàn ;
- chất lượng từ chối ;
- tính giải thích được hoặc trích dẫn.
Mỗi khía cạnh nhận được một định nghĩa và các ví dụ về điểm số. Một tiêu chí mơ hồ dẫn đến các giám khảo không nhất quán.
Kiểm soát quyết định trước tiên
Trước một đánh giá về ngữ nghĩa, hãy kiểm tra những gì có thể được kiểm tra bằng mã: JSON hợp lệ, các trường có mặt, các giá trị được phép, các tham chiếu tồn tại, phép tính, độ dài, ngôn ngữ, trích dẫn và việc gọi công cụ.
Các bài kiểm tra này nhanh, có thể tái tạo và dễ dàng tích hợp vào CI. Chúng loại bỏ lỗi mà không yêu cầu một mô hình đánh giá một định dạng.
Xây dựng một sự thật thực địa
Đối với việc trích xuất hoặc phân loại, các chuyên gia có thể chú thích kết quả đúng. Đối với việc tạo ra, thường thì tốt hơn nên xác định các yếu tố bắt buộc, bị cấm và một mục tiêu hơn là một câu duy nhất.
Các bất đồng giữa các chuyên gia được đo lường. Nếu họ không đồng ý, yêu cầu mô hình đưa ra một câu trả lời duy nhất có thể là không thực tế.
Sự thật thực tế được phiên bản hóa và xem xét lại khi công việc thay đổi.
Sử dụng thẩm phán con người
Con người vẫn cần thiết cho tính hữu ích, các sắc thái và rủi ro. Việc đánh giá có thể được thực hiện mù, với thứ tự ngẫu nhiên, nhằm hạn chế thiên vị thương hiệu hoặc vị trí.
Các đánh giá viên nhận được hướng dẫn, ví dụ và một cơ chế về sự bất đồng. Một tập hợp con được chấm điểm hai lần để đo độ nhất quán.
Sử dụng một mô hình làm trọng tài một cách thận trọng
Một thẩm phán LLM cho phép đánh giá thêm nhiều trường hợp, nhưng có những thiên vị riêng. Nó có thể ưa thích các câu trả lời dài, phong cách riêng của nó hoặc lựa chọn đầu tiên. Nó có thể bị ảnh hưởng bởi nội dung cần đánh giá.
Các biện pháp phòng ngừa bao gồm:
- tiêu chí rõ ràng ;
- xuất có cấu trúc;
- ẩn danh hóa các mô hình;
- thứ tự ngẫu nhiên;
- so sánh với điểm số của con người;
- nhiều lần lặp lại;
- giám sát các bất đồng.
Thẩm phán đẩy nhanh việc phân loại; ông ấy không biến một ý kiến thành sự thật tuyệt đối.
So sánh hai phiên bản
So sánh ghép thực hiện A và B trên cùng các trường hợp. Báo cáo hiển thị lợi ích, thua lỗ và các trường hợp quan trọng, không chỉ trung bình chung.
Kết quả được phân đoạn theo ý định, ngôn ngữ và rủi ro. Một cải thiện về tóm tắt có thể che giấu sự suy giảm về từ chối. Kích thước mẫu và độ không chắc chắn là có thể thấy được.
Đo lường sự biến đổi
Một cùng một đầu vào có thể tạo ra nhiều đầu ra. Đối với các nhiệm vụ nhạy cảm, thực hiện nhiều lần lặp lại và đo lường độ ổn định của định dạng, của lựa chọn công cụ hoặc của phản hồi.
Nhiệt độ, seed khi có sẵn, phiên bản mô hình và các tham số được ghi lại. Một hệ thống có thể trung bình là đúng nhưng quá không ổn định để sản xuất.
Độ trễ và tính khả dụng
Đo tổng thời gian và thời gian của từng bước: thu thập, mô hình, công cụ, xử lý hậu kỳ. Theo dõi trung vị và các phần trăm, không chỉ trung bình.
Các lỗi, hết giờ, hạn mức và thử lại đều là một phần của đánh giá. Một mô hình tốt hơn một chút nhưng thường không khả dụng có thể ít hữu ích hơn.
Chi phí cho mỗi nhiệm vụ thành công
Chi phí bao gồm token, embeddings, sắp xếp lại, công cụ, lưu trữ và xác thực bởi con người. Nó phải được tính theo mỗi trường hợp thành công, không chỉ theo yêu cầu.
Một đầu ra không chính xác có thể kích hoạt việc khôi phục tốn kém. Các kịch bản về khối lượng và đỉnh điểm giúp so sánh định tuyến và bộ nhớ đệm.
Đánh giá an toàn
Trò chơi bao gồm tiêm lệnh nhắc, trích xuất, dữ liệu cấm, vượt qua chính sách, công cụ không được phép và nội dung độc hại tùy theo cách sử dụng. Các bài kiểm tra được thực hiện trong một môi trường an toàn.
Một lỗi bảo mật nghiêm trọng ngăn không cho khởi chạy bất kể điểm trung bình.
Đặt ngưỡng
Mỗi chiều có:
- mục tiêu;
- tối thiểu chấp nhận được ;
- ngưỡng nguy cấp;
- chủ sở hữu của ngoại lệ.
Ngưỡng đến từ rủi ro nghề nghiệp. Một báo cáo tài chính có thể yêu cầu độ chính xác và kiểm soát rất cao; một bản nháp sáng tạo chấp nhận nhiều biến động hơn.
Tích hợp các đánh giá vào việc giao hàng
Một trò chơi nhỏ nhanh chạy mỗi khi có sự thay đổi. Một chuỗi hoàn chỉnh chạy trước phiên bản hoặc theo định kỳ. Chi phí được kiểm soát bằng cách lấy mẫu và lưu trữ các thành phần không thay đổi.
Báo cáo so sánh với một cơ sở và chặn các suy giảm quan trọng. Các thay đổi về prompt, mô hình, RAG, công cụ hoặc chính sách đều được phiên bản hoá.
Giám sát trong sản xuất
Các đánh giá ngoại tuyến không bao quát tất cả các yêu cầu. Sản xuất theo dõi các lỗi, từ chối, phản hồi, thang cấp, độ trễ và chi phí. Một số mẫu được xem xét theo chính sách bảo mật.
Các sự cố thực tế trở thành các trường hợp suy giảm. Dữ liệu theo dõi không nên thu thập nhiều thông tin hơn mức cần thiết.
Tránh làm ô nhiễm trò chơi
Nếu trò chơi được sử dụng để liên tục điều chỉnh prompt, nó sẽ trở thành một trò chơi huấn luyện ngầm. Giữ lại một tập hợp ẩn và làm mới các trường hợp giúp bảo vệ khả năng tổng quát hóa.
Các nhà cung cấp và mô hình cũng có thể đã xem một số chuẩn mực công khai, đó là lý do thêm để ưu tiên các trường hợp riêng.
Một đánh giá như sản phẩm tài sản
Trò chơi tình huống, các mục, các ngưỡng và các báo cáo trở thành một tài sản chiến lược. Chúng cho phép thay đổi mô hình, tối ưu hóa chi phí và chứng minh rằng một phiên bản tốt hơn.
Partitech có thể xây dựng các trò chơi đánh giá, tự động hóa các kiểm soát, so sánh các mô hình và tích hợp các hồi quy vào chuỗi cung ứng. Mục tiêu là điều khiển chất lượng dựa trên bằng chứng, không dựa trên ấn tượng của một buổi trình diễn.
Hãy nói về dự án của bạn
Thiết lập một nền tảng đánh giá AI với Partitech. Liên hệ Partitech.