Chi phí của một trợ lý không chỉ đến từ các token của lần gọi cuối cùng. Một RAG tạo embeddings, tìm kiếm, xếp lại, đôi khi gọi nhiều mô hình và sử dụng các công cụ. Một agent có thể lặp lại, chờ và yêu cầu xác nhận từ con người. Cơ sở hạ tầng, nhật ký và hỗ trợ hoàn thiện chi phí.
Tối ưu hóa đòi hỏi phải đo lường một nhiệm vụ hoàn chỉnh và sự thành công của nó. Một yêu cầu rẻ tiền mà đưa ra câu trả lời tồi và phải làm lại bằng tay là một sự tiết kiệm giả tạo.
Xây dựng một đơn vị kinh tế
Chọn một đơn vị liên quan đến công việc: hồ sơ có trình độ, tài liệu đã xử lý, phản hồi hữu ích, đơn hàng đã chuẩn bị hoặc sự cố đã giải quyết. Đối với mỗi đơn vị, đếm:
- cuộc gọi;
- token ;
- nhúng
- sắp xếp lại thứ hạng ;
- công cụ ;
- lưu trữ ;
- thử lại;
- xác nhận ;
- lỗi;
- cơ sở hạ tầng ;
- hỗ trợ.
Đơn vị này cho phép so sánh một kiến trúc, một mô hình và quy trình hiện tại.
Tính chi phí cho mỗi nhiệm vụ hoàn thành
Một công thức đơn giản hóa là:
(coûts variables + coûts fixes affectés + validation + reprises) / tâches réussies
Tỷ lệ thành công phải tuân theo một định nghĩa. Một phản hồi hiển thị không được coi là nhiệm vụ thành công nếu người dùng phải làm lại toàn bộ.
Các kịch bản bao gồm khối lượng trung bình, đỉnh điểm, tăng trưởng và tính theo mùa. Giá cả được đánh dấu ngày và kiểm tra, vì chúng thay đổi.
Phân tích chi phí của một nhiệm vụ AI giữa bối cảnh, nghiên cứu, mô hình, công cụ, sửa chữa, xác nhận và khai thác.
Tránh gọi mô hình
Đòn bẩy hiệu quả nhất là không gọi một LLM khi:
- một quy tắc là đủ;
- một câu trả lời tồn tại trong bộ nhớ đệm ;
- yêu cầu không hợp lệ;
- dữ liệu thiếu;
- người dùng không có quyền;
- một nghiên cứu cổ điển trả lời ;
- một hoạt động có thể được tập hợp lại.
Phân loại ban đầu có thể mang tính quyết định hoặc sử dụng một mô hình nhỏ. Các lộ trình thường xuyên được ưu tiên tối ưu hóa.
Router theo mức độ khó
Không phải tất cả các nhiệm vụ đều cần đến mô hình có khả năng cao nhất. Một bộ định tuyến có thể chọn:
- quy tắc ;
- mẫu nhẹ ;
- mẫu chuyên biệt ;
- mô hình tổng quát mạnh mẽ hơn;
- đối xử nhân đạo.
Định tuyến sử dụng ý định, độ dài, rủi ro, ngôn ngữ và sự tin tưởng. Nó được đánh giá: một sai lầm trong hướng dẫn có thể tốn kém hơn lợi ích kinh tế.
Đối với các nhiệm vụ nhạy cảm, chính sách và dữ liệu có thể áp đặt một môi trường bất kể chi phí.
Thu gọn ngữ cảnh
Các lệnh nhắc đôi khi tích lũy lịch sử, tài liệu và hướng dẫn. Một bối cảnh dài hơn sẽ làm tăng chi phí và độ trễ, và có thể giảm độ chính xác.
Các đòn bẩy là:
- thu hồi chính xác hơn;
- loại trùng lặp ;
- bộ lọc ;
- nén với nguồn gốc ;
- bản ghi nhớ có cấu trúc ;
- tóm tắt các cuộc trao đổi trước đây ;
- bối cảnh khác nhau tùy theo giai đoạn ;
- xóa các ví dụ không cần thiết.
Lợi ích phải được xác nhận qua các đánh giá.
Tối ưu hóa RAG
Một nghiên cứu kém dẫn đến việc gửi quá nhiều đoạn văn. Cải thiện siêu dữ liệu, kết hợp và sắp xếp lại có thể giảm bối cảnh cuối cùng.
Các embedding chỉ được tính toán cho các nội dung đã thay đổi. Các lô, kích thước và mô hình được chọn theo tập hợp dữ liệu. Việc thay đổi embedding đòi hỏi phải so sánh trước khi tái lập chỉ mục hoàn toàn.
Việc xếp hạng lại được dành cho các truy vấn mà nó mang lại lợi ích. Một số lượng nhỏ ứng viên sẽ giảm chi phí.
Bộ nhớ đệm
Có nhiều cấp độ tồn tại:
- đáp án chính xác;
- kết quả tìm kiếm ;
- nhúng truy vấn ;
- tiền tố của prompt;
- ra công cụ;
- tác vụ phụ theo đại lý.
Khóa phải bao gồm phiên bản, quyền, ngôn ngữ và độ mới. Bộ nhớ đệm được chia sẻ giữa các người dùng không được tiết lộ dữ liệu cá nhân. Việc vô hiệu hóa theo các nguồn và chính sách.
Các nhà cung cấp có thể đề xuất các cơ chế lưu trữ ngữ cảnh; các điều kiện và tiết kiệm của họ được kiểm tra.
Lô và không đồng bộ
Các nhiệm vụ không tương tác có thể được gom lại và xử lý với năng lực ít tốn kém hơn hoặc vào thời gian thích hợp. Các API theo lô có thể có thời gian chờ và mức giá cụ thể.
Kiến trúc tách biệt các nhu cầu thời gian thực với các xử lý nền. Người dùng nhận được trạng thái và thông báo thay vì một kết nối được duy trì một cách không cần thiết.
Hạn chế việc thử lại và các vòng lặp
Một timeout không luôn có nghĩa là thất bại. Tính idempotent và việc kiểm tra giúp tránh lặp lại một thao tác. Các lần thử lại sử dụng số lần tối đa, thời gian chờ giảm dần và phân biệt giữa lỗi tạm thời và vĩnh viễn.
Các tác nhân có một ngân sách về bước, thời lượng và chi phí. Họ dừng lại khi không có bằng chứng mới xuất hiện.
Các chuyến đi có cấu trúc
Một định dạng rõ ràng giảm bớt các cuộc gọi sửa lỗi. Sơ đồ đã được xác nhận và các lỗi xác định được gửi lại mô hình với số lần thử hạn chế.
Đối với việc trích xuất, một mô hình chuyên biệt hoặc một quy tắc xử lý hậu có thể kinh tế hơn so với một cuộc trò chuyện chung.
Mô hình mở và năng lực riêng tư
Một cơ sở hạ tầng tư nhân có thể giảm chi phí biến đổi ở mức khối lượng ổn định, nhưng lại thêm chi phí đầu tư và vận hành. Cần tính toán tỷ lệ sử dụng, công suất đỉnh, năng lượng, hỗ trợ và việc tái tạo.
Một kiến trúc lai định tuyến khối lượng dự đoán được về phía năng lực dự trữ và các đỉnh điểm hoặc nhiệm vụ phức tạp về phía API. Chất lượng và chủ quyền vẫn là những ràng buộc.
Đàm phán và đặt trước
Ở quy mô lớn, các nhà cung cấp có thể đề xuất các khả năng, cam kết hoặc mức giá phù hợp. Một việc đặt trước chỉ có lợi nhuận khi việc sử dụng ổn định và sự phụ thuộc được chấp nhận.
Hợp đồng phải đề cập đến các phiên bản, tính khả dụng, khu vực, khả năng đảo ngược và sự biến động của giá. Việc đàm phán không thay thế cho tối ưu hoá kỹ thuật.
Giảm chi phí xác nhận
Giao diện hiển thị các nguồn, sự khác biệt và các khu vực không chắc chắn để tăng tốc việc xem xét. Các kiểm soát định hướng xác định lọc lỗi trước khi đến con người. Việc lấy mẫu được điều chỉnh theo rủi ro và chất lượng đã được chứng minh.
Thời gian con người được theo dõi trong chi phí theo từng nhiệm vụ.
FinOps cho AI
Một thực hành FinOps kết hợp khả năng hiển thị, quyền sở hữu và tối ưu hóa. Mỗi nhóm đều biết:
- sử dụng ;
- ngân sách ;
- chi phí đơn vị;
- mẫu ;
- chất lượng ;
- dị thường ;
- dự báo.
Các thẻ và định danh gán các cuộc gọi cho trường hợp sử dụng. Các cảnh báo phát hiện đỉnh điểm, vòng lặp, thay đổi bối cảnh và sai lệch tỉ lệ thành công.
Ngân sách và các biện pháp bảo vệ
Giới hạn tồn tại theo người dùng, nhóm, nhiệm vụ và khoảng thời gian. Khi ngân sách sắp hết, hệ thống có thể:
- sử dụng một mô hình nhẹ hơn;
- giảm các bước;
- chuyển sang bất đồng bộ;
- yêu cầu xác nhận;
- từ chối một nhiệm vụ không ưu tiên.
Những quyết định rủi ro không nên bị giảm chất lượng âm thầm để tiết kiệm.
Đo lường chất lượng và chi phí cùng nhau
Một bảng so sánh các phiên bản về:
- thành công ;
- lỗi nghiêm trọng;
- độ trễ ;
- chi phí;
- xác nhận ;
- sự hài lòng.
Biên Pareto cho thấy các lựa chọn cải thiện một khía cạnh mà không làm suy giảm quá mức các khía cạnh khác. Quyết định được đưa ra theo từng trường hợp sử dụng.
Một bước đi liên tục
Bắt đầu bằng cách trang bị công cụ, xác định ba vị trí chính, thử một đòn bẩy và kiểm tra chất lượng. Tiết kiệm bền vững thường đến từ quy trình: định tuyến tốt hơn, ít ngữ cảnh hơn, ít sửa lại hơn và ít cuộc gọi không cần thiết hơn.
Partitech có thể điều tiết chi phí, xây dựng bộ định tuyến, tối ưu hóa RAG và các tác nhân, và so sánh các kịch bản lưu trữ. Mục tiêu là kiểm soát chi phí cho mỗi nhiệm vụ với chất lượng và độ an toàn đã được chứng minh.
Hãy nói về dự án của bạn
Kiểm toán và tối ưu hóa chi phí nền tảng AI của bạn với Partitech. Liên hệ Partitech.