Khi một công ty nghiên cứu một dự án trí tuệ nhân tạo tạo sinh, cuộc thảo luận thường tập trung vào các prompt: liệu chúng ta có thể gửi văn bản này cho mô hình không? Thực tế, dữ liệu luân chuyển trong một chuỗi rộng hơn nhiều. Các tài liệu được nhập, cắt nhỏ, chuyển đổi thành vector, lưu vào bộ nhớ đệm, ghi nhật ký, trích dẫn, sao chép vào các công cụ và đôi khi được giữ lại để cải thiện dịch vụ.
Một đại lý còn thêm các luồng khác: bộ nhớ bền, kết nối với email, CRM hoặc tệp, gọi các phụ đại lý và các hành động thực hiện nhân danh người dùng. Do đó, việc tuân thủ GDPR không thể được đánh giá chỉ dựa trên giao diện của nhà cung cấp.
Bài viết này đề xuất một phương pháp kỹ thuật lập bản đồ và không cấu thành ý kiến pháp lý. Các lựa chọn cần được xác nhận với DPO và các cố vấn có thẩm quyền.
Mô hình chỉ là một thành phần của xử lý
Một kiến trúc tạo sinh có thể bao gồm:
- giao diện web hoặc di động;
- một backend ứng dụng ;
- một cầu nối các mô hình ;
- một nhà cung cấp LLM;
- một dịch vụ nhúng;
- một cơ sở vectơ;
- một OCR ;
- các nguồn tài liệu ;
- các bộ kết nối chuyên ngành;
- một bộ nhớ cuộc trò chuyện;
- các nhật ký, dấu vết và phân tích ;
- một công cụ hỗ trợ;
- các bản sao lưu.
Mỗi người có thể nhận dữ liệu cá nhân. Một thành phần tự lưu trữ giảm bớt một số việc chuyển dữ liệu, nhưng không loại bỏ các nghĩa vụ về mục đích, tối thiểu hóa, bảo mật, thời gian lưu trữ và quyền lợi.
Bắt đầu từ mục đích cuối cùng
Câu hỏi « chúng ta có thể sử dụng dữ liệu này không? » không có câu trả lời trừu tượng. Cần phải mô tả mục đích cụ thể: giúp một cố vấn tìm lại một thủ tục, soạn thảo một câu trả lời, phân loại một yêu cầu, trích xuất một hóa đơn hoặc chuẩn bị một quyết định.
Một mục tiêu mơ hồ như « cải thiện hiệu quả nhờ AI » không cho phép xác định dữ liệu cần thiết. Một mục tiêu cụ thể giúp loại trừ:
- những cột không cần thiết;
- các tài liệu ngoài phạm vi;
- lịch sử đầy đủ khi một khoảng thời gian là đủ ;
- các danh tính khi các tham chiếu bí danh phù hợp;
- nhật ký nội dung khi các số liệu tổng hợp là đủ.
Việc giảm thiểu được nghĩ đến trước khi tiêu thụ, không chỉ sau một sự cố.
Lập bản đồ toàn bộ chuỗi
Đối với từng luồng, hãy ghi chú lại:
- nguồn;
- các loại dữ liệu ;
- các cá nhân liên quan;
- mục đích cuối cùng ;
- người nhận ;
- vai trò của từng diễn viên;
- quốc gia hoặc khu vực;
- mã hóa ;
- thời lượng;
- việc xóa bỏ ;
- việc sử dụng có thể cho huấn luyện;
- truy cập của con người và máy móc.
Việc lập bản đồ phải bao gồm cả các bản sao tạm thời và gián tiếp. Một lời nhắc có thể xuất hiện trong dấu vết khả năng quan sát, một bản ghi trên phương tiện lưu trữ hoặc một bản sao lưu lâu hơn so với trong ứng dụng chính.
Luồng dữ liệu của một tác nhân RAG từ người dùng và các tài liệu đến mô hình, các công cụ, nhật ký và việc xóa bỏ.
Đánh giá dữ liệu mà không đánh giá thấp việc nhận dạng gián tiếp
Một tên hoặc một địa chỉ rõ ràng là cá nhân. Các yếu tố khác có thể xác định một người thông qua sự kết hợp: số hồ sơ, vị trí công tác, địa điểm, sự kiện hiếm, lời trích dẫn, siêu dữ liệu hoặc lịch sử.
Việc thay thế tên giả sẽ thay thế một định danh bằng một tham chiếu được kiểm soát, nhưng dữ liệu vẫn được coi là cá nhân nếu có thể thực hiện việc tái nhận dạng. Việc ẩn danh đòi hỏi một phân tích mạnh mẽ hơn và có tính bối cảnh. Các hướng dẫn của CEPD được công bố vào năm 2026 nhắc lại rằng việc đánh giá phụ thuộc đặc biệt vào các phương tiện có khả năng hợp lý có thể được sử dụng bởi các bên liên quan phù hợp.
Do đó, hãy tránh gán nhãn một tập hợp dữ liệu là “ẩn danh” chỉ vì các tên đã bị xóa.
Xác định vai trò và trách nhiệm
Doanh nghiệp có thể là người chịu trách nhiệm xử lý cho mục đích kinh doanh và sử dụng các nhà thầu phụ. Nhà cung cấp cũng có thể xử lý một số dữ liệu cho các mục đích riêng của mình theo đề xuất và điều kiện của mình. Các vai trò cần được phân tích, không nên suy ra từ một khẩu hiệu thương mại.
Kiểm tra :
- hướng dẫn có tài liệu;
- các nhà thầu phụ sau này ;
- vùng điều trị ;
- chuyển giao ra ngoài Khu vực Kinh tế châu Âu;
- an ninh;
- thông báo sự cố ;
- hỗ trợ về quyền lợi;
- xóa bỏ và hoàn trả;
- kiểm toán ;
- thay đổi mô hình hoặc chính sách;
- sử dụng nội dung để cải thiện dịch vụ.
Chế độ « dữ liệu không được sử dụng để huấn luyện » không trả lời được tất cả các câu hỏi: nội dung vẫn có thể được lưu giữ cho mục đích bảo mật, hỗ trợ hoặc ghi log.
Chọn và ghi chép cơ sở pháp lý
Cơ sở pháp lý phụ thuộc vào mục đích, mối quan hệ và bối cảnh. Một công cụ nội bộ, một dịch vụ khách hàng, một nghiên cứu khoa học và một quá trình tuyển dụng không được phân tích theo cùng một cách.
Nhóm kỹ thuật không được tự động chọn “lợi ích hợp pháp”. Họ cung cấp cho DPO các yếu tố thực tế: cần thiết, dữ liệu, cá nhân, tác động, các phương án thay thế và các biện pháp. Sự đồng ý không nên được sử dụng khi nó không tự do hoặc khi dịch vụ thực sự không thể hoạt động mà không xử lý dữ liệu.
Khi các loại dữ liệu đặc biệt được đề cập, các điều kiện bổ sung sẽ được áp dụng.
Thiết kế RAG với việc bảo vệ dữ liệu
Một RAG có thể giảm ảo giác và hạn chế nhu cầu điều chỉnh tinh vi, nhưng nó tạo ra một chỉ mục được rút ra từ các tài liệu. Các embedding không nên được coi là ẩn danh theo mặc định. Chúng có thể tiết lộ thông tin hoặc cho phép so sánh tùy theo bối cảnh.
Các kiểm soát hữu ích bao gồm:
- lọc nguồn trước khi đưa vào
- quyền truy cập được phổ biến tới chỉ mục;
- tách theo người thuê hoặc miền;
- siêu dữ liệu tối thiểu ;
- mã hóa ;
- xóa đồng bộ giữa nguồn, các khối và chỉ mục ;
- trích dẫn có kiểm soát quyền hạn;
- kiểm tra rò rỉ giữa các người dùng;
- tái lập chỉ mục theo phiên bản.
Một cơ sở vector duy nhất mà tất cả mọi người đều có thể truy cập là một sai lầm thường gặp khi các tài liệu gốc có quyền hạn chi tiết.
Khung hướng dẫn, kết quả đầu ra và phản hồi
Người dùng có thể nhập nhiều dữ liệu hơn mức cần thiết. Giao diện phải thông báo cho họ và, nếu có thể, phát hiện hoặc ẩn một số loại trước khi gửi.
Các đầu ra có thể lặp lại một dữ liệu nguồn, suy ra một thông tin hoặc kết hợp nhiều yếu tố. Do đó, chúng cũng bị áp dụng các kiểm soát truy cập và lưu trữ giống nhau.
Phản hồi « đúng/sai » có thể chứa toàn bộ văn bản và trở thành một tập dữ liệu để cải thiện. Xác định ai có thể đọc nó, thời gian lưu trữ và liệu nó có được tái sử dụng để đào tạo hoặc đánh giá không.
Thành thạo nhật ký và khả năng quan sát
Không có dấu vết, khó có thể giải thích một lỗi. Với các dấu vết toàn diện, công ty tạo ra một cơ sở nhạy cảm mới. Cần phải tách rời:
- các chỉ số kỹ thuật không có nội dung;
- các định danh tương quan ;
- các lời nhắc và kết quả được lấy mẫu ;
- sổ nhật ký giao dịch cổ phiếu;
- lỗi;
- dữ liệu bảo mật.
Áp dụng kiểm soát truy cập, mã hóa, che giấu, thời gian ngắn và kiểm toán. Các dấu vết chi tiết có thể được kích hoạt tạm thời cho một sự cố với quy trình đã định.
Quản lý bộ nhớ và các tác nhân
Bộ nhớ bền có thể tích lũy sở thích, mối quan hệ, sức khỏe, quan điểm hoặc thói quen. Nó phải có thể nhìn thấy, chỉnh sửa và xoá bỏ. Phạm vi của nó được giới hạn ở những gì thực sự cải thiện dịch vụ.
Đối với một đại lý, mỗi kết nối mở rộng quá trình xử lý. CNIL và CIANum đã nhấn mạnh vào tháng 7 năm 2026 các rủi ro liên quan đến việc luân chuyển giữa các dịch vụ, bộ nhớ lâu dài, cá nhân hóa quá mức và khó khăn trong việc xác định trách nhiệm.
Nguyên tắc đặc quyền tối thiểu được áp dụng: truy cập theo yêu cầu, phạm vi hạn chế, thời gian ngắn, xác nhận cho các hành động nhạy cảm và nhật ký dễ hiểu cho người dùng.
Chuẩn bị quyền của con người
Doanh nghiệp phải biết cách tìm lại, sửa, xuất hoặc xóa các dữ liệu liên quan. Điều này bao gồm việc liên kết danh tính với các lớp khác nhau mà không tạo ra một chỉ mục xâm nhập hơn nữa.
Kiểm tra lộ trình:
- tìm lại các câu lệnh;
- xác định các tài liệu nguồn;
- xóa các phần và nhúng;
- xóa bộ nhớ ;
- xử lý các bản sao lưu theo chính sách;
- sửa một dữ liệu nguồn;
- tránh tái xuất hiện của nó trong lần lập chỉ mục tiếp theo.
Một quyền lý thuyết mà không có thủ tục kỹ thuật thì khó thực hiện.
Xác định xem một Đánh giá Tác động Bảo mật Dữ liệu (AIPD) có cần thiết hay không
Một phân tích tác động liên quan đến việc bảo vệ dữ liệu có thể được yêu cầu khi việc xử lý có khả năng tạo ra rủi ro cao. Các yếu tố bao gồm đặc biệt giám sát, dữ liệu nhạy cảm, người dễ bị tổn thương, quy mô, đối chiếu, đổi mới và các quyết định quan trọng.
Ngay cả khi không bắt buộc, một phân tích có cấu trúc cũng giúp so sánh các biến thể về kiến trúc và các biện pháp. Nó phải được cập nhật khi có sự thay đổi về mục đích, mô hình, dữ liệu hoặc tính tự chủ.
Không nhầm lẫn giữa huấn luyện, tinh chỉnh và sử dụng
Một nhà cung cấp có thể không sử dụng các prompt để huấn luyện trong khi thực hiện xử lý trên cơ sở hạ tầng của mình. Một fine-tuning có thể ghi nhớ các ví dụ. Một RAG lưu dữ liệu trong một chỉ mục. Mỗi cơ chế tạo ra các rủi ro riêng biệt.
Đối với việc huấn luyện hoặc cá nhân hóa, hãy ghi chép nguồn gốc, quyền hạn, sự cần thiết, lọc, kiểm tra trích xuất, thời lượng và khả năng rút lui. Việc thu thập hàng loạt dữ liệu cá nhân đang được hướng dẫn bởi các chỉ dẫn của CEPD được công bố để tham khảo vào tháng 7 năm 2026.
Một kiến trúc bảo mật theo mặc định
Một giải pháp vững chắc kết hợp:
- phân loại dữ liệu;
- cầu nối tập trung;
- mẫu được phép theo cấp độ ;
- che mặt trước trước khi gửi;
- truy cập được lan truyền;
- giữ lại tối thiểu;
- nhật ký được kiểm soát ;
- các vùng và hợp đồng đã được kiểm tra ;
- kiểm tra rò rỉ;
- thủ tục về quyền và sự cố.
Partitech có thể thực hiện việc lập bản đồ kỹ thuật, thiết kế các kiểm soát truy cập, lập chỉ mục, cổng và các cơ chế xóa dữ liệu. DPO và các cố vấn của công ty xác nhận các cơ sở pháp lý, thông tin và phân tích. Kết quả mong đợi là một kiến trúc mà trong đó các luồng dữ liệu được biết đến và có thể điều khiển, không phải là một lời hứa trừu tượng về quyền riêng tư.
Hãy nói về dự án của bạn
Lập bản đồ và bảo mật luồng dữ liệu của dự án AI của bạn với Partitech, DPO và các tư vấn của bạn. Liên hệ Partitech.