Anthropic đã công bố vào ngày 18 tháng 8 năm 2026 một báo cáo kinh nghiệm về việc sử dụng Claude như người phản ứng đầu tiên trong các sự cố CI/CD. Công ty thông báo rằng các báo cáo ban đầu thường được tạo ra trong chưa đầy mười lăm phút. Vượt ra ngoài các con số, trường hợp này thú vị vì nó mô tả một kiến trúc có thể tái tạo: truy cập chỉ đọc, công cụ được kiểm soát, bộ nhớ có phiên bản và xác nhận của con người trước bất kỳ sự thay đổi nào.
1. Những gì kinh nghiệm phản hồi khẳng định
Anthropic mô tả một tác nhân có tên Claude Tag được sử dụng như người trả lời đầu tiên cho các sự cố liên quan đến tích hợp và triển khai liên tục. Theo dữ liệu nội bộ đã công bố, tác nhân này đã tạo ra báo cáo tình hình đầu tiên trong mỗi sự cố gần đây có báo cáo, thường trong vòng mười lăm phút. Thời gian trung vị được công bố cho một phân tích dựa trên bằng chứng là mười bốn phút và, trong những trường hợp nhanh nhất, nguyên nhân gốc rễ đã được xác định trong bốn phút.
Những kết quả này xuất phát từ môi trường của Anthropic và không phải là một tiêu chuẩn đánh giá độc lập. Tuy nhiên, chúng cho thấy một phần công việc trực ban ban đầu có thể được cấu trúc: tập hợp các tín hiệu, đề xuất các giả thuyết, trích dẫn các yếu tố quan sát được và chuẩn bị việc truyền đạt.
2. Vai trò thích hợp cho một nhân viên trực
Mục tiêu đầu tiên không phải là thay thế kỹ sư trực. Mục tiêu là giảm thời gian bị lãng phí khi mở nhiều công cụ, so sánh các lịch trình và tái tạo bối cảnh của một thay đổi.
Một đại lý được thiết kế tốt có thể thu thập các cảnh báo, triển khai gần đây, lỗi, dấu vết và các cuộc thảo luận liên quan. Sau đó, nó có thể đề xuất một dòng thời gian, các dịch vụ bị ảnh hưởng, các giả thuyết và các kiểm tra tiếp theo. Con người vẫn duy trì quyết định, đặc biệt khi một hành động có thể làm tình huống trở nên nghiêm trọng hơn.
Sự phân bố này phù hợp với nguyên tắc của xác thực con người của các hệ thống AI : tự động hóa việc thu thập và tổng hợp, nhưng vẫn duy trì trách nhiệm rõ ràng đối với các hành động có tác động lớn.
3. Một kiến trúc hai giai đoạn
Mô hình được mô tả tách việc kích hoạt mang tính xác định ra khỏi điều tra theo tác nhân. Các cảnh báo và quy tắc cổ điển phát hiện một trạng thái đã biết: thất bại của pipeline, tỷ lệ lỗi, độ trễ hoặc tình trạng bão hòa. Sau đó, chúng kích hoạt tác nhân với phạm vi và mã định danh sự cố.
Một người điều phối có thể phân công nhiều nhiệm vụ cho các phụ đại lý: phân tích các chỉ số, kiểm tra các thay đổi trên Git, đọc các sự kiện Kubernetes hoặc tìm các sự cố tương tự. Mỗi kết quả đều phải giữ lại các tham chiếu cho phép kỹ sư kiểm tra.
Sự tách biệt này là thiết yếu. Hệ thống giám sát vẫn chịu trách nhiệm về việc phát hiện và các ngưỡng. Mô hình can thiệp vào việc nghiên cứu, giải thích và truyền đạt, nơi mà các quy tắc cứng nhắc đạt đến giới hạn của chúng.
4. Tại sao bắt đầu ở chế độ chỉ đọc
Anthropic cung cấp một bộ khởi động tạo một vai trò ban đầu chỉ có quyền đọc. Đây là phương pháp đúng cho một triển khai đầu tiên. Một đại lý có khả năng xem các chỉ số và nhật ký đã mang lại giá trị mà không thể dừng dịch vụ hoặc thay đổi cấu hình.
Bộ công cụ công khai được trình bày mà không có khả năng tự khắc phục: con người quyết định các hành động và triển khai chúng. Hệ thống nội bộ do Anthropic mô tả cũng bao gồm một tác nhân riêng biệt có thể quản lý việc triển khai dần dần phía sau các cờ tính năng; khả năng này không nên bị nhầm lẫn với phạm vi ban đầu của bộ công cụ.
Các quyền phải được cấp theo công cụ và theo môi trường. Đọc các sự kiện từ một cụm thử nghiệm không chứng minh quyền truy cập vào các bí mật sản xuất. Xem một yêu cầu kéo không yêu cầu quyền hợp nhất nó.
Mỗi yêu cầu phải được ghi nhật ký kèm theo danh tính của đại lý, sự cố, công cụ, phạm vi và kết quả. Các định danh tạm thời và mã thông báo thời gian ngắn hạn giới hạn tác động của rò rỉ.
5. Truy cập các công cụ thông qua MCP
Phản hồi kinh nghiệm đề cập đến việc truy cập Datadog hoặc Grafana, PagerDuty, GitHub, Kubernetes và Slack thông qua MCP. Giao thức này tạo điều kiện cho một giao diện chung, nhưng bản thân nó không cấu thành một biện pháp kiểm soát an ninh.
Mỗi máy chủ MCP phải phơi bày một tập hợp con các hành động rõ ràng, xác thực các tham số và áp dụng quyền hạn ở phía dịch vụ. Cần tránh các công cụ tổng quát kiểu “thực thi lệnh tùy ý” hoặc “thực hiện yêu cầu tự do” khi một chức năng hẹp hơn là đủ.
Các phản hồi của công cụ phải được coi là dữ liệu không đáng tin cậy. Một tin nhắn Slack hoặc tên nhánh có thể chứa văn bản được thiết kế để đánh lạc hướng tác nhân. Mô hình không bao giờ được phép biến một hướng dẫn tìm thấy trong một nguồn thành quyền thực hiện hành động.
6. Trí nhớ, hướng dẫn và học tập
Anthropic mô tả một bộ nhớ được cung cấp bởi Slack, các chỉ dẫn vĩnh viễn trong Markdown được phiên bản hoá trong Git và một tệp bài học rút ra từ các sự cố trước. Cách tổ chức này được ưa thích hơn so với một prompt không rõ ràng được chỉnh sửa trong giao diện.
Hướng dẫn phải chỉ rõ thứ tự kiểm tra, các nguồn tin cậy, định dạng báo cáo, ngưỡng phải nâng cấp và các hành động bị cấm. Mọi sửa đổi đều phải qua xem xét mã và có thể được liên kết với một sự cố cụ thể.
Bộ nhớ cần được lọc. Một bản phân tích sau khi chết đôi khi chứa những bí mật, dữ liệu cá nhân hoặc những giả thuyết đã trở nên sai. Hãy lưu giữ các bản tóm tắt đã được xác thực và ngày hết hạn thay vì truy cập không giới hạn vào tất cả các cuộc trò chuyện lịch sử.
7. Các biện pháp phòng ngừa trước một hành động
Khi một trình điều khiển chỉ đọc được kiểm soát, một số hành động có thể đảo ngược được có thể được đề xuất: mở một vé, chuẩn bị một pull request, chạy lại một công việc không phá hủy hoặc tạo một lệnh cần được xác nhận.
Sửa lỗi được mô tả bởi Anthropic vẫn được kỹ sư trực luân phiên xem xét, hợp nhất và triển khai. Ranh giới này phải rõ ràng trong giao diện. Một nút xác nhận là chưa đủ nếu người dùng không hiểu chính xác các tác động.
Đối với một hành động tự động, yêu cầu ít nhất một chính sách xác định, phạm vi giới hạn, nhật ký có chữ ký, thời hạn, điều kiện quay lại và bằng chứng kiểm tra sau khi thực hiện.
8. Một kế hoạch triển khai theo bốn giai đoạn
Giai đoạn 1 là ngoại tuyến: phát lại các sự cố đã đóng và so sánh báo cáo của nhân viên với báo cáo phân tích sau sự cố. Giai đoạn 2 là quan sát thời gian thực, không có thông báo hoạt động. Giai đoạn 3 mở báo cáo cho ca trực, luôn chỉ đọc. Giai đoạn 4 cho phép một số hành động chuẩn bị hoặc có thể đảo ngược.
Ở mỗi giai đoạn, hãy xác định các tiêu chí để chuyển tiếp: tỷ lệ trích dẫn chính xác, không truy cập ngoài phạm vi, thời gian phản hồi, chất lượng giả thuyết và khối lượng kiểm tra của con người.
Đừng nhảy thẳng vào việc khắc phục tự động. Sự cố chính xác là thời điểm mà bối cảnh không đầy đủ, các hệ thống bị suy giảm và các lỗi tốn kém.
9. Các chỉ số cần theo dõi
Đo lường thời gian cho đến báo cáo hữu ích đầu tiên, thời gian đến nguyên nhân gốc rễ, độ chính xác của các sự kiện, số giả thuyết bị bác bỏ và thời gian xem xét của con người. Cũng theo dõi các sự cố mà tác nhân không mang lại giá trị nào.
Một hệ thống tốt phải giảm thời gian hiểu mà không làm tăng rủi ro. Chỉ số "chẩn đoán đúng" là chưa đủ: một phân tích chính xác nhưng không có nguồn có thể không sử dụng được khi bị áp lực.
Kinh nghiệm được công bố bởi Anthropic cho thấy một hướng đi đáng tin cậy cho quản lý CNTT thuê ngoài và SRE. Tuy nhiên, việc chuyển đổi nó đòi hỏi một kiến trúc quyền hạn, các công cụ chuyên biệt và một tiến trình đo lường cẩn thận.
Partitech có thể hỗ trợ việc triển khai một trợ lý trực : tích hợp với các công cụ, vai trò chỉ đọc, các trò chơi phát lại, bảng điều khiển, xác nhận bằng con người và quy trình hoàn nguyên.