Trao đổi về dự án
Lưu trữ và quản lý dữ liệu

PRA và PCA của một ứng dụng web: xác định RTO, RPO, sao lưu và các kịch bản khủng hoảng

Một PRA không phải là một tài liệu được lưu trữ trong một hồ sơ. Đó là một khả năng được kiểm tra để phục hồi một dịch vụ, dữ liệu của nó và các phụ thuộc của nó trong một khoảng thời gian được chấp nhận bởi nghiệp vụ.

PRA và PCA của một ứng dụng web: xác định RTO, RPO, sao lưu và các kịch bản khủng hoảng

Một bản sao lưu không đảm bảo sự liên tục. Nó có thể không đầy đủ, không thể truy cập khi xảy ra tấn công, quá lâu để khôi phục hoặc phụ thuộc vào một dịch vụ cũng không khả dụng. Kế hoạch phục hồi hoạt động biến các mục tiêu kinh doanh thành các quy trình, phương tiện kỹ thuật và các bài tập có thể đo lường được.

PCA, kế hoạch tiếp tục hoạt động, nhằm duy trì mức dịch vụ trong thời gian gián đoạn. PRA, kế hoạch khôi phục hoạt động, tổ chức việc khôi phục sau khi bị ngắt quãng. Đối với một ứng dụng web, cả hai bao gồm mã nguồn, dữ liệu, hạ tầng, dịch vụ bên thứ ba, đội ngũ và xác thực nghiệp vụ.

Bắt đầu từ tác động nghề nghiệp

Câu hỏi ban đầu không phải là “chúng ta muốn bao nhiêu bản sao lưu?”, mà là “sẽ xảy ra chuyện gì nếu hành trình này không khả dụng hoặc nếu dữ liệu cuối cùng của nó biến mất?”. Các tác động có thể là về tài chính, vận hành, hợp đồng, pháp lý hoặc uy tín.

Mỗi khả năng được phân loại: tra cứu, nhập liệu, thanh toán, tính toán, nhập khẩu, thông báo, quản trị. Một số có thể hoạt động ở chế độ giảm chất lượng; những cái khác cần dừng lại để bảo vệ tính toàn vẹn.

Phân tích này xác định các ưu tiên phục hồi. Khôi phục toàn bộ trang web trước chức năng nhận đơn hàng có thể thuận tiện về mặt kỹ thuật nhưng lại không đúng về mặt nghiệp vụ.

Hiểu RTO, RPO, MTPD và WRT

RTO là thời gian mục tiêu giữa việc gián đoạn và khôi phục dịch vụ kỹ thuật được chấp nhận. RPO đại diện cho lượng dữ liệu tối đa mà tổ chức chấp nhận mất, được biểu thị theo thời gian.

MTPD chỉ ra thời gian tối đa có thể chịu được của gián đoạn trước khi hậu quả trở nên không chấp nhận được. WRT, hay thời gian khôi phục công việc, bao gồm những gì các đội ngũ nghiệp vụ phải làm sau khi kỹ thuật quay trở lại: kiểm tra, đối chiếu, bù đắp và truyền thông.

Một sự nhất quán đơn giản là cần thiết: RTO cộng với WRT phải luôn thấp hơn thời gian tối đa có thể chấp nhận. RPO phải tương thích với tần suất sao lưu hoặc nhân bản thực tế đạt được.

Dòng thời gian bắt đầu từ các bản sao lưu có sẵn trước sự cố. Khoảng thời gian giữa điểm phục hồi cuối cùng và sự cố đại diện cho mất mát dữ liệu được giới hạn bởi RPO. Sau sự cố, RTO bao gồm quyết định, tái thiết và khôi phục cho đến khi dịch vụ kỹ thuật trở lại ở mức chấp nhận được. WRT kéo dài thời gian này cho đến khi xác nhận và phục hồi hoàn toàn công việc của các nhóm nghiệp vụ. Toàn bộ RTO cộng với WRT phải nhỏ hơn MTPD, thời gian gián đoạn tối đa có thể chấp nhận.

Một chiến lược sao lưu toàn diện

Một chiến lược cụ thể :

  • dữ liệu được bao phủ;
  • tần số ;
  • sự giữ lại ;
  • các bản sao ngoại tuyến hoặc bất biến ;
  • sự tách biệt các tài khoản và quyền lợi ;
  • mã hóa ;
  • giám sát các thất bại;
  • thủ tục khôi phục;
  • bằng chứng kiểm tra.

Nguyên tắc gọi là 3-2-1 — nhiều bản sao, trên các phương tiện khác nhau, trong đó có một bản tách biệt — là một điểm khởi đầu, không phải là một bảo đảm toàn cầu. Các bản sao lưu phải bao gồm cơ sở dữ liệu, tập tin, cấu hình, các khóa cần thiết và các phiên bản mã tương thích.

Khôi phục toàn bộ sự nhất quán

Một cơ sở được phục hồi mà không có các tệp liên quan, hoặc một mã mới với một sơ đồ cũ, có thể làm cho ứng dụng không nhất quán. PRA xác định một điểm nhất quán và thứ tự: hạ tầng, bí mật, cơ sở dữ liệu, lưu trữ, chỉ mục, công nhân, bộ nhớ đệm và dịch vụ.

Các bản di chuyển và tập lệnh phải được phiên bản hóa. Các khóa mã hóa và chứng chỉ cần thiết để đọc dữ liệu được bảo vệ riêng nhưng có sẵn trong thời gian khủng hoảng.

Chọn mức độ cứu trợ

Sao lưu và tái tạo

Phù hợp khi RTO được tính bằng giờ hoặc ngày. Hạ tầng được tái tạo rồi dữ liệu được khôi phục. Phương pháp này tiết kiệm nhưng phụ thuộc vào tự động hóa và khả năng sẵn sàng của các thành phần.

Môi trường dự phòng lạnh hoặc ấm

Các tài nguyên đã được chuẩn bị, với một phần cơ sở hạ tầng hoặc dữ liệu đã có sẵn. Chi phí tăng lên, thời gian khôi phục giảm xuống.

Cứu trợ nóng và nhân bản

Một cơ sở hạ tầng sẵn sàng nhận dữ liệu liên tục hoặc gần như liên tục. Việc chuyển đổi có thể nhanh chóng, nhưng cần phải kiểm soát việc nhân rộng lỗi, xung đột và các bài kiểm tra hoàn nguyên.

Tiếp tục hoạt động

Nhiều khu vực hoặc trang web phục vụ cho giao thông. Kiến trúc này nhằm đảm bảo độ sẵn sàng cao, mà không loại bỏ nhu cầu sao lưu: một việc xóa dữ liệu theo logic hoặc một sự xâm phạm có thể lan rộng khắp nơi.

Lập bản đồ các phụ thuộc

Ứng dụng thường phụ thuộc vào DNS, danh tính, email, thanh toán, lưu trữ, API doanh nghiệp và nhà cung cấp. Kế hoạch khôi phục thảm họa (PRA) phải xác định hành vi của từng thành phần: chờ đợi, xếp hàng, chế độ suy giảm, nhà cung cấp khác hoặc tạm ngưng có kiểm soát.

Một kiến trúc dự phòng mất đi giá trị nếu tài khoản DNS, nhà cung cấp danh tính hoặc một khóa duy nhất vẫn là điểm lỗi. Các phụ thuộc về tổ chức cũng quan trọng: ai có thể truy cập các tài khoản, đưa ra quyết định và truyền đạt thông tin?

Xác định các kịch bản khủng hoảng

Một kế hoạch chung là không đủ. Hãy thử nghiệm các kịch bản:

  • xóa hoặc hỏng dữ liệu;
  • không khả dụng của một vùng đám mây;
  • xâm phạm các tài khoản quản trị viên;
  • mã độc tống tiền ;
  • chứng chỉ hoặc tên miền đã hết hạn;
  • triển khai bị lỗi ;
  • sự cố của một dịch vụ bên thứ ba;
  • sự vắng mặt của một người quan trọng.

Mỗi kịch bản cụ thể xác định rõ trình kích hoạt, phạm vi, quyết định, cách ly, khôi phục, xác nhận và thoát khỏi khủng hoảng.

Viết một sổ tay hướng dẫn có thể sử dụng dưới áp lực

Sổ tay vận hành phải ngắn gọn, có phiên bản và có thể truy cập ngay cả khi hệ thống chính không khả dụng. Nó chỉ ra các liên hệ, các yêu cầu trước, các lệnh, kết quả mong đợi và các điểm ngắt. Các bí mật không được viết rõ ràng; kho chứa bí mật và quy trình truy cập của chúng được kiểm tra.

Các vai trò được phân chia: điều hành khủng hoảng, can thiệp kỹ thuật, xác nhận nghiệp vụ, truyền thông và liên lạc với nhà cung cấp. Một người có thể đảm nhận nhiều vai trò trong một cơ cấu nhỏ, nhưng trách nhiệm vẫn được ghi rõ.

Kiểm tra việc khôi phục

Một thử nghiệm sao lưu kiểm tra xem một tệp có tồn tại hay không. Một thử nghiệm khôi phục chứng minh rằng nó có thể được sử dụng. Bài tập phải đo lường:

  • thời gian phục hồi quyền truy cập;
  • thời gian tái xây dựng;
  • thời gian chuyển và phục hồi;
  • kiểm tra tính toàn vẹn;
  • xác nhận các lộ trình;
  • chênh lệch so với RTO/RPO ;
  • các thao tác thủ công và lỗi.

Các bài tập có thể bắt đầu bằng một bàn, sau đó là một môi trường cách ly, rồi đến việc lặp lại toàn bộ. Chúng phải tạo ra các hành động có thời hạn.

Chuẩn bị giao tiếp

Sự liên tục bao gồm người dùng, đối tác và các đội ngũ. Các mẫu tin nhắn giải thích những gì đã biết, tác động, các biện pháp và bản cập nhật tiếp theo. Cần tránh các lời hứa về thời hạn không được xác nhận và bảo vệ thông tin bảo mật.

Một nhật ký khủng hoảng được đánh dấu thời gian lưu giữ các quyết định, hành động và bằng chứng. Nó tạo điều kiện thuận lợi cho việc rút kinh nghiệm và các nghĩa vụ thông báo có thể phát sinh.

Duy trì kế hoạch sống động

Kế hoạch khôi phục sau thảm họa (PRA) được xem xét lại khi kiến trúc, khối lượng, nhà cung cấp hoặc tổ chức thay đổi. Các liên hệ hết hạn, các đơn đặt hàng thay đổi và các mục tiêu kinh doanh trở nên khắt khe hơn. Việc xem xét hàng năm là tối thiểu cho một nền tảng quan trọng; các thử nghiệm có thể diễn ra thường xuyên hơn tùy thuộc vào mức độ quan trọng.

Các chỉ số theo dõi tỷ lệ thành công của các bản sao lưu, tuổi của lần kiểm tra cuối cùng, thời gian khôi phục đã đo, các sai lệch và các hành động chưa đóng.

Một khả năng, không phải một tài liệu

Mức độ liên tục phải được cân đối. Một RTO chỉ vài phút đòi hỏi kiến trúc và tổ chức tốn kém. Một mục tiêu vài giờ có thể hoàn toàn chấp nhận được nếu nó được thừa nhận và kiểm tra.

Partitech đảm bảo việc lưu trữ, quản lý thông tin, giám sát và bảo trì các nền tảng kỹ thuật số. Chúng tôi có thể lập bản đồ phụ thuộc, xác định các mục tiêu, tự động hóa việc khôi phục và thực hiện các bài tập để kế hoạch khôi phục thảm họa phù hợp với khả năng thực tế.

Để làm sâu sắc thêm quy trình, hãy khung các mức độ dịch vụ và bảo trì ứng dụng, bắt đầu với một kiểm toán kỹ thuật của ứng dụng và chuẩn bị chúng chiến lược chuyển đổi của một ứng dụng. Khám phá thêm ưu đãi Bảo trì, phát triển, lưu trữ và quản lý CNTT của Partitech.

Tài liệu tham khảo chính thức

Tài liệu tham khảo được tra cứu vào 17 tháng 8 năm 2026 :

Chia sẻ bài viết