Backup checkpoint và dữ liệu trên GPU Server
Dữ liệu trên GPU Server có thể gồm checkpoint tải về, dataset riêng, trọng số tinh chỉnh, cấu hình và kết quả chạy. Khi kết thúc thuê hoặc máy lỗi, mất một artifact nhỏ nhưng không thể tái tạo có thể làm mất nhiều giờ tính toán.

Dữ liệu trên GPU Server có thể gồm checkpoint tải về, dataset riêng, trọng số tinh chỉnh, cấu hình và kết quả chạy. Khi kết thúc thuê hoặc máy lỗi, mất một artifact nhỏ nhưng không thể tái tạo có thể làm mất nhiều giờ tính toán.
Phân loại trước khi sao lưu
| Dữ liệu | Cách ưu tiên |
|---|---|
| Model gốc tải lại được | Ghi revision/checksum và điều kiện truy cập |
| Dataset riêng | Bản sao, version và quyền truy cập |
| Checkpoint fine-tune | Sao lưu theo tiến độ và kiểm tra resume |
| Cấu hình/môi trường | Dependency, script và tham số chạy |
| Output quan trọng | Lưu bền vững và xác minh |
| Cache/tạm | Có thể loại khỏi backup nếu tái tạo được |
Ghi nguồn và giấy phép model/dataset theo phạm vi sử dụng. Một checkpoint có thể chứa dữ liệu hoặc khả năng suy ra thông tin từ dữ liệu huấn luyện, nên quyền chia sẻ cần được quản lý như artifact nhạy cảm.
Checkpoint để dùng model khác checkpoint để resume
Một file trọng số có thể đủ cho inference nhưng chưa đủ để tiếp tục training với trạng thái mong muốn. Tùy framework, resume có thể cần optimizer, scheduler, trạng thái bước chạy, adapter và dữ liệu cấu hình. Kiểm tra bằng run thử thay vì đoán từ tên file.
Không khuyến nghị một lệnh save chung cho mọi framework. Dùng cơ chế lưu hỗ trợ bởi bộ phần mềm và phiên bản của dự án, rồi xác nhận artifact thực sự có thể nạp hoặc resume.
Chọn chu kỳ theo thời gian phải chạy lại
Nếu có thể chấp nhận chạy lại tối đa 30 phút, thiết kế chu kỳ cùng thời gian upload để đáp ứng mục tiêu đó. Ví dụ job lưu mỗi 30 phút nhưng upload mất 20 phút có thể để bản ngoài host chậm hơn mốc mong muốn. Đo chu kỳ hoàn tất, không chỉ thời điểm bắt đầu save.
Lưu bền vững và ngoài máy
- Xác nhận disk nào tạm thời, disk nào giữ sau khi dừng thuê.
- Có bản sao ngoài host cho artifact không tái tạo được.
- Giới hạn quyền xóa/sửa bản sao của tài khoản runtime.
- Mã hóa và quản lý khóa theo yêu cầu dữ liệu.
- Chốt thời gian retention cùng dung lượng và chi phí.
Nếu chạy container, dữ liệu trong filesystem tạm của container không nên là nơi duy nhất lưu kết quả. Volume hỗ trợ lưu ngoài writable layer nhưng volume trên cùng host vẫn có rủi ro host; cần bản sao độc lập.
Tránh checkpoint dở dang
Sao lưu trong lúc framework đang ghi có thể tạo artifact không đầy đủ. Dùng tín hiệu hoàn tất hoặc cơ chế snapshot/atomic phù hợp công cụ. Với nhiều file, cần quản lý tính đầy đủ của cả bộ, không chỉ checksum một file riêng.
Thử khôi phục trên môi trường khác
- Ghi version, dependency và revision model.
- Lấy checkpoint cùng cấu hình cần thiết.
- Kiểm tra tính toàn vẹn và quyền.
- Nạp model hoặc resume một đoạn ngắn trên môi trường thử.
- Đối chiếu output hoặc trạng thái chạy.
- Ghi thời gian phục hồi và các bước thiếu.
Giữ một runbook có địa chỉ artifact và cách dựng môi trường nhưng không nhúng token truy cập. Khi thay GPU, cần kiểm tra tương thích phần mềm và nhu cầu VRAM; artifact đúng chưa đảm bảo mọi phần cứng đều chạy được.
Trước khi kết thúc thuê
Đồng bộ artifact cuối, kiểm tra bản sao, xác nhận quyền sở hữu và điều kiện xóa dữ liệu. Không chờ tới khi máy bị thu hồi mới tải checkpoint lớn. Khi thuê GPU Server, hỏi storage, băng thông xuất dữ liệu và thời gian truy cập sau khi dừng.
Model tải từ Internet có cần backup toàn bộ không?
Có thể ưu tiên ghi revision và nguồn nếu chắc chắn tải lại được; dataset riêng và checkpoint tinh chỉnh thường cần bản sao độc lập.
Lưu volume có nghĩa đã backup không?
Không. Volume giúp dữ liệu bền qua vòng đời container theo cấu hình, nhưng không thay bản sao ngoài host.
Cần máy chủ cho workload này?
NOC thuemaychu.vn hỗ trợ chọn CPU, GPU và băng thông. PoC trong 24 giờ.
Bài viết liên quan
GPU / AIGPU Server là gì? Cách chọn GPU cho mô hình ngôn ngữ lớn
Hướng dẫn chọn GPU Server theo workload: bộ nhớ, độ trễ, tải đồng thời và khả năng vận hành ứng dụng AI.
GPU / AICần bao nhiêu VRAM để chạy Llama 3.1 70B?
Tính riêng trọng số, KV cache và overhead; ví dụ context 8K, 32K và 128K với cache FP16.
GPU / AINVIDIA H200 SXM: thông số, phiên bản và mô hình AI
Đội phục vụ mô hình lớn thường hết bộ nhớ trước khi dùng hết tính toán. H200 tăng dư địa chứa trọng số và cache, nên cần đánh giá theo số phiên đồng thời và độ dài tài liệu mà khách gửi vào.