IT Health Check định kỳ: Checklist kiểm tra toàn diện cho doanh nghiệp
IT Health Check định kỳ: Checklist kiểm tra toàn diện cho doanh nghiệp
Hệ thống IT của doanh nghiệp bạn đang hoạt động — nhưng có ổn định không? Câu hỏi này ít ai trả lời được nếu không có một quy trình kiểm tra định kỳ có cấu trúc.
IT Health Check không phải đợi đến khi có sự cố mới làm. Đó là bước kiểm tra chủ động, có kế hoạch, giúp phát hiện rủi ro trước khi chúng trở thành downtime. Bài viết này đưa ra một checklist thực tế, dựa trên kinh nghiệm triển khai và bảo trì hệ thống cho doanh nghiệp tại Việt Nam.
Tại sao IT Health Check định kỳ lại quan trọng?
Một hệ thống IT vận hành liên tục sẽ tích lũy “mệt mỏi” theo thời gian: log đầy, disk sắp hết dung lượng, firmware cũ, cấu hình bị thay đổi không kiểm soát, connection table đầy trên firewall, switch bị lỗi port dần do bụi hoặc nhiệt độ. Những thứ này không gây sập hệ thống ngay lập tức, nhưng làm giảm độ tin cậy dần.
IT Health Check định kỳ giúp:
- Phát hiện cấu hình sai hoặc lệch chuẩn trước khi gây ảnh hưởng.
- Kiểm tra dung lượng lưu trữ, tài nguyên CPU/RAM trên máy chủ.
- Xác nhận backup chạy đúng và có thể restore được.
- Rà soát thiết bị sắp hết vòng đời (EOL/EOS) để lên kế hoạch thay thế.
- Đánh giá bảo mật cơ bản: firmware, patch, ACL còn hiệu lực không.
Checklist IT Health Check — 8 hạng mục chính
1. Mạng LAN & Wi-Fi
Bắt đầu từ tầng vật lý:
- Kiểm tra trạng thái port trên switch — port nào đang err-disable, port nào up/down bất thường.
- Xem log switch: có CRC error, collision, FCS error không. Đây là dấu hiệu cáp xuống cấp hoặc đầu nối tiếp xúc kém.
- Đo SNR và tín hiệu Wi-Fi tại các khu vực trọng yếu, đặc biệt nếu doanh nghiệp có ứng dụng thời gian thực (VoIP, video call).
- Kiểm tra VLAN assignment và trunk port có bị sai sau các lần can thiệp.
Tham khảo: Tiêu chuẩn TIA/EIA-568 khuyến nghị kiểm tra cáp mạng định kỳ 12 tháng/lần với hệ thống đang vận hành.
2. Firewall & Bảo mật
- Rà soát rule cũ không còn sử dụng — rule càng nhiều, latency càng cao và nguy cơ misconfiguration càng lớn.
- Kiểm tra firmware firewall: bản vá bảo mật thường được phát hành hàng tháng, firmware cũ hơn 2 phiên bản cần lên lịch nâng cấp.
- Xem log tấn công hoặc truy cập bất thường 30 ngày gần nhất.
- Kiểm tra VPN tunnel: trạng thái, số user concurrent, thời gian uptime.
3. Máy chủ & Ảo hóa
- Kiểm tra tài nguyên: CPU, RAM, disk I/O, network I/O — utilization > 80% kéo dài thì cần mở rộng.
- S.M.A.R.T health của ổ cứng: reallocated sector count, pending sector — chỉ báo sớm ổ sắp hỏng.
- Kiểm tra firmware và driver RAID controller, HBA, NIC.
- Với môi trường ảo hóa (Proxmox, VMware, Hyper-V): kiểm tra snapshot cũ, tình trạng cluster và shared storage.
4. Backup & Disaster Recovery
- Thực hiện restore test ít nhất 1 lần/quý — không chỉ kiểm tra log backup success.
- Kiểm tra dung lượng backup repository có đủ cho retention policy không.
- Xác nhận backup offsite hoặc copy ra media rời đúng lịch.
- Rà soát RPO và RTO thực tế so với yêu cầu SLA.
Nguyên tắc 3-2-1 (3 bản sao, 2 loại media, 1 bản ngoài site) vẫn là chuẩn cơ bản nhất — xem thêm bài viết về chiến lược backup 3-2-1 áp dụng cho doanh nghiệp.
5. UPS & Nguồn điện
- Kiểm tra tuổi thọ battery: UPS lithium thường 5-7 năm, UPS acid 2-3 năm. Battery cuối vòng đời dễ mất dung lượng đột ngột.
- Kiểm tra log sự kiện UPS: số lần chuyển battery mode trong tháng, thời gian chạy battery còn bao lâu.
- Đo điện áp đầu ra, kiểm tra đầu nối có bị nóng hoặc oxy hóa không.
6. Storage & Data Center
- Kiểm tra dung lượng và performance storage: latency có tăng không, có disk failed trong RAID array không.
- Kiểm tra nhiệt độ phòng server: khuyến nghị 18-27°C theo ASHRAE TC 9.9. Nhiệt độ > 27°C thường xuyên làm giảm tuổi thọ thiết bị.
- Kiểm tra bụi bẩn trong tủ rack — bụi trên quạt và tản nhiệt là nguyên nhân phổ biến gây quá nhiệt.
7. Hệ thống tổng đài & Communication
- Kiểm tra SIP trunk registration và chất lượng cuộc gọi: jitter, latency, packet loss.
- Kiểm tra dung lượng ghi âm: ổ đầy gây mất dữ liệu ghi âm mà không có cảnh báo.
- Kiểm tra đồng bộ cấu hình giữa PBX và thiết bị đầu cuối.
8. Tài liệu & Quy trình
- Sơ đồ mạng đã được cập nhật chưa? Thay đổi VLAN hay thiết bị mà không update sơ đồ là lỗi phổ biến.
- Danh sách thiết bị, tài khoản khẩn cấp (break-glass) có được lưu an toàn và kiểm tra định kỳ?
- Runbook xử lý sự cố cho các tình huống thường gặp đã được viết?
Tần suất kiểm tra
- Hàng tháng: log firewall, dung lượng backup, UPS event log, trạng thái RAID.
- Hàng quý: restore test, S.M.A.R.T health, firmware review, cập nhật sơ đồ mạng.
- 6 tháng: đo kiểm cáp mạng bằng Fluke, kiểm tra nhiệt độ phòng server, đánh giá rule firewall.
- Hàng năm: IT Health Check tổng thể, kế hoạch thay thế thiết bị EOL, đánh giá RPO/RTO.
Kết luận
IT Health Check định kỳ giống như bảo dưỡng xe: bạn không đợi máy kêu mới đi kiểm tra. Chi phí cho một đợt health check thường thấp hơn nhiều so với tổn thất từ một sự cố đáng lẽ phát hiện được từ trước.
Nếu doanh nghiệp bạn chưa có quy trình IT Health Check hoặc cần đơn vị đồng hành thực hiện định kỳ, ICTSolution by Wise Tech cung cấp dịch vụ kiểm tra, đánh giá và báo cáo hiện trạng hệ thống ICT. Kỹ sư sẽ đến khảo sát thực tế, đo kiểm bằng thiết bị chuyên dụng (Fluke, Ekahau) và đưa ra báo cáo chi tiết kèm khuyến nghị.
Liên hệ Wise Tech: 0869 31 31 69 (kỹ thuật) — 0917 32 36 37 (kinh doanh) — info@wisetech.com.vn