Telstra tiết lộ nguyên nhân sự cố mạng: lỗi phần mềm trong quá trình bảo trì
Telstra đã xác định nguyên nhân sự cố mạng diện rộng là lỗi phần mềm phát sinh trong quá trình bảo trì máy chủ đồng bộ thời gian tại Melbourne. Thiết bị khởi động lại với ngày giờ sai, kéo theo lỗi xác thực lan rộng, ảnh hưởng đến gọi Triple-0, hệ thống đường sắt và thanh toán thẻ. Lãnh đạo Telstra đã công khai xin lỗi và cam kết siết chặt quy trình để tránh tái diễn.
Telstra vừa hé lộ nguyên nhân phía sau sự cố mạng diện rộng gây ảnh hưởng lớn tại Úc: một lỗi phần mềm trong quá trình bảo trì máy chủ đồng bộ thời gian ở Melbourne. Điều đáng nói là chỉ một lỗi tưởng như rất kỹ thuật này đã kéo theo hàng loạt gián đoạn, từ cuộc gọi khẩn cấp Triple-0 cho đến hệ thống đường sắt và thanh toán EFTPOS.
Sự việc không chỉ khiến người dân lo lắng, mà còn đặt ra câu hỏi lớn về cách một hạ tầng viễn thông quy mô quốc gia phải vận hành an toàn như thế nào. Telstra cho biết họ đã báo cáo chi tiết lên cuộc điều tra của Thượng viện và thừa nhận rằng các biện pháp kiểm soát nội bộ có lẽ chưa đủ chặt chẽ.
Đây là một trong những sự cố khiến dư luận đặc biệt chú ý trong thời gian gần đây, vì nó tác động trực tiếp đến các dịch vụ thiết yếu mà hàng triệu người dân Úc đang phụ thuộc mỗi ngày. Nếu bạn muốn xem thêm các tin liên quan trong chuyên mục, có thể ghé Tin tức - Sự kiện hoặc Tin tức.
.png)
Ảnh minh họa: Máy chủ đồng bộ thời gian gây gián đoạn mạng
Telstra nói gì về nguyên nhân sự cố?
Theo nội dung Telstra trình lên cuộc điều trần của Thượng viện, sự cố bắt nguồn từ một máy chủ Network Time Protocol, hay NTP, đặt tại đường Exhibition Street, Melbourne. Đây là thiết bị đóng vai trò giữ thời gian đồng bộ cho mạng. Trong quá trình bảo trì, máy chủ này phải được tắt nguồn rồi khởi động lại.
Vấn đề phát sinh khi thiết bị bật lên với cấu hình phần mềm không phù hợp, khiến ngày giờ bị reset về năm 2006. Nghe có vẻ khó tin, nhưng trong một hệ thống viễn thông, thời gian chính xác lại là thứ cực kỳ quan trọng. Chỉ cần thời gian bị lệch, các cơ chế xác thực và đồng bộ trong mạng có thể bị ảnh hưởng dây chuyền.
Telstra cũng cho biết một thẻ GPS bên trong máy chủ không hoạt động như kỳ vọng, trong khi một bản cập nhật phần mềm quan trọng lại chưa được áp dụng cho thiết bị. Ngoài ra, còn có một thay đổi thiết kế trước đó từng được thực hiện để xử lý lỗi cũ, nhưng lại không được tài liệu hóa đầy đủ. Chính chi tiết này khiến đội bảo trì không lường trước được cách thiết bị sẽ phản ứng sau khi khởi động lại.
Vì sao lỗi thời gian lại gây ảnh hưởng diện rộng?
Nhiều người có thể thắc mắc: tại sao một máy chủ thời gian lại có thể làm gián đoạn cả một phần mạng di động? Câu trả lời nằm ở cách hạ tầng viễn thông hiện đại vận hành. Hệ thống mạng không chỉ truyền dữ liệu hay cuộc gọi, mà còn cần một mốc thời gian chuẩn để các máy chủ và thiết bị xác thực lẫn nhau.
Khi máy chủ bị quay ngược về một mốc thời gian sai, các chứng chỉ xác thực trong mạng có thể bị coi là không còn hợp lệ. Từ đó, nhiều tiến trình phụ thuộc vào xác thực sẽ gặp lỗi. Telstra mô tả tình trạng này như một hiệu ứng lan truyền chậm, khi ngày giờ sai tiếp tục “ripple” qua nhiều máy chủ khác, khiến chứng chỉ xác thực trên các hệ thống liên quan cũng vô hiệu.
Đây là lý do chỉ một sự cố ở một điểm trung tâm vẫn có thể tạo ra ảnh hưởng rất rộng. Với người dùng bình thường, điều họ nhìn thấy chỉ là cuộc gọi không kết nối được, mạng chập chờn hoặc máy thanh toán thẻ không hoạt động. Nhưng ở tầng kỹ thuật, đó là chuỗi phản ứng phức tạp giữa đồng bộ thời gian, xác thực và vận hành mạng.
Mức độ ảnh hưởng của sự cố Telstra
Telstra xác nhận có 604 người không thể liên lạc với Triple-0 trong thời gian sự cố xảy ra. Đây là con số đủ để cho thấy mức độ nghiêm trọng của vụ việc, vì Triple-0 là đầu số khẩn cấp quốc gia, nơi từng phút chậm trễ đều có thể tạo ra hệ quả đáng tiếc.
Không chỉ dừng ở lĩnh vực khẩn cấp, sự cố còn làm ảnh hưởng đến hoạt động của đường sắt và khiến nhiều doanh nghiệp nhỏ không thể xử lý thanh toán qua EFTPOS. Với các cửa hàng phụ thuộc vào kết nối di động, chỉ một khoảng ngắt dịch vụ ngắn cũng đủ khiến việc mua bán bị đảo lộn.
Telstra cho biết họ đã thực hiện 604 cuộc kiểm tra an sinh đối với những người không thể gọi Triple-0 trong giai đoạn đó và chưa ghi nhận kết quả đe dọa tính mạng. Hãng cũng nói rằng khoảng 99% cuộc gọi Triple-0 vẫn được kết nối thành công. Tuy nhiên, con số 1% còn lại vẫn là vấn đề rất lớn khi liên quan đến dịch vụ cứu hộ và khẩn cấp.
Lời xin lỗi từ lãnh đạo Telstra
Tại phiên điều trần ở Canberra, CEO Vicki Brady đã thừa nhận Telstra “đã làm người dân Úc thất vọng” và nói rằng bà rất lấy làm tiếc về sự cố này. Đây là một lời nhận lỗi thẳng thắn, cho thấy bản thân Telstra cũng hiểu mức độ nhạy cảm của sự việc đối với cộng đồng.
Brady cho biết công ty muốn làm rõ ba điều: chuyện gì đã xảy ra, họ đã phản ứng ra sao, và đang làm gì để giảm rủi ro tái diễn. Bà nhấn mạnh rằng còn nhiều điều cần tiếp tục học hỏi từ vụ việc này, vì sự cố không chỉ là bài học kỹ thuật mà còn là bài học về quản trị, quy trình và trách nhiệm với hạ tầng thiết yếu.
CFO Michael Ackland cũng phải trả lời trước Thượng viện về tình trạng các nút mạng điều phối thời gian trong hạ tầng di động. Theo các thông tin được công bố, Telstra không cho rằng đây là một vụ tấn công mạng, mà là một lỗi kỹ thuật phát sinh trong quá trình bảo trì và vận hành.
Telstra sẽ làm gì để tránh lặp lại?
Điều quan trọng nhất sau một sự cố như thế này là hệ thống phải được rà soát toàn diện. Telstra cho biết họ đang tiếp tục điều tra, đồng thời lên kế hoạch ngăn ngừa các lỗi tương tự trong tương lai. Những việc cần làm không chỉ là sửa một thiết bị, mà còn phải xem lại toàn bộ quy trình bảo trì, tài liệu thiết kế và cơ chế kiểm soát thay đổi.
- Rà soát lại các máy chủ đồng bộ thời gian và thiết bị GPS.
- Kiểm tra các bản cập nhật phần mềm còn thiếu.
- Chuẩn hóa lại tài liệu thay đổi kỹ thuật để đội bảo trì nắm rõ.
- Tăng cường cơ chế dự phòng để một node lỗi không kéo cả mạng bị ảnh hưởng.
- Đánh giá lại quy trình phục vụ các cuộc gọi Triple-0.
Nhìn từ góc độ vận hành, đây là bài học rõ ràng về việc một hệ thống lớn không chỉ cần phần cứng tốt, mà còn cần quy trình quản lý thay đổi đủ chặt, tài liệu đầy đủ và thử nghiệm trước khi đưa vào thực tế. Chỉ một chi tiết bị bỏ sót cũng có thể gây ra hậu quả rất lớn.
Với người dùng, sự cố này nhắc lại một thực tế quen thuộc nhưng thường bị xem nhẹ: hạ tầng số mà chúng ta dùng mỗi ngày, từ gọi điện, đi tàu đến quẹt thẻ, đều phụ thuộc vào hàng loạt lớp kỹ thuật phía sau. Khi một lớp gặp trục trặc, tác động có thể lan nhanh hơn nhiều so với những gì mắt thường nhìn thấy.
Nếu bạn muốn tiếp tục theo dõi các diễn biến mới nhất về những vấn đề ảnh hưởng trực tiếp đến cộng đồng người Việt tại Úc, hãy theo dõi Báo Online - Người Việt tại Úc để cập nhật nhanh hơn các tin tức quan trọng.
Vụ việc Telstra lần này cho thấy một nguyên tắc rất rõ: trong hạ tầng viễn thông, độ chính xác và tính kỷ luật trong bảo trì quan trọng không kém bất kỳ yếu tố nào khác. Khi mọi thứ phụ thuộc vào một hệ thống đồng bộ, chỉ một lỗi phần mềm cũng đủ làm cả mạng chao đảo.
Bài viết có thể bạn quan tâm
- Melbourne sắp có một tuần không mưa hiếm hoi giữa mùa đông
- Dự án 840 căn hộ tại Five Dock được đẩy nhanh tiến độ cấp phép
- Các nhà lãnh đạo gốc Mỹ thống trị danh sách thu nhập khủng tại Australia năm 2025
- NSW phê duyệt dự án năng lượng sạch 1,8 tỷ AUD trên mỏ than cũ
- Sydney Metro Southwest lần đầu chạy xuyên suốt Bankstown - Tallawong
- Thị trường đấu giá bất động sản chạm đáy thấp nhất kể từ năm 2020.
- Thu hồi nước suối Mt Ossa 10L bán tại Woolworths do nghi nhiễm nấm mốc.
- Chuyến bay chở hàng Qantas làm nên lịch sử tại sân bay mới WSI
- Nhiều viện dưỡng lão tại Úc bị điều tra vì nghi ngờ thu các khoản phí bất hợp pháp.
- Gần 168.000 AUD tiền hưu trí “bốc hơi” chỉ sau một đêm
