Chủ đề bài viết
Case Study
Tổng hợp các bài viết về Case Study
filesystem corrupt sau một lần node preempt và cái giá của việc coi persistent storage như stateless
Đến hẹn lại lên có chuyên là kể, nói thế chứ giờ mới được duyệt CV để viết bài :)) Bình thường bên tôi hay deploy đêm, giờ đó ít […]
Fact: AWS phục hồi Route 53 chỉ sau 8 phút khi bảng định tuyến toàn cầu gặp lỗi (2024)
Ngày 9/4/2024, nhiều tổ chức ghi nhận hiện tượng DNS resolution chậm hoặc thất bại khi truy cập dịch vụ chạy trên AWS. Nguyên nhân đến từ vùng us-east-1, nơi […]
Hạn chế Downtime khi migration PostgreSQL với Logical Replication
Bài toán phải upgrade hạ tầng thì chắc không lạ nữa, tôi cũng thích đọc tech blog dạo trước cũng có nhiều thắc mắc là mấy doanh nghiệp hàng đầu, […]
Fact: LinkedIn xử lý 52 tỷ event/ngày nhờ hệ thống Kafka “chữa bệnh cho chính mình”
Ngày 23/7/2023, LinkedIn công bố đã đạt cột mốc 52 tỷ event/ngày trên nền tảng dữ liệu thời gian thực của họ, vận hành chủ yếu dựa trên Apache Kafka. […]
Fact: Spotify sống sót sau sự cố Cassandra mất 60% node mà không downtime (2023)
Ngày 14/3/2023, đội vận hành Spotify phát hiện cụm Cassandra cluster chính phục vụ metadata người dùng bị mất kết nối hàng loạt. Chỉ trong vài phút, 60% số node […]
Consistency issue trong distributed cache: đọc nhanh hơn thật, nhưng đọc sai luôn
Cuối tuần ngồi cafe thời tiết Hà Nội thật đẹp, đem laptop ra viết chia sẻ kinh nghiệm một lần đáng nhớ của tôi đến từ cái suy nghĩ “muốn […]
Fact: 70% lỗi Production của Meta đến từ config, không phải code
Ngày 12/5/2024, Meta công bố trong báo cáo Engineering Resilience Review rằng hơn 70% sự cố Production trong năm 2023 bắt nguồn không phải từ lỗi lập trình, mà từ […]
Các cấu hình sai lầm trên Kubernetes mà tôi biết
Quản lý Kubernetes trong môi trường production là một bài toán phức tạp chắc mọi người trải nghiệm đã đều hiểu rồi. Khi một cluster sập nguyên nhân thường không […]
Fact: Toàn cảnh AWS khôi phục hệ thống sau sự cố DNS DynamoDB trong 15 giờ
Ngày 20/10/2025, nhiều tổ chức công nghệ toàn cầu ghi nhận lỗi API, độ trễ tăng cao và dịch vụ ngừng phản hồi do sự cố tại vùng US-EAST-1 của […]
Fact: OpenAI giữ GPT-4 online 99,99% nhờ autoscaler phân tán toàn cầu
Tháng 5/2024, OpenAI ghi nhận mức tải truy cập cao nhất lịch sử: hơn 1,2 triệu request/s, gấp 3 lần thời điểm ra mắt GPT-4. Điều đáng kinh ngạc là […]
Atlassian: Thách thức di chuyển và tái cấu trúc 4 triệu database
Làm thế nào để migrate một hệ thống cơ sở dữ liệu khổng lồ mà không gây gián đoạn cho người dùng? Đây là câu hỏi mà đội ngũ kỹ […]
Tham gia DevOps VietNam Newsletter
Cập nhật kiến thức thực tế, sự kiện từ các chuyên gia, việc làm chất lượng, và các đặc quyền dành cho cộng đồng.