Chủ đề bài viết

Case Study

Tổng hợp các bài viết về Case Study

Kiến thức 14/11/2025 · 5 phút đọc

filesystem corrupt sau một lần node preempt và cái giá của việc coi persistent storage như stateless

Đến hẹn lại lên có chuyên là kể, nói thế chứ giờ mới được duyệt CV để viết bài :)) Bình thường bên tôi hay deploy đêm, giờ đó ít […]

Kiến thức 12/11/2025 · 3 phút đọc

Fact: AWS phục hồi Route 53 chỉ sau 8 phút khi bảng định tuyến toàn cầu gặp lỗi (2024)

Ngày 9/4/2024, nhiều tổ chức ghi nhận hiện tượng DNS resolution chậm hoặc thất bại khi truy cập dịch vụ chạy trên AWS. Nguyên nhân đến từ vùng us-east-1, nơi […]

Kiến thức 10/11/2025 · 8 phút đọc

Hạn chế Downtime khi migration PostgreSQL với Logical Replication

Bài toán phải upgrade hạ tầng thì chắc không lạ nữa, tôi cũng thích đọc tech blog dạo trước cũng có nhiều thắc mắc là mấy doanh nghiệp hàng đầu, […]

Kiến thức 09/11/2025 · 3 phút đọc

Fact: LinkedIn xử lý 52 tỷ event/ngày nhờ hệ thống Kafka “chữa bệnh cho chính mình”

Ngày 23/7/2023, LinkedIn công bố đã đạt cột mốc 52 tỷ event/ngày trên nền tảng dữ liệu thời gian thực của họ, vận hành chủ yếu dựa trên Apache Kafka. […]

Kiến thức 06/11/2025 · 4 phút đọc

Fact: Spotify sống sót sau sự cố Cassandra mất 60% node mà không downtime (2023)

Ngày 14/3/2023, đội vận hành Spotify phát hiện cụm Cassandra cluster chính phục vụ metadata người dùng bị mất kết nối hàng loạt. Chỉ trong vài phút, 60% số node […]

Kiến thức 02/11/2025 · 5 phút đọc

Consistency issue trong distributed cache: đọc nhanh hơn thật, nhưng đọc sai luôn

Cuối tuần ngồi cafe thời tiết Hà Nội thật đẹp, đem laptop ra viết chia sẻ kinh nghiệm một lần đáng nhớ của tôi đến từ cái suy nghĩ “muốn […]

Kiến thức 25/10/2025 · 3 phút đọc

Fact: 70% lỗi Production của Meta đến từ config, không phải code

Ngày 12/5/2024, Meta công bố trong báo cáo Engineering Resilience Review rằng hơn 70% sự cố Production trong năm 2023 bắt nguồn không phải từ lỗi lập trình, mà từ […]

Kiến thức 22/10/2025 · 12 phút đọc

Các cấu hình sai lầm trên Kubernetes mà tôi biết

Quản lý Kubernetes trong môi trường production là một bài toán phức tạp chắc mọi người trải nghiệm đã đều hiểu rồi. Khi một cluster sập nguyên nhân thường không […]

Kiến thức 21/10/2025 · 6 phút đọc

Fact: Toàn cảnh AWS khôi phục hệ thống sau sự cố DNS DynamoDB trong 15 giờ

Ngày 20/10/2025, nhiều tổ chức công nghệ toàn cầu ghi nhận lỗi API, độ trễ tăng cao và dịch vụ ngừng phản hồi do sự cố tại vùng US-EAST-1 của […]

Kiến thức 10/10/2025 · 3 phút đọc

Fact: OpenAI giữ GPT-4 online 99,99% nhờ autoscaler phân tán toàn cầu

Tháng 5/2024, OpenAI ghi nhận mức tải truy cập cao nhất lịch sử: hơn 1,2 triệu request/s, gấp 3 lần thời điểm ra mắt GPT-4. Điều đáng kinh ngạc là […]

Kiến thức 19/08/2025 · 12 phút đọc

Atlassian: Thách thức di chuyển và tái cấu trúc 4 triệu database

Làm thế nào để migrate một hệ thống cơ sở dữ liệu khổng lồ mà không gây gián đoạn cho người dùng? Đây là câu hỏi mà đội ngũ kỹ […]

12

Tham gia DevOps VietNam Newsletter

Cập nhật kiến thức thực tế, sự kiện từ các chuyên gia, việc làm chất lượng, và các đặc quyền dành cho cộng đồng.