Insights & Knowledge

Kiến thức & Hướng dẫn

Các bài viết phân tích, chia sẻ kinh nghiệm và hướng dẫn thực hành chi tiết về hạ tầng, DevOps, Cloud và hệ thống.

Kiến thức 18/11/2025 · 11 phút đọc

Dockerfile Contest 2025: Đây là Docker Image nhẹ nhất?

Đây là một bài viết rất dài và chi tiết cách tôi viết Dockerfile build thành Docker Image chỉ 143KB, tôi sẽ giải thích cặn kẽ nên bác nào chịu […]

Kiến thức 14/11/2025 · 5 phút đọc

filesystem corrupt sau một lần node preempt và cái giá của việc coi persistent storage như stateless

Đến hẹn lại lên có chuyên là kể, nói thế chứ giờ mới được duyệt CV để viết bài :)) Bình thường bên tôi hay deploy đêm, giờ đó ít […]

Kiến thức 12/11/2025 · 3 phút đọc

Fact: AWS phục hồi Route 53 chỉ sau 8 phút khi bảng định tuyến toàn cầu gặp lỗi (2024)

Ngày 9/4/2024, nhiều tổ chức ghi nhận hiện tượng DNS resolution chậm hoặc thất bại khi truy cập dịch vụ chạy trên AWS. Nguyên nhân đến từ vùng us-east-1, nơi […]

Kiến thức 10/11/2025 · 8 phút đọc

Hạn chế Downtime khi migration PostgreSQL với Logical Replication

Bài toán phải upgrade hạ tầng thì chắc không lạ nữa, tôi cũng thích đọc tech blog dạo trước cũng có nhiều thắc mắc là mấy doanh nghiệp hàng đầu, […]

Kiến thức 09/11/2025 · 3 phút đọc

Fact: LinkedIn xử lý 52 tỷ event/ngày nhờ hệ thống Kafka “chữa bệnh cho chính mình”

Ngày 23/7/2023, LinkedIn công bố đã đạt cột mốc 52 tỷ event/ngày trên nền tảng dữ liệu thời gian thực của họ, vận hành chủ yếu dựa trên Apache Kafka. […]

Kiến thức 07/11/2025 · 9 phút đọc

DevGreenOps: Tư duy vận hành hiệu quả tài nguyên trong kỷ nguyên Cloud và Automation

Trong suốt hơn một thập kỷ qua, DevOps đã giúp các tổ chức công nghệ rút ngắn chu kỳ phát hành và tự động hóa hạ tầng qua việc tích […]

Kiến thức 07/11/2025 · 8 phút đọc

CI Runner autoscaling tối ưu chi phí trên Kubernetes

Mọi người chạy CI/CD trên kubernetes mà trên hạ tầng cloud đã biết chi phí scale cũng rất đáng để nói. Như bên mình có lúc cao điểm pipeline treo […]

Kiến thức 06/11/2025 · 4 phút đọc

Fact: Spotify sống sót sau sự cố Cassandra mất 60% node mà không downtime (2023)

Ngày 14/3/2023, đội vận hành Spotify phát hiện cụm Cassandra cluster chính phục vụ metadata người dùng bị mất kết nối hàng loạt. Chỉ trong vài phút, 60% số node […]

Kiến thức 05/11/2025 · 2 phút đọc

Checklist để nâng Cấp Kubernetes HA đỡ run

Hôm trước tôi nâng cụm Kubernetes nội bộ cho team. Cụm này chỉ chạy 3 control plane, VIP cho kube-apiserver, etcd stacked do kubeadm quản lý. Trước khi làm tôi […]

1131415161766

Tham gia DevOps VietNam Newsletter

Cập nhật kiến thức thực tế, sự kiện từ các chuyên gia, việc làm chất lượng, và các đặc quyền dành cho cộng đồng.