Chủ đề bài viết
Kiến thức
Tổng hợp các bài viết kỹ thuật, chuyên môn công nghệ của cộng đồng, kỹ sư, chuyên gia, và doanh nghiệp
Fact: Google Cloud xử lý sự cố mất traffic 70 phút do lỗi route propagation
Ngày 25/04/2024, Google Cloud ghi nhận một sự cố ảnh hưởng đến nhiều dịch vụ trọng yếu, bao gồm Compute Engine, Cloud SQL, Cloud Run, MemoryStore, Cloud Functions và một […]
DevOps không phải là người deploy code, mà là người biết khi nào không nên deploy
Cuối tuần ngồi chill một tuần hệ thống chạy ổn định. Trong đầu mang nhiều suy nghĩ xin phép chia sẻ một chút kinh nghiệm cá nhân, tám chuyện là […]
Lựa chọn giải pháp Artifact Storage cho doanh nghiệp
Anh em làm DevOps hay System Administrator đã từng đối mặt với bài toán Lưu trữ các Artifact sao cho nhanh, ổn định, tiết kiệm chi phí và dễ dàng […]
Cài đặt Node.js v24.11.1 trên linux
Trong môi trường Production và CI/CD, việc cài đặt Node.js yêu cầu sự chính xác tuyệt đối về phiên bản và Supply Chain Security. Phiên bản v24.11.1 (LTS) hiện là […]
Cách xử lý sự cố production database bị lock mà không cần restart service
DevOps rất rõ ràng là Dev + Ops tức là triển khai và quản trị. Với cá nhân tôi thấy thì quản trị khó hơn triển khai kha khá đấy, […]
Fact: Cloudflare phục hồi mạng toàn cầu sau sự cố nội bộ ngày 18/11/2025
Ngày 18/11/2025, hệ thống của Cloudflare nhà cung cấp hạ tầng CDN và bảo mật lớn nhất thế giới gặp sự cố nội bộ khiến nhiều dịch vụ bị gián […]
Cài đặt Gradle 9.x trên linux
Nếu như các phiên bản 8.x tập trung vào việc hoàn thiện Kotlin DSL, thì dòng Gradle 9.x ra mắt chính thức vào năm 2025 đánh dấu một bước chuyển […]
Dockerfile Contest 2025: Đây là Docker Image nhẹ nhất?
Đây là một bài viết rất dài và chi tiết cách tôi viết Dockerfile build thành Docker Image chỉ 143KB, tôi sẽ giải thích cặn kẽ nên bác nào chịu […]
filesystem corrupt sau một lần node preempt và cái giá của việc coi persistent storage như stateless
Đến hẹn lại lên có chuyên là kể, nói thế chứ giờ mới được duyệt CV để viết bài :)) Bình thường bên tôi hay deploy đêm, giờ đó ít […]
Fact: AWS phục hồi Route 53 chỉ sau 8 phút khi bảng định tuyến toàn cầu gặp lỗi (2024)
Ngày 9/4/2024, nhiều tổ chức ghi nhận hiện tượng DNS resolution chậm hoặc thất bại khi truy cập dịch vụ chạy trên AWS. Nguyên nhân đến từ vùng us-east-1, nơi […]
Hạn chế Downtime khi migration PostgreSQL với Logical Replication
Bài toán phải upgrade hạ tầng thì chắc không lạ nữa, tôi cũng thích đọc tech blog dạo trước cũng có nhiều thắc mắc là mấy doanh nghiệp hàng đầu, […]
Fact: LinkedIn xử lý 52 tỷ event/ngày nhờ hệ thống Kafka “chữa bệnh cho chính mình”
Ngày 23/7/2023, LinkedIn công bố đã đạt cột mốc 52 tỷ event/ngày trên nền tảng dữ liệu thời gian thực của họ, vận hành chủ yếu dựa trên Apache Kafka. […]
DevGreenOps: Tư duy vận hành hiệu quả tài nguyên trong kỷ nguyên Cloud và Automation
Trong suốt hơn một thập kỷ qua, DevOps đã giúp các tổ chức công nghệ rút ngắn chu kỳ phát hành và tự động hóa hạ tầng qua việc tích […]
CI Runner autoscaling tối ưu chi phí trên Kubernetes
Mọi người chạy CI/CD trên kubernetes mà trên hạ tầng cloud đã biết chi phí scale cũng rất đáng để nói. Như bên mình có lúc cao điểm pipeline treo […]
Fact: Spotify sống sót sau sự cố Cassandra mất 60% node mà không downtime (2023)
Ngày 14/3/2023, đội vận hành Spotify phát hiện cụm Cassandra cluster chính phục vụ metadata người dùng bị mất kết nối hàng loạt. Chỉ trong vài phút, 60% số node […]
Tham gia DevOps VietNam Newsletter
Cập nhật kiến thức thực tế, sự kiện từ các chuyên gia, việc làm chất lượng, và các đặc quyền dành cho cộng đồng.