Data Lake là kho lưu trữ dữ liệu quy mô lớn, có thể chứa dữ liệu thô ở nhiều định dạng khác nhau để phục vụ phân tích, Machine Learning, BI và các hệ thống AI.
Bạn đang xem các bài viết có tag "data lake".
Data Lake là một hệ thống lưu trữ dữ liệu quy mô lớn, cho phép doanh nghiệp lưu giữ dữ liệu ở trạng thái thô hoặc gần với dữ liệu gốc trước khi xử lý sâu hơn.
Khác với Data Warehouse thường yêu cầu dữ liệu được chuẩn hóa và tổ chức theo cấu trúc rõ ràng trước khi đưa vào sử dụng, Data Lake có thể chứa nhiều loại dữ liệu như dữ liệu có cấu trúc, bán cấu trúc và phi cấu trúc, bao gồm bảng dữ liệu, log, file JSON, hình ảnh, âm thanh hoặc dữ liệu từ thiết bị IoT.
Data Lake thường được sử dụng khi doanh nghiệp cần lưu trữ lượng dữ liệu lớn với chi phí hợp lý, đồng thời muốn giữ lại dữ liệu gốc để phục vụ các nhu cầu phân tích, Machine Learning, Data Science hoặc AI trong tương lai.
Tuy nhiên, Data Lake không tự động tạo ra giá trị chỉ vì lưu được nhiều dữ liệu. Nếu thiếu quản trị, metadata, kiểm soát chất lượng và phân quyền, hệ thống có thể trở thành một data swamp - nơi dữ liệu tồn tại nhưng khó tìm, khó hiểu và khó sử dụng.
Tag Data Lake tổng hợp các bài viết, kiến thức và kinh nghiệm về kiến trúc Data Lake, lưu trữ dữ liệu lớn, data governance, metadata, data pipeline, Data Engineering và cách xây dựng nền tảng dữ liệu phục vụ BI, phân tích và AI.