Data Lake

Data Lake là kho lưu trữ dữ liệu quy mô lớn, có thể chứa dữ liệu thô ở nhiều định dạng khác nhau để phục vụ phân tích, Machine Learning, BI và các hệ thống AI.
Bạn đang xem các bài viết có tag "data lake".
Big Data là gì và khai thác Big Data như thế nào để ứng dụng trong cuộc sống
Bài viết cập nhật lại kiến thức Big Data mà Nha từng chia sẻ từ năm 2016. Big Data không đơn giản là dữ liệu thật nhiều và cũng không có một ngưỡng TB hay PB cố định. Bài giải thích 5V của Big Data, sự khác nhau giữa Big Data với Data Warehouse, Data Lake và Lakehouse, tác động của cloud và AI, đồng thời nhìn lại bài học Google Flu Trends để thấy rằng nhiều dữ liệu không đồng nghĩa với dữ liệu tốt.

Data Lake là một hệ thống lưu trữ dữ liệu quy mô lớn, cho phép doanh nghiệp lưu giữ dữ liệu ở trạng thái thô hoặc gần với dữ liệu gốc trước khi xử lý sâu hơn.

Khác với Data Warehouse thường yêu cầu dữ liệu được chuẩn hóa và tổ chức theo cấu trúc rõ ràng trước khi đưa vào sử dụng, Data Lake có thể chứa nhiều loại dữ liệu như dữ liệu có cấu trúc, bán cấu trúc và phi cấu trúc, bao gồm bảng dữ liệu, log, file JSON, hình ảnh, âm thanh hoặc dữ liệu từ thiết bị IoT.

Data Lake thường được sử dụng khi doanh nghiệp cần lưu trữ lượng dữ liệu lớn với chi phí hợp lý, đồng thời muốn giữ lại dữ liệu gốc để phục vụ các nhu cầu phân tích, Machine Learning, Data Science hoặc AI trong tương lai.

Tuy nhiên, Data Lake không tự động tạo ra giá trị chỉ vì lưu được nhiều dữ liệu. Nếu thiếu quản trị, metadata, kiểm soát chất lượng và phân quyền, hệ thống có thể trở thành một data swamp - nơi dữ liệu tồn tại nhưng khó tìm, khó hiểu và khó sử dụng.

Tag Data Lake tổng hợp các bài viết, kiến thức và kinh nghiệm về kiến trúc Data Lake, lưu trữ dữ liệu lớn, data governance, metadata, data pipeline, Data Engineering và cách xây dựng nền tảng dữ liệu phục vụ BI, phân tích và AI.