Data Platform trong tương lai sẽ thay đổi như nào?

 


Data Platform trong tương lai sẽ thay đổi như nào?

Nếu nhìn lại quá trình phát triển của hệ thống dữ liệu, mình thấy có một xu hướng khá rõ:
Phạm vi của Data Platform ngày càng mở rộng.

1. Từ Data Warehouse đến Lakehouse

Ở giai đoạn đầu, bài toán dữ liệu của doanh nghiệp tương đối đơn giản.
Các hệ thống nghiệp vụ tạo ra dữ liệu, sau đó dữ liệu được ETL vào Data Warehouse để phục vụ reporting và BI.
Khi dữ liệu tăng lên cả về volume lẫn variety, đặc biệt với log, event, semi-structured data và streaming, Data Lake xuất hiện như một cách tiếp cận linh hoạt hơn.
Rồi Lakehouse xuất hiện, đưa thêm transaction, schema evolution, table management, governance... vào trên nền Data Lake.
Mỗi bước đều giải quyết một giới hạn của bước trước.
Nhưng đồng thời, data ecosystem cũng ngày càng phức tạp.

2. Khi Data Stack bắt đầu trở nên quá phức tạp

Một platform thực tế có thể bao gồm:
Object Storage + Spark + Kafka + Airflow + Trino + Iceberg + Catalog + BI + ML …
Mỗi technology giải quyết một vấn đề rất cụ thể và làm tốt nhiệm vụ của nó.
Nhưng khi số lượng thành phần tăng lên, một vấn đề khác bắt đầu xuất hiện:
Complexity của data infrastructure ngày càng được đẩy về phía người sử dụng.
Một Data Engineer muốn đưa một pipeline lên production có thể phải quan tâm đến storage, compute, networking, IAM, orchestration, deployment, monitoring...
Lúc này, việc “có đủ tool” không còn đồng nghĩa với việc “có một Data Platform tốt”.

3. Cloud đang thay đổi vai trò của Data Platform

Đây là nơi Cloud đang thúc đẩy sự thay đổi khá mạnh.
Ngày trước, để xây một platform, rất nhiều effort nằm ở việc tự vận hành infrastructure: server, storage, cluster, networking...
Cloud dần biến nhiều thứ trong số đó thành những building block có sẵn:
Compute, Object Storage, Kubernetes, IAM, Networking, Database, Monitoring, Security...
Điều này không có nghĩa architecture trở nên đơn giản hơn.
Nó chỉ làm thay đổi nơi complexity được đặt.
Thay vì dành phần lớn effort để vận hành infrastructure, Platform team có thể tập trung nhiều hơn vào:
Automation · Governance · Security · Self-service · Developer Experience

4. Từ Data Stack đến Data Platform

Đây là điểm mình nghĩ sẽ quyết định Data Platform trong tương lai.
Khi data ecosystem tiếp tục lớn lên, chúng ta khó có thể tiếp tục giải quyết complexity bằng cách thêm người hoặc thêm tool.
Cách hợp lý hơn là đóng gói complexity đó thành platform.
Data Engineer không nhất thiết phải quan tâm bên dưới đang chạy Spark trên Kubernetes hay một managed compute service nào.
Họ quan tâm:
Tôi có thể tạo workload như thế nào?
Tôi deploy nó ra sao?
Tôi truy cập dataset thế nào?
Tôi biết pipeline đang chạy tốt hay không bằng cách nào?
Phần còn lại nên được platform xử lý càng nhiều càng tốt.

5. Data Platform sẽ thay đổi như thế nào?

Vì vậy, mình nghĩ xu hướng của Modern Data Platform sẽ không đơn giản là:
“Technology nào sẽ thay thế Spark, Kafka hay Iceberg?”
Mà sẽ chuyển dần thành:
“Làm thế nào để biến một ecosystem ngày càng phức tạp thành một platform đơn giản, self-service và có governance cho người sử dụng?”
Đây cũng là lý do mình nghĩ Data Platform sẽ ngày càng gần với tư duy của Platform Engineering.
Không phải vì các technology bên dưới biến mất.
Ngược lại, chúng có thể còn nhiều hơn.
Nhưng complexity sẽ ngày càng được đẩy xuống dưới platform abstraction layer.
Và có lẽ đó là một xu hướng khá tất yếu:
Data càng nhiều → workload càng đa dạng → infrastructure càng phức tạp → càng cần abstraction → Data Platform càng trở nên toàn diện.
Cuối cùng, có thể chúng ta sẽ không còn nhìn Data Platform đơn thuần như một “data stack” nữa.
Mà như một operating layer cho toàn bộ data ecosystem.
Mọi người đang nhìn xu hướng này như thế nào?
Data Platform tương lai sẽ là một Lakehouse mở rộng, một Internal Developer Platform cho Data, hay sẽ trở thành một lớp abstraction hoàn toàn mới phía trên Cloud/Infrastructure?


Post a Comment

Mới hơn Cũ hơn