23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
Data Scientist, Data Engineer, Data Platform 운영자들을 위한 Smart한 접근 방법 2가지를 소개합니다.
On Demand Data Mesh
분산 Federated Query Engine(Trino Cluster)를 kubernetes 상에서 사용자의 요구에 맞게 쉽게 배포, 구성 및 관리할 수 있습니다. 가장 큰 특징으론 Blue-Green(무중단) 배포를 지원합니다. Cluster Spec이 변경되거나 Catalog 추가 시 Blue-Green Upgrade를 지원하여, 사용자로 하여금 중단 없는 분산 쿼리 환경을 지원합니다. 또한 고급 사용자에 대한 니즈를 파악하여 제품 내에서 Container Resource 및 JVM 등을 설정할 수 있고, Trino Properties 설정을 제공합니다.
Active Meta
그동안 수많은 데이터 더미 위에서 데이터를 이용하기 위해서는 Catalog 서비스에 의존할 수 밖에 없었습니다. 원하는 데이터가 어디에 있는지를 알아내고자 Meta 정보를 검색할 수 있는 솔루션을 도입하거나, Meta 정보를 현실과 비슷하게 유지하기 위한 정책과 가이드를 만들어냈습니다.
하지만 Data Owner 들은 오로지 자신들의 Data Pipeline이 잘 유지되기를 원할 뿐, Meta 정보를 최신으로 유지하는데에는 큰 관심이 없습니다. 처음에는 잘 유지되던 Meta 정보들은 어느 순간 실제 모습과는 다른 것이 되어 있고, 어떤 데이터는 더 이상 이용되지 않는 Junk 데이터가 되기도 합니다. 그 결과 도대체 어디에서 온 것인지를 파악할 수 없는 데이터들을 지켜볼 수 밖에 없게 됩니다.
전통적인 Catalog 서비스들이 Data Owner의 참여와 활동이나 부하를 일으키는 Query 수행에 의존해 Meta 정보들의 Freshness를 확보했다면, SK텔레콤은 Active한 Data Pipeline을 모니터링하고, Column Level Lineage를 포함한 Meta 정보를 자동으로 생성하고자 합니다. Fresh한 Meta 정보들은 Data Platform에 대한 Observability를 제공하기 위한 Base가 되며, 전체 Data Pipeline의 Issue를 미리 파악하거나 RCA(Root Cause Analysis)를 위한 정보로 활용될 수도 있습니다.
■ 발표자 소개
장한을 (SK텔레콤)
첫 직장 생활을 C++ 프로그래머로 시작하여 Data Engineer로 커리어를 발전시켜오면서 Data ETL, Data 기반의 인사이트 분석, Data Platform 구축에 이르는 Data 전반적인 영역에서 전문 역량을 쌓아왔습니다. 이런 경험을 바탕으로 현재는 SK텔레콤 AI Data Platform 조직에서 뛰어난 팀원들 사이에서 초보 Product Owner 역할을 맡고 있으며, Product의 점진적인 발전에 기여하고자 노력하고 있습니다.
김형은 (SK텔레콤)
어느덧 20년째 개발자로 살아가고 있습니다.
선배들에 등떠밀려 스타트업에 몸담아 다양한 개발 스킬을 배울 수 있었습니다. 훌륭한 개발자들에게 둘러쌓여 전국민이 이용했던 네이트온을 개발하면서 숨가쁜 시간도 보내봤습니다. 힘든 기억이지만, 운이 좋게도 창업에서 Exit 까지의 과정도 겪어봤습니다.
현재는 SK텔레콤 AIX 조직에서 Industrial Data Platform을 위한 기반 기술 연구 및 상품화 과제를 수행하고 있습니다. 개발자들이 필요로 하는 솔루션이나 플랫폼을 만들면서, 그 동안의 경험을 잘 살려보고자 노력하고 있습니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.