23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
Python으로 데이터 분석 및 개발을 하는 사람들에게 Dask를 소개하고자 합니다.
대규모 데이터 처리 업무를 하시는 분들이라면 Spark을 기본적으로 사용하고 계실 텐데요,
Dask는 Spark( 정확히는 PySpark) 과 비슷한 형태와 서비스를 가지고 있습니다.
Python에 친숙한 분들, PySpark을 사용해 보신 분들이 쉽게 이해되고 사용하는데 어려움이 없으실 것 같습니다.
Dask is a flexible library for parallel computing in Python.
대규모 데이터 처리를 위해서 분산컴퓨팅으로 사용할 수 있는 라이브러리를 제공한다.
Pandas, Numpy 데이터 처리가 병렬처리 환경에서 동작하는 것을 지원한다.
Delayed 함수를 제공해서 병렬처리를 지원한다.
최적화된 Dynamic task scheduling을 지원한다.
정리하자면, python이 분산 환경에서 동작 할 수 있게 지원한다 가 될 것 같습니다.
Numpy 로 구현되어 있어 numpy api를 그대로 사용할 수 있습니다.
Pandas의 DataFrame과 같은 구조이고 병렬처리를 지원합니다. import만 변경하면 pandas api를 그대로 사용하실 수 있습니다.
Python 객체에 map, filter, fold, groupby 와 같은 operation을 제공합니다.
멀티 프로세싱 환경에서 graph를 통해 순서를 정의할 수 있고 그 연산을 효율적으로 할 수 있습니다.
Dask를 단일 머신에서도 효율적으로 동작하고 다중 머신으로 묶여 있는 클러스터 환경으로 확장할 수 있습니다.
단일 머신에서 Default scheduler, dask.distributed 시스템을 이용 할 수 있습니다.
분산 컴퓨팅 환경에서는
PBS, SLURM,LSF, SGE 같은 리소스 매니저를 통해 클러스터 구축이 가능합니다.
쿠버네티스 환경 위에서도 클러스터 구축이 가능합니다.
spark 사용자에게 친숙한 yarn 클러스터에서도 구축이 가능합니다.
AWS, GCP, AZURE 와 같은 클라우드 환경에서도 클러스터 구축이 가능합니다.
ChatGPT로 더 많은 사람들이 AI 기술에 관심을 가지고 Python 언어로 코딩을 시작하실 것 같습니다.
더 많은 데이터를 처리할 때 사용 가능한 라이브러리로 Dask를 알고 계시면 규모 있는 데이터 및 서비스를 개발하고 운영하기에 용이할 것 같습니다.
아직은 PySpark보다 커뮤니티가 부족해서 한국어 정보는 많이 찾아볼 순 없지만, Dask를 한번 도입해 보고 프로젝트의 데이터 규모와 성격에 따라 비교 테스트를 해보시는 것은 어떨까요?
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.