데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      OpenLab 2기 - Cloud 에서 AI 활용하기 세번째 모임: 시각화와 모델링 with AWS

      stats 24.10.09
      126 2 0
      DEVOTEE 요약
      데보션 오픈랩 2기에서 클라우드에서 AI 활용을 학습하는 프로그램에 참여하여 데이터 시각화와 이해를 중심으로 AWS QuickSight 사용법을 익히고, 머신러닝 모델에 관한 심화 학습을 진행했습니다. 데이터 시각화의 4가지 주요 유형과 Amazon QuickSight의 다양한 기능을 배웠으며, Amazon EMR과 SageMaker를 활용한 데이터 모델링과 내장 알고리즘도 탐구했습니다. 참여자들이 쌍방향으로 즐겁게 학습하며 클라우드에서 AI 활용을 증진할 수 있는 유익한 시간이었다고 합니다.
      DEVOTEE 추천 블로그

      안녕하세요, 데보션 오픈랩 2기의 Cloud에서 AI 활용하기 (AWS Certi MLS 취득) 에 참여하는 강호현 입니다.


      1부에서는 제가 Cloud에서 AI를 활용한다면 빠질 수 없는 데이터 시각화와 이해,

      그리고 AWS QuickSIght에 대해 발표 하고 구성원간 질의 응답과 해당 내용에 대한 각자의 경험을 나누는 시간을 가졌습니다.

      2부에는 더욱 재밌고 고급스러운 머신러닝 모델에 대해 깊이 있게 학습해 볼 수 있었습니다.


      데보션 영으로도 활동 중이신 박병영님의 발표가 더해져서 신선하고 재미있게 배울 수 있었습니다.

      간단히 후기를 남겨보고자 합니다.


      1부: 데이터 이해 그리고 시각화 with Amazon QuickSight

      데이터를 이해하고 그에 맞게 시각화하는 방법에 대해 배웠습니다. 데이터 시각화의 목적에 따라 약 4가지 유형으로 나눌 수 있습니다.

      변수간 관계를 살펴보거나, 두개 이상의 변수를 비교하고, 데이터의 분포를 볼 수 있습니다.

      마지막으로 하나의 변수를 이루는 구성 요소를 나누어 살펴보는 방법을 생각할 수 있습니다.

      1. 관계(Relationship)

      두 변수의 관계를 살펴본다면, 산점도(scatter plot)와 버블 차트(bubble chart)가 적합합니다.

      산점도는 두 변수의 관계를 정적이거나 부적, 혹은 관계 없음을 한눈에 살펴보기 좋은 시각화 방법입니다.

      주로, 상관관계를 시각적으로 먼저 살펴볼 때 유용하게 쓰입니다. 한 변수가 증가할 때, 다른 변수가 감소하는지, 함께 증가하는지, 그대로인지 등 경향성을 살펴볼 수 있습니다.

      버블 차트는, 그 산점도에 하나의 축인 버블의 크기를 더한 것입니다. 상관관계 외에도 한가지 더 설명하고 싶을 때 유용할 것입니다.

      2. 비교(Comparisons)

      두 개 이상의 변수가 있다면, 비교를 하고 싶습니다. 변수를 비교할 때는, 막대 그래프(Bar chart), 스택 컬럼 차트(stacked column charts), 컬럼 차트, 선 그래프(line charts) 등이 있습니다.

      막대 그래프는, 한 변수에 다양한 클래스가 있다면 한눈에 비교하기 좋습니다.

      한국에 여러 지역구에서 코로나 양성 환자 수를 비교한다면, 막대 그래프로 지역별로 코로나 양성 환자의 수를 막대 하나씩 놓고 비교할 수 있겠습니다.

      스택 컬럼 차트는, 여기에 하나의 조건을 추가한 것입니다. 가령 타이타닉 호에서 생존자와 사망자 수를 비교하는데, 여기서 성별을 나누어 비교해볼 수 있습니다.

      사망자 수가 생존자 수보다 많은데, 그 중에서 생존자 중에서는 여성이 많고, 사망자 중에서는 남성이 많은 것을 그래프로 한눈에 확인할 수 있습니다.

      컬럼 차트와 선 그래프는, 변수의 시간에 따른 변화량을 함께 볼 수 있습니다.

      즉, 하나의 시점을 본다면 막대 그래프, 스택 컬럼 차트를 사용하고, 시간의 변화량을 보려면 컬럼 차트, 선 그래프를 생각할 수 있습니다.

      3. 분포(Distributions)

      데이터의 분포를 한눈에 확인하려면, 히스토그램이 가장 적합합니다. 전반적인 분포를 보기 좋고, 별도 어려운 프로그래밍이 필요하지 않습니다.

      각 구간에 맞는 빈도 수를 그래프로 표현하고 있어 아주 유용합니다. 다만, 특정한 경우에는 굉장히 치우친(skew) 경우가 있습니다.

      이런 경우에는 구간을 더 나누거나 조정해주는 게 필요하겠습니다.

      다른 방법으로는 상자 그래프 혹은 Box plots가 있습니다.

      단순한 빈도수로 전반적인 분포를 확인하는 것 외에도 중앙값, 1분위수, 3분위수, 최대값, 최소값, 이상치까지 한눈에 확인할 수 있는 도구입니다.

      통계량을 함께 표현할 때는 상자 그래프를 사용해봅시다.

      4. 구성(Compositions)

      하나의 변수 안에 다양한 요소가 있습니다. 이 요소간 비중을 비교해볼 수도 있고, 그 구성 방식을 다양하게 보여줄 수 있습니다.

      파이 차트(Pie chart), Stacked chart, tree map 등을 활용해보면 좋습니다. 그 외에도 KPIs(핵심 성과 지표)를 활용해서 시각화를 할 수 있다는 점을 배웠습니다.

      그 지표로는 이탈율, 기업 충성도 지표인 NPS, ROI 등이 있다고 합니다.

      이를 적절히 사용하면 훌륭한 시각화가 가능할 것입니다.

      AWS에서는 자랑하는 완전 관리형 시각화 도구인 Amazon QuickSight라는 서비스가 있습니다. 이것을 활용해보는 방법을 배울 수 있었습니다.

      5. Amazon QuickSight

      Centered Image

      AWS Cloud 기반의 분석 서비스 중에 데이터 시각화 및 사후 분석 기능을 제공합니다.

      특히, 다양한 데이터 소스를 지원하고 있는데요. AWS가 제공하는 Redshift Aurora, RDS, Athena 외에도 온프레미스 데이터 솔루션도 데이터 소스로 활용할 수 있다고 합니다.

      특히, S3가 가능하고, 형식은 Excel, CSV, 로그 파일 부터 다른 써드 파티 SaaS 솔루션도 지원한다고 하니 유용해보입니다.

      특히 SPICE(Super-fast, Parallel, In-memory, Calculation Engine)이라는 기능이 있어서, 데이터셋을 이 QuickSight에 최적화된 구조로 만들 수 있다고 합니다.

      이 기능에 대해 좀 더 공부해볼 예정입니다.

      이렇게 사용 방법도 간단하고, 시각화 외에도 간단한 데이터 준비를 도울 수 있는 기능이 있습니다.

      비용이 문제일 뿐이죠. 다른 시각화 도구와 비교해보면 더욱 와닿는 부분입니다.

      즐거운 퀴즈 타임

      배운 내용을 복습하는 퀴즈 시간을 보냈습니다. 많은 분들의 적극적인 참여로 저도, 구성원도 즐겁게 보낼 수 있는 시간이었습니다.

      물론 상품은 없었지만, 다들 빠르고 정확한 답변으로 성장하는 기분을 느껴볼 수 있었네요!

      image.png


      2부: 데이터 모델링 with Amazon EMR and SageMaker

      아마존에는 머신러닝 및 딥러닝과 같은 도구를 활용해서 데이터를 분석할 수 있는 플랫폼이 있습니다.

      아마존 세이지 메이커(SageMaker)라는 도구입니다. 이 도구를 이해하기 위해서 다양한 내장된 알고리즘을 배울 수 있었습니다.

      데보션 영으로 활동하시는 박병영님의 명쾌한 발표가 큰 도움이 되었습니다.


      대략 6개 정도의 내장 알고리즘을 배웠습니다. 일부는 이미 들어보셨을 수도 있겠네요.

      기존에 머신러닝에서 사용하는 모델을 AWS SageMaker에서 사용할 수 있도록 이름만 살짝 바꾼 것도 있습니다.

      1. Linear learner

      2. Factorization machines

      3. XGBoost

      4. KNN

      5. Object2Vec

      6. DeepAR forecasting

      이와 관련해서 지도학습, 비지도학습의 정의와 차이점, 위 함수(알고리즘)의 기능을 사례로 들어 재밌게 비교해볼 수 있었습니다.

      이러한 도구를 활용한다면, Cloud에서 AI를 활용한 데이터 분석이 좀 더 효과적으로 가능할 것이라 생각합니다.

      물론, 관리형 도구인 만큼 어느 정도 비용은 감안해야겠지만요!

      openlab1009.jpeg

      이렇게 클라우드의 매력을 한껏 느껴볼 수 있는 시간이었고, 기존에 AI 분야로 현직에서 활동 중이신 주원님의 추가 설명도 어려운 머신러닝 알고리즘을 이해하는데 큰 도움이 되었습니다.

      다양한 분야에서 알고 있는 전문 지식을 나누면서 함께 성장할 수 있는 OpenLab, 앞으로의 모습이 기대가 됩니다.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      stats 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기