23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
모든 수험생 분들 수고하셨습니다.
한국에서 11월은 공휴일이 하나도 없는 달이지만, 11월 둘쨰주 목요일은 특별합니다.
특히 수험생이 있는 대부분의 가정에서 이 수능날이 지니는 무게는 여느 하루 이상일 것입니다.
수험생/가족들만 11월에 초점을 맞추고 있는 건 아닙니다. 많은 기업들이 수능 관련 이벤트/프로모션을 준비하면서
어떻게든 수험생들의 자유와 새로운 시작을 함께하고자 합니다.
SKT도 마찬가지로, 매년 수험생을 위한 프로모션을 준비하고 있습니다.
수험생의 마음을 사로잡는 프로모션을 기획하기 위해서는 그들의 행동 해턴을 파악하는 것이 중요한데, 이를 위한 방법 중 하나는 역시 데이터를 분석하는 것이겠지요.
저는 수능 끝나고 수험표들고 미용실 할인을 받았던 기억이 있습니다
이번 글에서는 수능 이후 수험생분들이 어떤 행동을 보이는 지를 데이터를 통해 확인해보겠습니다.
데이터 분석은 질문에서 시작됩니다. 알고 싶은 것을 명확히 하지 않으면, 사내에 있는 수많은 데이터만 뒤적이다 끝날 가능성이 높습니다. (넵, 제가 많이 그랬습니다 😅😓😭)
알고 싶은 것들은 함께 협업하는 조직(담당자)과 의견을 주고 받으면서 설정합니다
위와 같이 '알고 싶은 것'을 정리하고, 이것을 알기 위한 데이터가 사내에 있는지. 있다면, 어디에 어떻게 적재되고 있는지를 확인 합니다.
이미 알고 있는 데이터들이라면 여기서 헤매지는 않겠지만, 처음 봐야하는 데이터가 있다면 이 단계에서 생각보다 지체되는 경우를 많이 보고 경험했습니다.
데이터가 아예 사내에 없다면, 가설을 수정하거나 반드시 확인이 필요한 가설이라면 고객 데이터를 수집합니다.
고객 데이터는 설문조사를 기획하거나 포커스 그룹 인터뷰를 진행하는 등 외부에서 수집할 수 있도록 계획을 변경할 필요가 있습니다.
이번 수능 프로모션은 다행히 알고 싶은 것들에 대한 데이터가 사내에 적재되고 있었고, 제가 잘 알고 있는 DB였습니다.
이런 사전 작업이 끝나면, 보통은 분석에 계속 쓰일 것 같은 정보를 모아 마스터 DB(혹은 테이블)를 만들어 놓는 것이 편합니다.
수능 프로모션은 분석모수를 수험생으로 한정해야 될 필요가 있어서. 아래와 같이 수험생 모수를 특정한 테이블을 만들었습니다.
N수생은 포함하지 않았는데, 고3과 N수생을 함꼐 분석하면 현재 알고자하는 가설에 bias가 많을 것 같아 제외했습니다.
N수생은 성인이라 수능 이후 그들의 패턴은 성인들만 할 수 있는 것들에 영향을 받을 것이 분명해보이기 떄문입니다.
시간/인력의 리소스가 충분하면, 수험생을 현역/N수생으로 나눠서 접근하는 것도 좋을 것 같습니다.
이렇게 대략적인 작업 준비는 마쳤습니다.
(TMI.) 테이블 이름은 업무와 연관성을 갖도록 짓는 네이밍 컨벤션(Naming Convention)이 필요한데, 생각해보니 수능을 영어로 뭐라고 하는지 모르겠더군요.
찾아보니, College Scholastic Ability Test가 수능이라고 하네요. 그래서 csat_xx1, xx2등등으로 만들어두었습니다.
먼저, 수능일(11.14) 이전/이후의 관심사 변화를 확인하였습니다.
수능 이전 한 달간의 관심사와 수능 이후 현재까지의 관심사의 비교. 관심사에 대한 정의는 SKT 내부 데이터를 통한 프로파일링의 결과물.
예상 혹은 상식과 크게 다르지 않은 분석 결과 입니다.
조금 특이한 점이 있다면, 의료에 대한 관심인데 더 확인해보진 않았지만,
아마도 성형 관련 앱과 성형 외과 방문이 영향을 줬을 가능성이 있습니다.
아직까지는 '유레카'할만한 것이 없기는 한데,
특별한/특이한 패턴을 찾지 못했다고 실망할 필요는 없습니다.
가설을 숫자로 확인해보는 것 자체가 의미 있습니다.
그리고, 세부적으로 나눠보면 새로운 것들이 보일 수도 있습니다, 아래처럼요.
관심사를 세부 카테고리로 나눠서 확인해 본 것. 예를 들면, 위에서는 OTT/음악이 모두 미디어/엔터테인먼트 영역에 있었다.
관심사를 좀 더 나눠서 보면 확연하게 다른 차이를 볼 수 있습니다.
큰 변화가 없었던 미디어/엔터테인먼트였지만, 이것은 OTT에 대한 증가된 관심과 음악에 대한 낮아진 관심의 합산이었음을 알 수 있지요.
아마도, OTT 같이 한번 보면 시간을 오래 투자해야 될 서비스에 대한 관심은 수험 생활로 인해 이연된 반면,
음악 같이 이동 혹은 공부중에도 사용할 수 있는 서비스는 수험 생활 내내 함께 했었다고 해석이 가능합니다.
다른 부분에서 눈에 띄는 건, 구직 관심이 늘고, 학생교육이 줄어든 건 이해가 되는데,
중고거래가 늘어난 부분은 의외입니다.
수험생활 동안 썼었던 교재/물품을 당근마켓 같은 곳에 올리는 것인지도 모르겠네요.
다음으로, 수험생들이 수능 이후 방문한 곳을 확인해봤습니다.
주말_낮에 여학생 수험생이 수능 이후 가장 많이 방문한 10개의 지역
주말_낮에 남학생 수험생이 수능 이후 가장 많이 방문한 10개의 지역
위 데이터를 통해 알 수 있는 건, 수험생들은 대조군(Control Group)에 비해 [강남]/[서초] 방문 비율이 높다는 것입니다.
그리고, 주말_밤에 [수원], [용인] 등의 위치가 보이는 걸로 보면 [수원], [용인]은 집 위치로
주말 낮~저녁에 [강남], [서초] 등에서 시간을 보내고 밤에는 귀가 한 것 같습니다.
그럼, 수험생들은 [강남], [서초], [마포] 등에서 무엇을 했을까.
우리가 갖고 있는 데이터로 정확히 확인하기는 어렵지만, 아마도, 패션/쇼핑을 경험 했을 가능성이 있습니다.
이유는, 이전 [2] 관심사 분석에서 패션/쇼핑에 대한 관심은 늘었던 반면 온라인 패션에 대한 관심(앱 사용 등)은 낮아졌었거든요.
이것은 패션/쇼핑에 대한 경험을 온라인 보다는 [강남권], [마포] 등에서 오프라인으로 경험했을 가능성을 보여줍니다.
다른 가능성으로는, 데이터로 확인한 것은 아니지만, 수능 이후의 context를 고려한다면
주말에는 수시/논술 등 남은 입시 전형을 준비하기 위해 [강남], [서초]에 방문한다는 해석도 가능할 것 같습니다.
이제, 마지막으로 수험생을 행동 패턴에 따라 몇 가지 그룹으로 유형화를 해보겠습니다.
마케팅에서 말하는 세그멘테이션(segmentation)에 해당하고, '비슷한 고객을 특성에 따라 분류하는 것'이지요.
데이터 분석에 친숙한 사람들은 클러스터링을 떠올릴 수 있겠고, 이번 분석에서도 topic model을 활용한
클러스터링 방법론 중 bertopic을 활용했습니다.
bertopic은 본래 문서에서 주제를 찾는 영역에 활용 되지만, 고객(수험생)을 하나의 문서로 보면 고객 유형화에도 활용이 가능합니다.
고객의 행동/위치 등등을 단어로 보는 것 인데,
에를 들면 고객A [Netflix_앱 / Netflix_앱 / Youtube_앱/ 스타벅스_장소 / 배달의민족_앱] 이런 식으로 구성하고 비슷한 유형의 고객을 찾아 묶어서 유형화 하는 방식입니다.
전체 과정을 요약하면 아래 이미지와 같습니다.
기존에는 모델이 비슷한 행동 패턴별로 묶어 놓은 세그먼트들의 특징을 분석가가 하나씩 보아 세그의 특징을 정리했었다면,
이제는 LLM에게 각 세그의 특징들(많이 나온 행동 등)을 보여주고 세그의 네이밍 및 특징을 요약하게 하는 것이 가능해져서 시간 효율적으로 업무가 가능해졌습니다.
# LLM을 통한 세그먼트 분석
def analyze_segment_with_llm(topic_words, client):
# 프롬프트 생성
prompt = f"""다음은 수능 이후 수험생들의 행동 패턴에서 추출된 주요 키워드입니다:
{', '.join(topic_words)}
이 키워드들을 바탕으로:
1. 이 세그먼트의 특징을 가장 잘 나타내는 짧은 네이밍(2-3단어)을 제시해주세요.
2. 이 세그먼트에 속한 수험생들의 행동 특성을 3-4문장으로 설명해주세요.
3. 이 세그먼트의 수험생들이 관심을 가질만한 제품이나 서비스 제안을 2-3개 해주세요.
형식:
네이밍: [네이밍]
특성: [특성 설명]
제안: [제품/서비스 제안]
"""
# LLM 호출
message = client.messages.create(
model="claude-3-haiku-20240307",
max_tokens=300,
messages=[{"role": "user", "content": prompt}]
)
return message.content위와 같이 나온 seg 결과는 아래와 같고, 시각화를 통해서도 각각 seg의 특징과 유사도를 볼 수 있습니다.
각 seg의 시각화와 주요 키워드
데이터 분석이 정말 가치있게 사용되기 위해선, 리포트에 머물지 않고 액션으로 이어져야 겠지요.
적어도, 액션(프로모션, 마케팅, 이벤트 등등)을 기획하고 실행하는 담당자에게 내용이 전해져야 의미가 있을 것입니다.
저는 프로모션/이벤트를 기획하는 담당자는 아니기에, 분석 결과를 그대로 마케팅에 반영하지는 못하지만,
고객 데이터를 통해 여러 인사이트를 발굴하는 것에 만족합니다.
"SKT, “수험생의 새로운 시작 응원합니다” ‘0 수능 페스티벌’ 오픈"
(https://news.sktelecom.com/208457)
수험생분들 고생 많으셨습니다.😀😁😊
개인적으로는 수능에 좋은 기억은 별로 없는데,
매년 돌아오는 이벤트인 만큼 회사에서 자주 관련 업무를 하게 되는 것 같아요.
사실, 수능 관련 글을 11월에 데보션 글을 쓰는 건 꽤 이전에 생각해두었습니다.
분석 데이터를 돌려본 경험이 있었고, 시의성도 있어 보였거든요.
그런데, 세부적인 내용에 대해서는 계속 고민이 있었어요.
'수능을 망친 나를 위로하는 AI', 이런 내용도 괜찮을 것 같았거든요.
LLM이 위로하는 작문을 하는 식인데, tech 내용도 들어가면서 실질적인 도움도 될 것 같았어요.
글 작성하면서 생각이 좀 바뀌어, 결국 위 내용으로 작성하게 되었습니다.
위로 작문 few-shot 예시용으로 몇 가지 찾아 놓은 글들이 그냥 묻어 두기에는 아까운 것 같아, 이 글의 마지막에 남겨 두면서 이번 글을 마무리합니다.
분명, 누군가에게는 위로가 필요한 시기일 테니까요.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.