23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요. 데보션 여러분.
SK 브로드밴드의 최요한 입니다.
아래 글은 제가 <김칩>이라는 국제개발협력 뉴스레터에 기고했던 글입니다.
본문을 그대로 옮깁니다.
여러분들은 생존자 편향(Survivorship bias)이란 말을 들어보셨나요? 아래 비행기 그림을 보면서 이야기해 보겠습니다.
<출처: https://en.wikipedia.org/wiki/Survivorship_bias>
세계 2차 대전 중 미해군 분석센터 연구원들은 전투를 마치고 귀환한 전투기들의 총탄 자국을 연구해 어디를 어떻게 보강해야 전투기의 귀환율을 높여 공군 전력을 최대로 유지할 수 있을지 분석했다고 합니다.
이 때 많은 연구원들은 비행기 날개와 몸통, 꼬리날개에 피탄이 집중되니(빨간점) 해당 부분 중심으로 전투기를 강화reinforce하려 했습니다.
여기서 잠깐 멈추고 비행기 사진을 다시 보면 확실히 좌,우 날개들과 몸통과 꼬리에 빨간점이 많이 찍혀있습니다.
총탄에 비행기가 피격되면 해당 부분이 파괴돼 제대로된 비행을 하지 못하고 추락할 것입니다.
피격되더라도 귀환하려면 전투기의 어느 부분을 강화해야 할까요? 빨간점이 많은 날개쪽일까요?
5초 정도만 곰곰히 생각해보시고 아래 글을 읽어보세요.
💡 다시 이야기로 돌아가면, 미해군이 고용한 통계학자 “아브라함 왈드(Abraham Wald)”는 다른 사람들과 다른 의견을 제시합니다.
귀환율을 높이려면 “비행기 머리부분인 조종석과 엔진의 장갑을 더 두껍게 하고 튼튼하게 해야 한다”고 주장한 것입니다. 그는 근거를 말했습니다.
“날개와 몸통에 총탄을 맞은 비행기들은 어찌됐든 귀환해 우리 눈앞에 있습니다. 하지만 조종석과 엔진을 피격당한 비행기들은 돌아오지 못했습니다.
조종석과 엔진 부분에 빨간점이 없는 이유는 그 부분을 피격당한 전투기들이 귀환하지 못했다는 강력한 증거입니다.”
[아브라함 왈드가 제안한 reinforce area]
<출처: https://dizarr.tistory.com/553>
전투에서 귀환한 전투기만을 표본으로 삼는 것. 이것을 생존자 편향(Survivorship bias)이라고 합니다.
처음 생존자 편향 이야기를 듣고 아브라함 왈드의 유연한 사고에 감탄하지 않을 수 없었습니다.
우리가 분석하려고 하는 대상이 데이터적으로 편향되거나 오염된 경우, 표본(부분)은 모집단(전체)을 제대로 대표할 수 없습니다.
편향된 데이터는 분석을 잘 하더라도 필연적으로 잘못된 결과를 도출하므로 늘 유의해야 합니다.
통계학자 프란시스 앤스컴은 1973년 아래 4개의 그래프를 앤스컴 콰르텟(Anscombe’s quartet)이라는 이름으로 발표하며 한마디 덧붙입니다.
<출처: https://ko.wikipedia.org/wiki/앤스컴_콰르텟>
갑자기 표준편차와 선형회귀같은 통계 용어가 나왔지만 머리 아프게 공부하자는 것이 아닙니다. 😅
앤스컴의 의도는 그래프로 그려보는 것의 중요성을 강조한 것이니까요. 평균과 표준편차만 가볍게 설명한 후 앤스컴 콰르텟으로 다시 돌아오겠습니다.
한가지 비유를 들어 설명하겠습니다.
저 멀리 아프리카에 사는 쬬비 학생은 중간고사에서 영어 90점, 수학 10점을 받아 평균 50점을 기록했습니다.
그 옆에 있는 해리 학생은 영어 60점, 수학 40점을 받아 역시 평균 50점을 기록했습니다.
두 학생의 평균은 50점으로 같지만 표준편차는 쬬비 학생이 57, 해리 학생은 14입니다.
쬬비 학생은 점수의 변동이 90과 10으로 상대적으로 크지만, 해리 학생은 60과 40으로 적기 때문입니다.
표준편차란 이처럼 평균을 보완하는 통계의 한가지 개념입니다.
90점과 10점의 평균이 60점과 40점의 평균과 같지만 통계학자들은 평균으로 설명할 수 없는 변동폭도 표현하고 싶었습니다.
그래서 표준편차라는 개념을 만들어냈습니다. 위에 언급한 상관계수, 선형회귀, 결정계수 역시 그런 맥락에서 이해할 수 있습니다.
하지만 프란시스 앤스컴은 그런 구체적인 통계값조차 그래프로 그려보기 전에는 시사하는 바를 정확히 알수 없다고 역설합니다.
그래프들은 분명히 다르게 해석됩니다. 1번~4번 그래프 모두 평균부터 선형회귀까지 같은 통계를 갖는다지만
1번 그래프는 안정적으로 우상향하고, 2번 그래프는 급성장한 후 하향추세를 그리며, 3번 그래프는 1번처럼 안정적으로 우상향하다 중간에 특이값을 갖습니다.
4번 그래프는 같은 위치에 여러 데이터 포인트가 있고 역시 특이값을 하나 갖습니다.
인터넷 시대를 맞아 알베르토 카이로(Alberto Cairo)는 앤스컴 콰르텟의 2000년대 버전이라고 할 수 있는 데이터 사우르스를 발표합니다.
아래 왼쪽 그래프는 계속 변하지만 우측 통계는 변하지 않는 것을 볼수 있습니다. Mean은 평균, SD는 표준편차, Corr.은 상관계수를 의미합니다.
<출처: 직접 작성>
데이터사우르스 그래프를 직접 그릴수도 있습니다. 겨우 코드 7줄입니다. 필요한 분은 아래 코드를 R studio에서 실행해보세요.
install.packages("datasauRus") #패키지 다운로드
library(datasauRus) #패키지 로드
install.packages("tidyverse") #패키지 다운로드
library(tidyverse) #패키지 로드
datasaurus_dozen |> ggplot(aes(x = x, y = y)) + geom_point() + #산점도
facet_wrap(.~dataset, ncol = 5) + #면분할
theme(strip.text = element_text(size = 17))생존자 편향부터 앤스컴 콰르텟, 데이터 사우르스까지 재밌게 읽으셨나요? 통계와 데이터가 머리 아픈 것 같지만 알고 보면 재밌고 흥미롭습니다.
요즘 많은 사람들이 관심갖는 챗GPT도 결국 통계적으로 확률 높은 답을 하는 것이고 우리가 AI라고 부르는 인공지능도 마찬가지입니다.
일상에서 통계적으로 확률 높은 답을 하는 대표적인 서비스가 있습니다.
바로 날씨 예보입니다. 풍속, 기온, 바람, 습도, 가시거리, 기압 등을 관찰하고 분석해 오늘의 날씨를 예측하는 것도 통계에 기반을 두고 있습니다.
AI와 다름 없습니다.
인류는 처음으로 삶의 대부분을 디지털과 데이터로 남기기 시작했습니다.
24시간 스마트폰을 갖고 다니며 자신의 위치와 동선을 남기고 검색으로 관심사를 기록하며, 문자메세지나 전화로 사회관계망을 그립니다.
인터넷과 스마트폰을 이용하기 때문에 가능합니다. 인터넷에 연결된 모든 기계는 반드시 log를 남기며 log가 쌓이면 데이터가 되고 데이터를 분석하면 정보가 됩니다.
우리는 그런 시대에 살고 있습니다. 과거에는 사람이 직접 만나 나눴던 대화들이 바로 휘발됐지만 이제는 사람이 기계에게, 기계가 기계에게, 기계가 상대방에게 말과 글을 전달 합니다.
이런 것들이 날씨예보처럼 체계적으로 분석된다면 어떻게 될까요. 좀더 드라마틱한 미래로 나아갈 수 있으리라 믿습니다.
💡 **“가난은 임금도 구제 못한다”**는 말이 있습니다. 역사적으로 맞는 말이였습니다. 임금도 못한 일을 데이터를 올바로 사용하는 사람들은 할 수 있다고 믿습니다.
그래서 저는 데이터를 공부합니다. AI를 보고 터미네이터나 아이언맨을 떠올리는 것이 아니라 데이터로 개선된 풍요로운 미래를 상상합니다.
국제개발분야에서도 데이터 리터러시는 필요합니다.
필요한 자원이 생존자 편향 오류를 극복하고 필요한 사람들에게 전달되기를,
그래프를 그리는 시각화가 평균의 오류를 간파하고 빈부 격차를 발견해내는 날카로운 천리안이 되기를, 저는 바래봅니다.
올 여름에는 장맛비가 오더라도 인명피해가 없기를 바라는 그 간절함으로 데이터를 사용해 여러분과 함께 더 나은 미래를 만들어가고 싶습니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.