데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      지하철 혼잡도로 살펴보는 ‘데이터가 제품이 되기까지’

      d4gem 24.08.21
      4,047 13 1
      DEVOTEE 요약
      프로덕트가 물건을 넘어 서비스나 시스템을 포함하게 된 오늘날, 저희 팀은 '데이터 프로덕트'를 연구하며 지하철 혼잡도 데이터를 제공하고 있습니다. 기지국과 와이파이 데이터를 사용해 지하철의 혼잡도를 예측하고, 통계성 혼잡도와 실시간 혼잡도를 분석하여 서울 지하철 1~9호선, 공항철도 등의 혼잡도를 제공합니다. 이를 통해 사용자들은 출퇴근길의 불편함을 줄이고, 더욱 편리한 대중교통 이용이 가능해집니다.

      이제 프로덕트(product)가 물리적인 물건(物件)을 넘어 무형의 서비스나 시스템을 포괄하여 지칭하는 시대가 되었습니다.

      이런 흐름에 맞추어 저희 팀은 우리가 가진 데이터를 어떻게 더 가치 있게 활용할 수 있을까? 하는 고민 속에서 ‘데이터 프로덕트’를 연구해 왔습니다.

      기지국(위치) 데이터를 활용해 장소 혼잡도를 구성하였고, 통화량을 기반으로 전화가 많이 오는 인기 음식점을 살펴보며 통신 서비스를 넘어 편리한 일상을 위한 데이터 프로덕트들을 개발할 수 있었습니다.

      이번 포스팅에서는 가장 널리 활용되고 있는 지하철 혼잡도를 통해 데이터 프로덕트 구성 프로세스와 운영 사례를 간략하게 소개합니다.


      지하철 혼잡도 소개

      지하철 승강장엔 사람이 없었지만, 도착한 열차에는 승객이 가득해 어깨를 잔뜩 웅크리고 지하철을 탄 경험 있으신가요?

      지하철 혼잡도는 누구나 한 번쯤은 겪었을 출퇴근길의 불편함에서 시작했습니다.


      편리한 지하철 이용을 위해 출발역부터 도착역 사이에 언제 사람들이 많이 타고 내리는지(경로 혼잡도),

      각 열차별로 어느 칸에 이용객이 많고 적은지(칸 혼잡도)에 대한 정보를 통계성 데이터로 제공하며,

      일부 구간은 실시간 데이터로 송출하고 있습니다.

      2024년 8월을 기준으로 수도권 지하철 1호선 일부 구간, 2~9호선, 공항철도, 수인분당선, 신분당선의

      혼잡도를 제공하고 있으며, 에이닷 혼잡도 서비스와 서울 지하철 역사 안의 종합안내도를 통해 만나보실 수 있습니다.


      지하철 혼잡도 기준 (지하철 객차 1칸을 기준으로 합니다)



      (좌) 에이닷 혼잡도 내 지하철 혼잡도 제공 화면 / (우) 제공 데이터


      지하철 혼잡도 (구성) 프로세스

      2019년 10월, 서울교통공사와 대중교통 안전 및 혼잡도 해결을 위한 MOU를 기점으로

      지하철 혼잡도 분석 원천 기술 개발과 관련 특허를 출원하며 데이터 프로덕트로서 지하철 혼잡도가 시작되었습니다.


      지하철 혼잡도는 기지국 및 객차 내 wifi 수신기를 활용한 위치 데이터와 다양한 메타 데이터 그리고 지하철 운행 정보와 관련된 공공 데이터를 활용합니다.

      이를 통해 지하철 이용 패턴을 추정하였으며 이를 기반으로 열차별, 객차(칸)별, 역사별 혼잡도 정보를 산출했습니다.

      지하철 혼잡도는 데이터 생성 방법에 따라 통계성 혼잡도와 실시간 혼잡도 2가지로 분류해 볼 수 있습니다.


      이번 글에서는 실시간 혼잡도 생성 프로세스 중 혼잡도를 예측하는 모델에 대해서 좀 더 설명해 드리려고 합니다.

      참고로, 실시간 혼잡도를 제공하기 위해서는 크게 4단계의 작업이 존재합니다.


      [실시간 혼잡도 제공 프로세스]



      실시간 혼잡도 모델링


      실시간 혼잡도 모델은 객차 내 WiFi AP 데이터를 24개의 feature(x)로 가공, 기지국 기반으로 산출된 열차 혼잡도(y)를 예측하는 모델입니다.

      또한, 실시간으로 값이 inference 되어야 하기 때문에 가볍고 빠른 Light GBM모델을 활용하였습니다.


      모델의 output은 아래와 같이 열차 번호별 열차 혼잡도와 객차 혼잡도로 구분되어 제공됩니다.



      모델 성능 검증

      산출된 혼잡도 데이터의 정확도를 검증하기 위해 Accuracy, MAE, RMSE 등의 평가 지표를 활용하였습니다.

      Accuracy는 혼잡도 구간을 4단계로 구분해서 확인했고, 88.5%의 정확도를 보였습니다.

      다만, 혼잡도 수치가 높아질수록 정확도가 떨어지는 경향이 보여 모델이 개선되어야 할 부분이 아직 존재합니다.


      MAE, RMSE 수치


      또한 아래와 같이 열차 번호별로 예측값과 정답값 수치를 비교했을 때, 혼잡도 값이 상당 부분 일치하는 것을 확인할 수 있었습니다.


      정답값: 검정선, 예측값: 붉은선


      필드 테스트

      지난해 에이닷 혼잡도 서비스로 적용되기 전, 확장된 노선 등을 고려해 각 호선별 거점 역을 선별하여 필드 테스트에 나섰습니다.

      필드 테스트는 검증 과정에서 실제 현장에서 보이는 정도와 비교하며 서비스로서 완성도를 높일 수 있는 단계입니다.


      당시 진행된 테스트는 프로덕트에 대해 잘 알고 있는 담당자 및 서비스 연관 구성원이 직접 현장으로 나가게 되었습니다.

      테스트를 위한 공통 가이드 내용을 숙지하고 이른 아침 각자 배정받은 역사의 지하철 플랫폼에서 진입 열차의 혼잡도를 평가하였습니다.


      운영 대응

      프로덕트 운영 과정에서 발생하는 이슈는 다양합니다. 다양한 출처의 데이터 결합으로 구성된 프로덕트인 만큼 데이터의 흐름을 잘 살펴야 하고,

      프로덕트와 연계된 환경 변화도 꼼꼼히 확인하며 품질 유지를 위한 노력을 기울입니다.

      그 과정에서 마주하는 다양한 상황들은 프로덕트 고도화를 위한 고민의 지점이 되기도 합니다.


      데이터 누락 탐지 및 품질 모니터링

      주기적으로 진행되는 데이터 관련 변동 사항은 사전 공지 후 진행되기 때문에 선 대응이 가능하지만,

      갑작스러운 데이터 이슈는 빠른 후속 대응이 필요합니다.


      지하철 혼잡도의 경우에는 공공 데이터(TOPIS)로 제공되는 실시간 열차 운행 정보를 결합하여 혼잡도 수치가 산출됩니다.

      실시간 열차 운행정보 데이터 누락은 혼잡도 값에 직접적인 영향을 주기 때문에 정확한 정보를 제공하기 위해서는 공공데이터의 원활한 수급이 중요합니다.

      위 사례와 같이 사전 예측이 어려운 데이터 이슈의 경우 가능한 한 빠르게 이슈를 탐지하기 위한 데이터 모니터링 시스템을 구축하여 운영하고 있습니다.


      데이터 퀄리티 모니터링 시스템은 산출된 값을 기준으로 알람을 설정했습니다.

      이슈가 발생하면 자연스레 혼잡도 값에 이상치가 발생하기 때문입니다. 이와 같이 특정 수치를 넘어가는 경우를 탐지하여 데이터 품질을 관리하고 있습니다.


      외부 환경 변화 대응

      데이터 프로덕트와 연관된 외부 환경의 변화도 빠르게 고려해야 하는 항목 중 하나입니다.

      지하철 혼잡도의 경우에는 지하철 운영 환경과 관련된 뉴스 등을 모니터링하며 대응이 필요한 사항을 살펴봅니다.


      일례로 지난 2월에는 서울 지하철 7호선의 건대입구와 청담 사이 역의 이름이 뚝섬유원지에서 자양으로 변경되었습니다.

      해당 변화에 따라 지하철 혼잡도 데이터도 역 이름 변경으로 영향을 받는 모든 영역을 점검하였습니다.

      이 과정은 활용하는 데이터가 다양한 만큼 출처와 시점이 다르기 때문에 내부 기준을 세우고 변경된 사항을 반영하는 작업을 진행하게 됩니다.

      이 외에도 신규 개발되는 수도권 지하철 노선에 따라 지하철 혼잡도 서비스도 함께 관련 시스템을 구축하며 고도화해 나가고 있습니다.


      데이터의 무한한 활용을 꿈꾸며

      빠르게 변화하는 기술 환경에 맞춰 프로덕트로서의 데이터를 다양한 방면으로 탐색하고 연구하며 개발된 데이터 품질에 대한 관리와 고도화도 함께 힘쓰고 있습니다.

      또한, 고객의 입장에서 더 편리하고 유용하게 이용할 수 있는 개인화 서비스 방안에 대한 실험도 진행 중입니다.

      앞으로도 데이터를 기반으로 유용한 프로덕트를 개발해 고객의 일상 가까운 곳에서 함께하고자 합니다.

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      d4gem 님의 최신 블로그

      더보기
      동영상 기고하기