23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요!
저희는 Team “GADA” 입니다!
저희가 풀고자 하는 문제는 다소 오래되었지만 여전히 해결되지 않은 주제입니다.
바로 Tabular 데이터와 결측치(Missing Value) 문제입니다.
기존의 점진적 업데이트 방식에서 벗어나, 데이터 기반의 모델 생성 과정을 자동화함으로써 AI 개발의 효율성을 극대화하고,
제한된 자원 환경에서도 실용적인 성능을 발휘할 수 있는 경량 모델을 구축하는 것이 목표입니다!
이전에 작성했던 내용에 이어 진행된 내용들과 앞으로의 계획에 내용에 대해서 말씀드리도록 하겠습니다!
AI 연구에서 텍스트, 이미지, 음성 같은 데이터는 많은 관심과 성과를 얻어왔습니다.
반면, 정작 모든 산업에서 기본적으로 사용되는 데이터 형태는 Tabular입니다.
고객 회원 정보, 병원 기록, 공공 행정 데이터, 온라인 쇼핑 기록 등은 모두 표 형태로 정리되며, 이는 산업 전반에 걸쳐 범용적 가치를 지닙니다.
그럼에도 불구하고, Tabular 데이터에 특화된 딥러닝 연구는 상대적으로 부족합니다.
컬럼마다 다른 스케일과 타입이 혼재
복잡하고 비선형적인 feature 상호작용
데이터셋 불균형과 규모 제한이러한 이유로, Tabular에서는 아직도 전통적인 머신러닝 기법(XGBoost, RandomForest 등)이 자주 쓰이고 있습니다.
Tabular 데이터를 다루다 보면 결측(Missing Value)은 피할 수 없는 현상입니다. 그런데 이런 결측에도 종류가 존재하는데요, 결측의 종류는 아래와 같습니다.
MCAR: 결측이 완전히 무작위로 누락
MAR: 결측이 특정 관측 변수의 값에 따라 발생
MNAR: 결측 발생이 결측된 값 자체와 직접적으로 관련
기존 접근은 대부분 단순한 방식으로 결측을 채운 뒤 학습을 진행합니다.
하지만 이 경우, 결측 패턴에 담긴 중요한 정보가 무시되거나, 데이터 특성에 맞지 않는 값이 들어가 오차가 누적되며 성능이 저하되는 현상이 있습니다.
이를 위해 저희는 결측을 단순히 메꿔버리는 것이 아니라, 데이터의 맥락과 패턴을 반영하고,
missing의 특성을 활용해 모델 구조부터 가중치 생성까지 함께 최적화할 수는 없을까? 라는 물음을 해결하기 위해 연구를 진행하고 있습니다.
저희 연구는 크게 두 가지 축으로 진행되고 있습니다.
단순히 빈칸을 채우는 수준을 넘어, 현실적인 데이터를 새롭게 생성하는 것이 목표입니다.
이를 위해 다양한 도메인 지식을 갖춘 대규모 언어모델(LLM) 을 활용하여 실험을 진행하고 있습니다.
LLM은 데이터셋을 단순히 숫자 집합이 아니라 맥락이 있는 정보로 해석하고, 더 자연스러운 샘플을 만들어낼 수 있습니다.
이를 위해 CoT (Chain-of-Thought)를 활용하여 LLM이 갖고 있는 domain knowledge와 Reasoning 능력을 활용하고 있습니다.
이 덕분에 단순한 interpolation 보다 더 풍부하고 의미 있는 데이터셋을 확보할 수 있었습니다.
Model | 원본→원본 테스트 | 생성→원본 테스트 | ML Efficacy |
|---|---|---|---|
Logistic Regression | 0.9333 | 1.0000 | 1.0714 |
Random Forest | 0.9333 | 1.0000 | 1.0714 |
Gradient Boosting | 0.9667 | 1.0000 | 1.0345 |
SVM | 0.9333 | 0.9333 | 1.0000 |
Neural Network | 0.9333 | 1.0000 | 1.0714 |
저희는 실제로 간단한 OpenML과 UCI 데이터셋을 대상으로 초기 실험을 진행했습니다.
그 결과, LLM이 생성한 데이터가 오히려 기존 원본 데이터를 그대로 활용했을 때보다 더 좋은 성능을 내는 경우도 확인할 수 있었습니다.
이는 LLM이 단순히 값을 보완하는 것이 아닌, 데이터의 구조적 특성과 패턴을 반영할 수 있다는 가능성을 보여주고 있습니다.
다만, 이러한 결과가 실사용으로 이어지기 위해서는 한정된 소규모 공개 데이터셋을 넘어서, LLM이 사전에 학습하지 못한 새로운 데이터셋에서도 동일한 효과가 나타나는지 검증하는 과정이 필요합니다.
앞으로 저희는 보다 다양한 도메인과 데이터셋을 포함한 폭넓은 실험을 통해, 생성 데이터의 일반화 가능성에 대해서 실험을 계속 진행할 예정입니다.
기존 Tabular 모델들은 새로운 데이터셋에 맞추려면 다시 학습 과정을 거쳐야만 했습니다.
하지만 저희는 메타데이터와 데이터의 통계적 특성, 그리고 missing indicator를 입력으로 받아,
그에 맞는 모델 구조부터 가중치까지 동시에 생성하는 방식으로 연구를 진행하고 있습니다.
이를 통해 단순히 고정된 구조를 반복적으로 재학습하는 것이 아니라,데이터 환경이 바뀌더라도 유연하게 적응할 수 있는 새로운 형태의 하이퍼네트워크 모델을 설계하고 있습니다.
저희는 연구를 시작하면서 먼저 기존 Tabular 모델들을 직접 검증해보았습니다.
TabNet, FT-Transformer, TabPFN 등 다양한 접근법을 분석했고, 각 모델이 가진 장단점을 실험적으로 확인했습니다.
저희가 가장 먼저 실험했던 구조는 feature들의 subset을 graph 형태로 표현하고 이를 Node로 보는 접근 방법이었습니다.
충분히 가볍고 좋은 성능을 낼 수 있을 것이라고 생각했으나, Node의 최대 개수가 feature 수를 넘지 못한다는 한계점을 가지고 있으며 Missing에 특화된 요소를 추가해야 한다는 점이 고려 사항으로 생겼습니다.
아래 표는 대표적인 baseline 에서 일부 결과를 나타낸 표입니다.
Model | Accuracy | Precision | Recall | F1-Score | AUC-ROC |
|---|---|---|---|---|---|
HyperTabNet (w. BCEloss) | 0.8506 | 0.7373 | 0.5834 | 0.6514 | 0.9057 |
HyperTabNet (w. BCElogitloss) | 0.7959 | 0.7554 | 0.1771 | 0.2934 | 0.8514 |
TabNet | 0.8465 | 0.7835 | 0.4953 | 0.6069 | 0.9035 |
XGBoost | 0.8731 | 0.7930 | 0.6356 | 0.7056 | 0.9297 |
실험을 통해 얻은 중요한 인사이트는 다음과 같습니다.
단순히 모델 크기를 키우는 것이 성능 향상으로 이어지지 않는다.
기존 모델들은 결측치에 대한 고려가 없으며, 새로운 데이터셋에 맞추려면 다시 학습이 필요하다.
HyperNetwork 기반 접근은 데이터 특성을 활용해 모델 구조 및 가중치를 최적화할 수 있는 방법론이다.
현재 저희는 missing indicator와 메타데이터를 활용해 모델 구조부터 가중치까지 자동으로 생성하는 하이퍼네트워크를 주제로 진행하고 있습니다.
이를 통해 결측 패턴 자체를 정보로 적극 활용하면서, 데이터 특성에 최적화된 경량화 모델을 빠르게 설계하는 것을 목표로 연구를 진행하고 있습니다.
저희는 앞으로 다음과 같은 방향으로 연구를 이어갈 계획입니다.
다양한 공개 데이터셋 실험
의료, 금융, 전자상거래 등 여러 산업 도메인에 걸친 데이터셋을 활용하여, 제안한 방법이 범용적으로 잘 작동하는지 검증할 예정입니다.
결측 시나리오별 분석
현실적으로 발생하는 MCAR, MAR, MNAR 등 다양한 결측 패턴에서 안정적으로 성능을 유지할 수 있는지를 살펴볼 계획입니다.
Missing Indicator 활용
결측을 단순히 메꿔버리는 것이 아니라, 결측 자체가 가진 패턴을 정보로 활용할 수 있는 방법을 활용 할 계획입니다.
어떤 방식으로 결측 여부를 모델에 전달하는 것이 최적의 성능을 낼 수 있는지 집중적으로 연구할 계획입니다.
경량화 모델 연구
학습 과정을 최소화하면서도 데이터 특성에 맞는 구조와 가중치를 빠르게 생성할 수 있는 모델 개발을 목표로 하고 있습니다.
이를 통해 고성능 GPU 자원에 의존하지 않고도 실시간에 가까운 모델 생성을 목표로 하고 있습니다.
저희 연구가 성공적으로 완성된다면 여러 측면에서 의미 있는 효과를 기대할 수 있습니다.
우선, 기존처럼 긴 학습 과정이나 대규모 GPU 자원을 소모하지 않고도 데이터에 맞는 맞춤형 모델을 바로 생성할 수 있어 효율성이 크게 향상됩니다.
이로 인해 연구자나 기업이 새로운 데이터를 접할 때마다 재학습을 반복하는 부담을 줄일 수 있습니다.
또한, 이러한 접근은 특정 대기업이나 연구기관에 한정되지 않고, 스타트업이나 소규모 연구소, 혹은 개인 연구자들까지도 손쉽게 활용할 수 있는 환경을 제공할 수 있습니다.
누구나 가볍게 자신만의 데이터에 맞는 AI 모델을 만들 수 있다는 점에서, 접근성이 획기적으로 높아집니다.
마지막으로, 불필요한 연산 자원을 줄이고 데이터 특성에 최적화된 모델을 생성하는 방식은 지속가능성 측면에서도 큰 의미가 있습니다.
에너지 낭비를 줄이는 동시에, 환경 친화적인 AI 개발 문화를 조성할 수 있다는 점에서 장기적으로 긍정적인 영향을 줄 수 있습니다.
남은 기간 동안 최선을 다해서 프로젝트를 마무리 할 수 있도록 하겠습니다!
감사합니다!
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.