23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
다양한 모달리티의 정보를 처리해야 하는 의료 분야
데이터의 수가 적고 파편화 되어있어 학습이 어려운 의료 AI
개인별 특성과 임상 기준 변화 등으로 인한 의료 AI 시스템의 동적 지식 통합의 필요성
최근 MLLMs을 활용한 RAG 시스템에 대한 활발한 연구
MQA 문제에 최신의 MLLMs 적용 및 개선점 탐구
다양한 RAG 방법론을 접목해 MQA 시스템 성능 개선
새로운 아이디어를 활용한 MQA 시스템 성능 개선
프로젝트 목표
최신/새로운 RAG 방법론을 접목한 MQA 시스템 연구개발
프로젝트 과정 중에 도출된 아이디어로 논문/특허 작성
비전
실제 의료 분야에 적용 가능한 고도화된 Agentic AI 개발
VocAI VISION: 인의 진단 모델 재학습 없이 개인별 진료 기록 및 연관 건강 지표를 반영하여 서비스 고도화
XCaliber: 수의 진단 모델에 개체별 진료 기록, 다중 영상, 수의 데이터베이스를 반영하여 서비스 고도화
강현정
소속 : BioMedical AI 개발팀 (ML/DL 개발)
담당 업무 : 수의 질환 판독 모델 개발
(#ESTJ #ComputerVision #Medical #될놈될)
안지용
소속 : BioMedical AI 개발팀 (ML/DL 개발)
담당 업무 : 음성 질환 판독 모델 개발
(#ESFJ #Reinforcement Learning #Robotics #취미 부자 #적일많버)
갑작스런 인후통으로 병원을 간 상황을 가정해 봅시다.
처음 병원을 방문하면 (1) 나이, 성별 과 같은 기본적인 인적 사항을 작성하고 이를 토대로 (2) 과거 진료 기록을 살펴볼 것 입니다. (3)
의사 선생님과 내담을 거친 후, 추가적인 진단이 필요하다고 생각되면 (4) X-ray, CT 와 같은 여러 의료 영상을 (5) 다각도로 촬영할 것입니다.
또 필요할 경우 (6) 음성 데이터를 확보하여 다른 기관에 문제가 있는 것은 아닌지 체크도 해볼 것입니다.
이를 모두 종합적으로 추려서 의사 선생님은 환자에 대한 최종 진단을 내리게 됩니다.
병원에 방문했을 때 생성되는 수많은 데이터들 중 AI 모델은 매우 일부분만 다루게 됩니다.
예로, '후두 X-ray에서 특정 질환을 판독'만 하거나 '음성 데이터를 토대로 결절 진단'만 수행하게 됩니다.
그러다보니 AI 서비스로 만들어지는 과정에서 여러 기능을 확장할 때마다 새로운 데이터를 수집하고 모델을 학습시켜야 하는 번거로움이 발생합니다.
혹시라도 판독 기준에 변동이 생긴다면 그 난이도는 더욱 상승하게 됩니다.
더 나아가 환자 개개인에 맞춘 솔루션까지 제공하는 것은 실사용 환경에서 더 뚜렷한 한계점을 갖고 있습니다.
본 프로젝트는 위와 같은 문제점을 MQA(Medical Question Answering)로 한정짓고 문제를 RAG(Retrieval-Augmented Generation)로 해결하고자 합니다.
최종 목표는 정해진 Input-Output값에 supervised learning된 진단 모델과 다양한 Input 값을 처리할 수 있는 MLLMs((Multimodal Large Language Model) 모델이 서로 상호작용 함으로써 가장 적합한 답변을 하는 형태이며
이를 위해 크게 세 가지 부분의 적용 기술이 필요합니다.
MLLMs SOTA (Qwen-VL, LLaVA V4)
RAG Methods
MQA with RAG
우선, 진단을 위해 필요한 모델과 MLLMs은 별도의 학습 과정을 거치지 않고 가장 적합하다 생각되는 사전 학습된 모델을 사용하고자 합니다.
적절한 MLLMs이 선정되면 일종의 Open-Book 역할을 해주는 Multimodality RAG와 Closed-Book 역할을 수행하는 사전 학습된 모델이 어떻게 효율적으로 검색하고 상호작용 하는 것이 좋은지에 대한 MQA 연구를 수행할 예정입니다.
아래 이미지는 구축하고자 하는 MQA 방법론의 한 예시입니다.
Reference
Liang, S., Zhang, L., Zhu, H., Wang, W., He, Y., & Zhou, D. (2025). RGAR: Recurrence Generation-augmented Retrieval for Factual-aware Medical Question Answering. arXiv preprint arXiv:2502.13361.
VocAI VISION은 SK텔레콤의 Multimodal AI 기술을 이용해 연구 개발 중인 서비스로, 환자의 목소리를 입력받아 후두질환 3종에 대한 건강 지표를 분석하는 서비스입니다.
이 기술은 음성 파형에 대한 분석과 함께 이를 주파수 영역으로 변환한 이미지에 대한 분석을 수행합니다.
이 서비스는 환자들이 병원에 직접 방문하지 않고도 편하게 목소리 컨디션을 점검할 수 있도록 해주지만, 아직 환자 개개인의 임상적 특성을 반영하는데 한계가 있습니다.
환자의 성별과 나이 같은 간단한 정보를 활용하지만 환자의 진료기록이나 Jitter, Shimmer, CPP(Cepstral Peak Prominence) 등 실제 의료진의 진단 과정에서 주요하게 참고하는 음성학적 지표들을 활용하지 못합니다.
현재 서비스 구조에서는 추가 정보를 활용하기 위해 데이터 수집, 모델 구조 변경, 재학습이 필요한 상황입니다.
하지만 MLLMs-RAG 시스템을 도입한다면 추가적인 학습없이도 환자의 개인화된 특성이나 연관된 다른 건강 지표들을 유연하게 반영해 서비스를 고도화 할 수 있을 것으로 기대합니다.
LLM / RAG 관련 연구 경험이 있으신 분
도메인 특화된 RAG 시스템을 구축에 관심이 있으신 분
최신 연구를 이해하고 적용해본 경험이 있으신 분
신선한 아이디어를 가지고 열정적으로 프로젝트에 참여하실 분
데이터셋은 어떤 것을 활용할 예정인가요?
공개된 다양한 MQA 데이터셋 중에서 프로젝트에 적합한 데이터를 선정해 활용할 예정입니다. 예시 데이터로는 다음 **링크**를 참고해주세요.
Multimodality 관련 연구와 RAG 시스템 연구 중 어디에 더 중점을 둔 과제인가요?
Zero/Few-Shot 특성을 지닌 MQA 문제를 RAG 시스템을 이용해 해결하는 과제입니다. Multimodality는 문제를 다루는 도구 중에 하나이고, RAG 시스템 연구에 더 중점을 두고 있습니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.