23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
LLM 학습을 위한 synthetic data의 품질 향상을 목표로 다양한 filtering 기법을 연구하고 적용.
최소한의 synthetic data로 최고의 성능을 내기 위한 품질 검증 및 filtering 프로세스 연구.
연구 결과를 데이터 정제 파이프라인과 LLM 학습 데이터 구축 파이프라인에 적용. 좋은 결과가 나오면 논문 작성 계획.
데이터셋 설계 및 데이터/모델 품질 측정에 대한 경험. 프롬프트 엔지니어링과 LLM post-training에 대한 이해를 가진 Fellows를 모집
박소희
AI Data Engineering팀
90% AI Researcher, 10% chaos.
배움에 진심
조용히 깊게, 꾸준히 앞으로!
송인지
AI Data Engineering팀
SW Engineer
AI 대화 시스템(dialog system) 아키텍처 설계 및 구현 경험을 보유한 SW 엔지니어
대규모 언어 모델(Large Language Model, LLM) 학습 및 평가를 위한 데이터셋 구축 경험
복잡한 태스크 수행과 의사결정을 위한 AI 에이전트(AI agent) 시스템의 인지적 능력 향상 연구에 전념 중
SF 소설 읽는 게 취미
장원범
AI Data Engineering팀
LLM Research Engineer
LLM-as-a-Judge, Reward Model, Synthetic Data 관련 연구에 전념 중
연구 경험
산업계
Telco Domain 특화 LLM Benchmark 개발 (EMNLP industry track)
Industry 분야 OCR용 synthetic data, Anomaly Detection model 경량화, (Vision-Language) Multi-modal model 하드웨어 최적화
학계
Multi-view Depth Estimation (Machine Vision and Applications)
LLM 학습을 위한 synthetic data의 품질을 높이기 위해 다양한 filtering 기법을 연구하고 적용하는 것을 목표로 합니다.
데이터 정제 기준을 세우고, 각 filtering 기법이 LLM 학습 성능에 미치는 영향을 분석하여 최적의 데이터 정제 방식을 찾아내고 검증하는 것이 주요 과제입니다.
LLM 학습에 필요한 대량의 고품질 데이터를 효과적으로 확보하기 위해 synthetic data를 활용합니다.
데이터 부족 문제 해결: LLM을 효과적으로 학습하려면 대량의 고품질 데이터가 필요합니다.
하지만 Hand-crafted 데이터를 만드는 데는 시간과 비용이 많이 소요됩니다. 이러한 문제를 해결하기 위해 여러 분야에서 synthetic data를 활용하고 있습니다.
데이터 품질 문제: Synthetic data는 자연스럽지 않은 문장 구조나 비현실적인 내용이 포함될 수 있어, 모델 학습에 부정적인 영향을 미칠 수 있습니다.
다양성 부족: 다양한 상황과 맥락을 충분히 반영하지 못하는 경우가 많아, 모델이 특정 상황에만 최적화될 위험이 있습니다.
Model Collapse: 잘못된 데이터가 반복적으로 학습되면 모델이 특정 패턴에만 집중하게 되어, 전반적인 성능이 저하될 수 있습니다.
따라서 저희는 Synthetic Data의 품질을 확보하기 위해 Data Filtering에 관해서 연구하고자 합니다.
s1: s1에서는 Difficulty, Diversity, Quality라는 기준으로 1K의 데이터만으로도 Qwen2.5-32B-Instruct가 특정 벤치마크에서 o1 벤치마크를 따라잡았다는 결과가 있습니다.
LIMO: LIMO는 Level of Difficulty, Generality, Knowledge Diversity 세 가지 지표로 filtering을 수행하여 O1-preview를 뛰어넘는 성과를 보였습니다. 이는 적절한 filtering 기법이 데이터의 효율성을 크게 향상시킬 수 있음을 보여줍니다.
Synthetic data의 품질 검증과 filtering에 관한 프로세스를 연구하여 고품질 데이터를 제작하는 것을 목표로 합니다.
특히 최소한의 synthetic data로 최고의 성능을 내는 것을 목표로 하며, 특정 Task나 Benchmark에 적합한 데이터를 제작하고, 이를 검증하고 filtering하는 프로세스를 연구하고 있습니다.
우리 팀은 데이터셋 설계와 데이터/모델 품질 측정을 고민하는 팀으로, 많은 경험과 노하우를 가지고 있습니다. 또한 연구에 대한 열정이 많아 좋은 결과가 나오면 논문도 작성할 계획입니다.
프롬프트 엔지니어링에 대한 경험
SFT, RLHF, DPO 등 LLM post-training에 대한 기본적인 이해
A1. 아직 확정된 Task는 없지만, 2025년은 Agent의 해인 만큼 Agent에 필요한 planning능력을 키우는데 집중하고싶습니다. 구체적인 Fellow와 함께 논의하면서 Task를 구체화를 할 예정입니다.
A2. 제한은 없습니다. SFT, DPO 등 여러 학습 방법을 고려하고 있습니다.
A3. 오픈된 synthetic data를 사용해도 괜찮지만, 오픈된 데이터는 이미 모델 학습에 사용되었을 확률이 높아 직접 설계하는 것을 추천드립니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.