23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요!
저희는 DEVOCEAN Ai fellowship 연구과제 02. 추론 기반 한국어 AI 성능-안전성 최적화: Task-aware Deliberative Alignment 프로젝트에 참여하게 된 팀 밤티 the STRIKER 입니다.
우선, 연구 진행 상황에 앞서 트렌디한 이슈 먼저 중요체크하려고 하는데요, 비교적 최근 상용화된 GPT-5, 다들 사용해보셨나요?
놀랍게도 챗봇 시장을 주도하는 회사의 최신 모델조차, 출시 후 불과 일주일 만에 프롬프트 공격에 의해 안전장치가 뚫리는 문제가 발생했습니다. [1]
소위 탈옥(Jailbreak) 이라고 일컬어지는 현상이죠. 이처럼, LLM의 안전을 지키기 위한 Safety Alignment 연구는 더이상 미룰 수 없는 중대한 과제가 되었습니다.
탈옥된 모델이 학습 과정에서 얻은 방대한 유해 데이터를 사용자에게 그대로 제공할 수 있기 때문이죠.
저희 밤티 팀의 Safety Alignment는 저번 포스팅에서도 설명했듯, 크게 두 가지 파트로 나눌 수 있습니다.
도메인/태스크 별 LLM 안전 정책 작성
정책을 사용한 Alignment
인데요, 저희는 현재 LLM Safety Spec 작성을 진행하고 있습니다! 그럼 밤티 팀의 연구 진행상황, 함께 만나보시죠!
문제의식: 안전 정렬된 LLM이 과잉 거부(over-refusal) 를 보이거나, 도메인/태스크 맥락을 놓쳐 유용성이 저하되는 문제가 빈번함.
핵심 아이디어: 도메인·태스크 전반을 아우르는 SPEC(명시적 안전 정책)을 생성하고, 정책을 직접 참조하는 SFT 만으로도 안전 정렬 효과를 입증.
현재 단계: SPEC 최종 생성 완료 단계 & SFT 학습용 쿼리 준비 중.
기대효과: 필요할 때만 정확히 거부하고, 허용 가능한 요청은 도메인/태스크별 규범을 준수하며 유용한 답변을 제공.
Safety Alignment에는 중요한 딜레마가 존재합니다. 안전만 강조하면 유용한 답변이 제한되고, 반대로 유용성만 추구하면 위험한 답변이 나올 수 있다는 것인데요,
이러한 Safety-Helpfulness Trade-off를 완화하기 위해 필수적인 안전 정책입니다.
이를 통해 LLM은 단순한 거부가 아닌 안전정책을 근거로 이유 있는 거부를 배울 수 있게 되는 것이죠.
이를 위해 저희는 AI가 반드시 지켜야 할 작동 원칙을 ‘헌법(Constitution)’으로 제정해, SPEC 작성과 평가의 최우선 기준으로 삼았습니다.
이를 위해 전 세계의 AI 윤리 원칙, 지침, 권고를 폭넓게 조사했습니다.
조사한 문서들에서 반복·강조되는 핵심 키워드를 추출해 밤티팀 고유의 AI 헌법 초안을 만들었고,
이 헌법은 궁극적 목적과 세가지 원칙으로 이루어진 계층적 구조로 설계해, 조항 간 충돌 시 우선순위를 명확히 했습니다.
위계 질서를 명시하고, 핵심 조항을 보강했으며, 용어 통일과 1인칭 서술로 명료성을 높이는 등 수정과 실험을 거쳐, 헌법 초안을 완성했습니다.
완성된 초안은 법률 전문가의 검수를 거쳤는데요,(Special Thanks to 김영서 변호사님)
특히 최신 글로벌 거버넌스가 인권을 모든 규제의 근본 철학으로 삼고 있는 점을 반영하여 인간의 기본권 존중 항목을 최상위 원칙으로 격상시켰습니다.
그 외에도 주신 피드백을 반영하여 수정하였고, 최종적으로 전문가께서 추천해주신 추가적인 자료 조사를 통해 최종 헌법을 완성할 수 있었습니다!
OpenAi에서 제시한 기존 Deliberative Alignment[2]는 general한 하나의 SPEC에 의존하기 때문에 실제 산업에서의 적용에는 한계가 존재합니다. 그렇기 때문에 저희는 더욱 체계적인 도메인, 태스크 특화 SPEC을 제안합니다. 분야별 SPEC을 생성하기에 앞서, 다양한 활용 맥락을 아우를 수 있도록 5개의 도메인과 10개의 태스크를 정의했습니다.
이 도메인과 태스크들은 우선적으로 LLM의 활용에 있어서 위험이 도사리고 있다고 판단되는 분야를 위주로 선정했으며, 공개된 데이터셋과 벤치마크 여부를 조사해 최종적으로 구분하게 되었습니다.
그러나 이러한 파이프라인은 다른 도메인/태스크에도 얼마든지 적용할 수 있는 확장성이 있다는 점! 알아주셨으면 좋겠어요☺️
그럼 앞서 생성된 Constitution을 사용해 SPEC을 생성해보겠습니다.
완성된 AI 헌법과 도메인, 태스크를 바탕으로 프롬프트를 설계합니다.
다양한 실험 결과, 헌법 전문과 few-shot 예시를 함께 포함했을 때 SPEC 품질이 가장 우수했으며, 영어 프롬프트가 한국어 프롬프트 대비 더 일관된 성능을 보였습니다.
또한 각 도메인, 태스크 설명을 제공해 거대 모델 내부의 지식을 활용하고자 했고, Ablation study로 각 구성 요소의 기여를 확인했습니다. 이 결과를 반영해 최종 프롬프트를 완성했습니다.
완성된 프롬프트를 사용해 SPEC 생성 실험을 시작하였습니다.
먼저 최대한 다양하고 광범위한 정책을 만들기 위해 높은 temperature로 많은 SPEC 생성 후 클러스터링하는 실험을 진행하였으나 SPEC의 품질이 few-shot 예시의 품질에 강하게 의존한다는 한계가 확인되었습니다.
따라서 저희는 few-shot 품질을 자동으로 끌어올리고 검증할 수 있는 방안을 모색하였습니다.
그 결과 Google DeepMind의 연구, AlphaEvolve[3]를 선택했습니다.
이는, 진화 알고리즘과 LLM을 결합한 연구로, 변이를 생성하여 자동평가를 거친 뒤 우수 후보를 저장하는 과정을 반복해 점진적으로 더 나은 결과물로 발전시킨다는 아이디어입니다.
본격적으로 실험을 진행하기 전에, 진화의 기반이 될 평가 방식을 설정합니다.
기존 연구가 안전, 유용성 점수만 평가하는데 반해, 저희는 헌법, 도메인, 태스크의 적절성과 충실도를 각각 평가하는 세가지 Judge를 새롭게 도입했습니다.
Judge들의 전체 평가 항목입니다. 헌법40점, 도메인30점, 태스크30점으로 총점 100점만점으로 설정하였습니다.
그러나! 실험 전에, Judge가 모두 LLM이기 때문에 LLM Judge의 기본적인 편향 문제를 해결해야 합니다.
Judge LLM에는 크게 세 가지 편향이 존재합니다. 바로, 같은 모델 선호 편향, 길이 편향, 위치 편향입니다.
LLM Judge의 가장 흔한 편향 3가지 [4]
Self-enhancement Bias: 패밀리 모델의 답변을 선호
Length Bias: 정확하지 않더라도 길고 장황한 응답을 선호
Position bias: 후보응답의 순서나 위치가 평가 결과에 영향
이를 해결하기 위해 1) 생성과 평가 모델을 분리하고, 2) 명료도 항목을 추가하며, 3) 단일 SPEC 점수 체계(pointwise 평가방식)를 도입했습니다.
특히 길이 편향 문제가 가장 해결하기 어려웠는데요,
Judge LLM에 명료도 평가항목을 도입한 뒤에 5세대 진화 후 생성된 SPEC들의 길이와 점수 간의 상관관계를 분석한 결과, 명료도 항목의 도입이 길이 편향을 효과적으로 억제하는 것을 확인할 수 있었습니다.
이제 하이퍼파라미터를 설정하고 진화를 시작보겠습니다.
Generator로는 Claude 3.5 Sonnet을, Judge로는 GPT 4o mini를 사용했으며, 총 20개의 시드 문장을 기반으로 평가를 진행했습니다.
실험 결과, 10-20개 SPEC을 집단으로 평가했을 때는 점수 차이가 거의 나타나지 않았습니다.
따라서 평가 방식을 문장 단위로 세분화하여 더 정밀한 평가가 가능하도록 개선했습니다.
또한 세대별로 상위 SPEC을 아카이브에 보관하여 이전 세대의 효과적인 SPEC 들을 지속적으로 활용할 수 있었으며, 다양한 LLM을 Judge 모델로 사용해 검증을 진행했습니다.
최종적인 진화 파이프라인입니다.
법률 도메인 SPEC의 워드 클라우드를 살펴보면,시드 데이터에는 없던 도메인의 전문 용어가 새롭게 등장하였습니다.
이를 통해, 진화 과정을 거치며 더욱 구체적이고 전문적인 방향으로 SPEC이 발전하고 있다는 것을 발견할 수 있었습니다.
추가적으로, 더 명확한 태스크별 특화도를 확인하기 위해 법률 도메인 내의 task를 각각 커뮤니케이션과 코드생성으로 설정해 SPEC들의 문장/단어 벡터 유사도를 측정했습니다.
측정 결과, 단어 유사도에 비해 문장 유사도 차이가 매우 큰 것으로 나타났습니다.
이는, 동일한 도메인이기 때문에 유사한 전문 용어를 사용하여 태스크간의 단어 유사도는 높지만,
태스크별로 서로 다른 의미와 목적을 가진 지침이 생성되기 때문에 문장 의미론적 유사도는 낮게 나오는 것입니다.
이를 통해 태스크별 특화가 성공적으로 이루어지고 있음이 확인됩니다.
저희는 앞선 실험들을 바탕으로 초안을 Pointwise 평가하고, 지배도 산출로 중복을 제거한 뒤 Pairwise Elo Rating 기반 정렬로 한 번 더 순위를 점검합니다.
그 뒤, 최종적으로 만들어진 SPEC 아카이브 집단에서 15-20개씩 랜덤샘플링한 부모 집단을 바탕으로 그룹 진화를 거쳐 각 SPEC끼리의 유기적 연결성을 평가합니다.
이를 통해, 하나의 온전한 도메인-태스크 조합 별 SPEC을 만들 수 있습니다.
SPEC 데이터셋은 선행 연구 및 공개 데이터가 존재하지 않아 통계적 검증이 어렵기 때문에, 특히 취약한 의료와 법률 도메인에 대해서는 전문가 검수를 통해 신뢰성을 확보할 것입니다.
SPEC을 완성한 후에는 이를 직접 파인튜닝에 활용합니다.
먼저 밤티 SPEC과 시드 데이터를 추론 모델에 입력하여 추론 데이터를 생성하고, 이 데이터를 사용해 정렬 대상 모델을 파인튜닝합니다.
이처럼 단순한 과정만으로도 모델의 안전성이 향상되는 이유는 바로 BAMTI SPEC의 효과 때문일 것입니다!
파인튜닝 과정은 간단합니다. 우선, JailBreakV-28K[5] 데이터셋으로 시드 데이터를 설정합니다.
하지만 이 데이터셋은 법률과 일반 도메인에 편중되어 있기 때문에 안전성을 제거한 모델을 활용해 부족한 도메인 데이터를 추가로 생성하여 데이터 불균형을 해소할 계획입니다.
시드 데이터셋 준비가 완료되면 다음으로 SFT 데이터셋을 생성합니다.
추론 모델에 완성된 시드 데이터셋과 밤티 스펙을 입력하여 추론과정을 포함한 최종 학습 데이터를 확보합니다.
이후, 학습 대상으로는 safety post training 성과가 드러나지 않은 모델(Qwen3-4B-Thinking-2507 [6])을 선정하여 파인튜닝을 진행할 것입니다.
모든 파인튜닝이 종료되면, 크게 두 가지 측면에서 모델을 평가합니다.
첫번째로 모델의 전반적인 안전성 능력을 평가합니다. 이를 위해 공격 방어, 진실성, 과도 거부 세 가지 측면으로 나누어 종합 평가를 진행합니다.
두번째로 도메인별 특화 능력을 평가합니다. 각 도메인에 해당하는 전문 벤치마크 뿐만 아니라 일반 지식 벤치마크를 함께 활용하여 안전성과 유용성을 종합적으로 검증합니다.
마지막으로, 안전 정렬의 효과를 가시적으로 입증하기위해 Safety Layer 개념[7] 을 도입합니다.
LLM의 특정 레이어에서 나타나는 벡터 변화를 통해 악성 프롬프트 식별 및 억제 기능을 확인할 것 입니다.
General한 SPEC이 아닌 다양한 도메인과 태스크를 다루는 SPEC을 최초로 구축하고 배포합니다.
비싼 강화학습 없이 간단한 SFT만으로도 안전성과 유용성을 함께 확보하며, 이를 통해 SPEC의 중요성을 다시 한 번 증명합니다.
모델 내부 구조 분석을 통해 정렬 효과를 정량적으로 입증합니다.
LLM 악용 가능성을 최소화하고 Jailbreak 대응을 강화합니다.
해석 가능성, 투명성을 부여하여 신뢰할 수 있는(trustful) AI 개발 산업에 기여합니다.
Domain/Task 별 SPEC 자동 생성 파이프라인을 공개하여, 높은 확장성으로 원하는 분야에 얼마든지 적용할 수 있게 합니다.
‘독자 AI 파운데이션 모델 프로젝트’의 안전성 확보 파트에 기여 가능합니다.
똑똑하기만 한 모델이 아닌, 똑똑하면서도 믿을 수 있는 모델로 발돋움할 수 있도록 돕는 것이 저희 밤티 Alignment의 목표입니다.
현재 SPEC 최종 생성과 SFT 학습용 쿼리 준비에 집중하고 있으며,
이어서 학습·평가·해석 가능성 실험을 통해 “거부할 땐 정확히 거부하고, 답할 땐 책임 있게 답하는” 정책 기반 LLM의 기준선을 제시하겠습니다.
긴 글 읽어주셔서 감사합니다!
지금까지 밤(낮없이) 티(나게 열심히 하는) the STRIKER 팀이었습니다!

[1] https://m.boannews.com/html/detail.html?idx=138659
[2] Guan, M.Y. et al. (2024) “Deliberative Alignment: Reasoning Enables Safer Language Models,” arXiv.org [Preprint].
[3] Novikov, A. et al. (no date) “AlphaEvolve : A coding agent for scientific and algorithmic discovery.”
[4] https://tech.kakao.com/posts/690
[5] Luo, W. et al. (2024) “JailBreakV: A Benchmark for Assessing the Robustness of MultiModal Large Language Models against Jailbreak Attacks.”
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.