데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      밤티팀: 추론 기반 한국어 AI 성능-안전성 최적화(Task-aware Deliberative Alignment) - 연구계획(1)

      7기_김지윤 25.06.11
      112 1 0
      DEVOTEE 요약
      DEVOCEAN AI Fellowship 팀의 연구는 LLM의 안전성(safety)과 유용성(usefulness)을 동시에 향상시키기 위해 명시적 안전 정책 기반 정렬과 추론 최적화 기술을 개발하고자 합니다. 이를 위해 AI 윤리 강령을 바탕으로 정책 데이터베이스를 구축하고, 모델에 정책 기반 reasoning을 통합하며, 안전 정보를 활용한 Monte Carlo Tree Search 및 self-improvement 루프를 적용합니다. 또한, 안전 정렬의 효과를 입증하기 위해 safety layer 분석 및 시각화를 통해 모델 내부 구조를 투명하게 확인할 계획입니다.
      DEVOTEE 추천 블로그

      안녕하세요~!!

      저희는 DEVOCEAN Ai fellowship 연구과제 02. 추론 기반 한국어 AI 성능-안전성 최적화: Task-aware Deliberative Alignment 프로젝트에 참여하게 된 팀 밤티 the striker 입니다.

      1. 연구 과제 아이디어

      1.1. 연구 배경

      최근 범용 LLM은 다양한 언어, 분야, 응용 환경에서 강력한 성능을 보이며 폭넓게 활용되고 있습니다. 그러나 이와 동시에, **LLM의 안전성(safety)**에 대한 우려도 크게 증가하고 있습니다.

      기존의 LLM의 safety alignment는 주로 간접 데이터를 활용한 Supervised Fine-Tuning(SFT) 또는 Reinforcement Learning from Human Feedback(RLHF) 방식에 의존하고 있습니다.

      이러한 기존 방법은 단순 거절, 필터링 규칙, 혹은 영어권 중심 가치 기반 정책 데이터를 중심으로 이루어지며, 다음과 같은 한계점이 있습니다:

      • 복잡한 윤리적 상황에 대한 심사숙고 부족

        → 유해하지 않은 요청까지도 과도하게 거부하는 over-refusal 발생

      • 많은 양의 기준을 간접적으로 학습→ 새로운 도메인이나 복합적인 상황에서의 robust한 정책 적용 실패

      • 관련 정책 불투명성으로 인한 해석 가능성 부족

        특히, LLM이 준수해야 할 윤리적 원칙이 명확히 정의되지 않은 채, 정렬 기술이 적용되는 경우가 많아, LLM 안전 정책의 기반이 되는 헌법(constitution) 자체를 체계적으로 구성하고 적용하는 접근이 요구되고 있습니다.

      이러한 윤리적 원칙, 안전 정책을 정렬에 도입하고자 한 시도가 OpenAI사의 Deliberative Alignment [1]입니다.


      Fig 1. 기존의 파이프라인

      위와 같이 기존의 정렬 파이프라인에서는 안전 정책이 인간 라벨러에게 제공되며, 모델에는 명시적으로 제공되어지지 않습니다. 그러나 Deliberative Alignment에서는?





      Fig 2. 제안된 deliberative alignment 방식


      이렇듯 SPEC(카테고리화된 안전 정책)을 직접적으로 추론 모델에 제공하여 모델이 CoT 내에서 직접 정책을 참조하고, 이를 최적화하는 방식으로 훈련됩니다.

      더불어, inference 시에 모델에게 추가 리소스를 제공해 모델이 더 나은 응답을 탐색할 수 있도록 했습니다.

      다시 말해, 모델에게 복잡한 문제에 대해 생각할 시간을 넉넉히 주는 거죠.


      이 아이디어에서 출발해 저희는 안전정책을 모델에 직접적으로 학습시켜 사용할 수 있는 새로운 안전 정렬 방식을 제안하려 합니다. 저희 연구의 Key point는 다음과 같습니다:

      1. LLM이 지켜야 할 윤리적 기반(LLM Constitution)을 명문화하고,

      2. 이를 Task, Domain, Purpose 에 따라 구체화한 하위 안전 정책을 제작,

      3. 정책 기반 alignment 및 추론 최적화 기술을 통해,

      4. Safety와 Helpfulness 사이의 trade-off를 최소화하는 안전 정렬

      1.2. 연구 목표

      저희 팀의 연구는 LLM의 **안전성(safety)**과 **유용성(usefulness)**을 동시에 향상시키기 위해, 명시적 정책 기반 정렬 기법과 추론 최적화 프레임워크를 제안합니다.

      1. 범용 LLM의 응답 생성 과정에 정책 기반 reasoning을 삽입하여, 단순 거절을 넘어선 합리적 대응을 가능하게 함

      2. 다양한 도메인과 태스크 상황을 인식하고, 적절한 정책을 적용할 수 있는 안전 정렬 시스템 구축

      3. 구조화된 CoT 기반 학습 데이터셋 생성 및 SFT 진행

      4. **보상 모델(PRM)과 Monte Carlo Tree Search(MCTS)**를 결합한 추론 최적화 및 self-improvement 루프 구현

      5. LLM 내부의 해석 가능성확보를 위한 Safety Layer 분석 및 시각화 실험 수행

      2. 연구 과제 수행 계획

      2.1. 연구 과정

      저희의 연구는 크게 정책 생성 파이프라인과 안전 정렬, 그리고 해석 가능성 세 파트로 나누어 설명할 수 있습니다.

      2.1.1. 정책 생성 파이프라인

      정렬을 위한 Policy DB를 제작합니다.

      국제 기구, 상용 LLM 회사 등에서 공개하고 있는 AI 윤리 강령들을 참고해 LLM이 응답할 때 지켜야 할 constitution을 작성하고,

      이 constitution을 기반으로 SPEC(constitution, purpose, task, domain)을 생성해 alignment의 기준 및 적용 범위를 결정합니다.

      ShieldAgent라는 규칙 구조화 모델[2]을 사용해 정책 초안을 더 고차원적인 규칙으로 반환합니다.

      ShieldAgent는 **정책 문서에서 검증 가능한 규칙을 추출하여 구조화된 안전 정책 모델(ASPM)**을 구축하고, 이를 활용하여 에이전트의 행동을 검증하는 파이프라인을 갖추고 있습니다.

      ASPM을 구축하는 데 사용한 프레임워크를 저희가 만든 정책 초안에 도입해 구조적인 효율성을 갖추려 합니다.


      Fig 3. ShieldAgent의 정책 구조화


      더불어, 특정 도메인(전문 분야)은 보안 등의 여러가지 이유로 안전 기준을 공개하지 않는 경우가 있습니다.

      따라서, 저희는 기존에 존재하지 않는 도메인 정책 DB를 구축하기 위해 해당 도메인의 유해 대화 데이터(유해한 응답을 이끌어내기 위한 jailbreak 프롬프트 등)를 이용해 정책 초안을 작성하려 합니다.

      이를 통해 Domain/Task에 특화된 안전 정책을 수집할 수 있고, 발생했던 jailbreak로부터 관련 정책을 생성하는 것이므로 효율적인 정책 구축이 가능해집니다.

      실제 있었던 유해 쿼리와 관련된 정책을 생성하니, 유해 사용자가 주로 노리는 부분에 대한 대응을 강경하게 할 수 있는 것이죠.


      Fig 4. 제안할 policy DB 구축 파이프라인

      2.1.2. 안전 정렬 프레임워크

      저희의 안전 정렬 연구의 기반이 되는 선행연구 STAIR 프레임워크[3]입니다.


      Fig 5. STAIR Overview


      이 논문의 핵심은 다음과 같습니다:

      1. 구조화된 CoT 추론 능력을 SFT를 통해 부여하고,

      2. 자체 개발한 안전 정보 기반 몬테카를로 트리 탐색(Safety-Informed Monte Carlo Tree Search, SI-MCTS)을 사용하여 생성된 단계별 추론 데이터에 대한 반복적인 **선호도 최적화(step-level DPO)**를 통해 안전 정렬을 발전시키며,

      3. 이 데이터로 프로세스 보상 모델(Process Reward Model, PRM)을 학습시켜 테스트 시 탐색을 유도한다

        는 것인데요, 상당히 복잡하게 들리지만 CoT를 구조화하고, 그 구조화된 CoT를 몬테 카를로 트리의 노드로 취급하여 여러가지 응답을 시뮬레이션해보고, 최적의 응답을 선택한다는 점에서 deliberative alignment의 ‘심사숙고’ 아이디어와 궤를 같이 한다! 정도로 볼 수 있습니다.


        Fig 6. Monte-Carlo Tree Search


        또한, 많이 사용되는 외부 LLM(특히 GPT)의 보상이 아닌, 모델 스스로 보상을 주며 자가개선한다는 점에서 모델 자체의 잠재력을 충분히 사용할 수 있고, 비용효율적이므로 여러 번 반복할 수 있다는 장점이 있습니다.


        Fig 7. self-improvement loop


      저희는 Deliberative Alignment의 명시적 정책 사용과 STAIR의 SI-MCTS, self-improvement의 장점을 합친 명시적 정책 기반 안전 정렬을 구현할 것입니다.

      2.1.3. 해석가능성

      안전 정렬이 성공적으로 마무리되었는지 어떻게 확인할 수 있을까요? 물론 여러 평가지표와 벤치마크가 있지만, 모델 내부적으로도 이를 확인해볼 수 있습니다. 바로 safety layer라는 개념입니다.

      Safety layer이란, 정렬된 LLM에서 악의적인 질의를 구별하고 보안을 유지하는 역할을 하는 레이어를 말합니다. 이 레이어 집단을 콕 집어내기 위해 레이어를 pruning하여 응답을 비교하거나[5], hidden layer의 코사인 유사도를 비교하는[4] 등 여러 접근방식 연구가 이루어지고 있는데요, 저희는 후자의 코사인 유사도 방식을 택해 layer-wise한 해석을 시도하려 합니다.

      추론 단계에서 정상 쿼리와 악의적인 쿼리를 각 정렬된 LLM에 입력하고, 각 hidden layer의 마지막 출력 벡터를 추출합니다. 그리고 각 레이어에 대해 다음 두 시나리오에서의 코사인 유사도를 계산했을 때, 특정 레이어부터 상당한 분포 차이가 나타나고 후속 레이어에서 수렴하는 것을 관찰했으며, 이는 safety layer의 존재를 시사합니다.


      Fig 8. safety layer(2024) 논문의 실험


      초반 레이어에서는 각도 차이가 거의 없지만, 중간 레이어부터 차이가 벌어지고 가속화된 후 수렴하는데,

      이는 LLM이 이 레이어에서 악의적인 쿼리를 구별하기 시작했음을 나타냅니다. 안전 정렬이 수행되지 않은 사전 학습된 LLM에서는 이러한 각도 차이가 관찰되지 않았으며,

      이는 안전 레이어가 안전 정렬의 결과임을 보여줍니다.

      저희는 이 safety layer 시각화를 안전 정렬 실험 전후로 시행해, 모델 내부 구조를 투명하게 밝히며, 성공적으로 safety layer가 형성되었음을 확인하려 합니다.

      2.2. 연구 일정


      3. 팀 소개

      Team 밤티 The Striker


      밤티.png

      “넘버원”이 될때까지 밤낮없이 달리는 스트라이커 팀 밤티 the striker 입니다.

      참고 문헌

      [1] Guan, M. Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Helyar, A., ... & Glaese, A. (2024). Deliberative alignment: Reasoning enables safer language models. arXiv preprint arXiv:2412.16339.

      [2] Chen, Z., Kang, M., & Li, B. (2025). Shieldagent: Shielding agents via verifiable safety policy reasoning. arXiv preprint arXiv:2503.22738. https://arxiv.org/abs/2503.22738

      [3] Zhang, Y., Zhang, S., Huang, Y., Xia, Z., Fang, Z., Yang, X., Duan, R., Yan, D., Dong, Y., & Zhu, J. (2025). STAIR: Improving safety alignment with introspective reasoning. arXiv preprint arXiv:2502.02384.

      [4] Li, S., Yao, L., Zhang, L., & Li, Y. (2024). Safety layers in aligned large language models: The key to LLM security. arXiv. https://arxiv.org/abs/2408.17003 (Accepted at ICLR 2025)

      [5] Zhao, W., Li, Z., Li, Y., Zhang, Y., & Sun, J. (2024). Defending large language models against jailbreak attacks via layer-specific editing. arXiv. https://arxiv.org/abs/2405.18166 (Accepted at EMNLP 2024)

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      7기_김지윤 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기