23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
최근 LLM의 성능이 좋아지면서 한국어 <-> 영어 번역을 많이 활용하고 있습니다.
외국업체에 이메일을 보낼 때나 논문, 기사 중 어려운 문장이 있는 경우, 빠르게 논문이나 기술 자료를 읽어야 할때 자주 사용하는데요.
몇년 전만해도 구글 번역기나 네이버 파파고를 사용했었는데, 요즘은 ChatGPT, Claude, Gemini에 바로 물어보고 빠르게 답을 얻곤 합니다.
최근 업무에서 정식적으로 한영/영한 번역 기능이 필요하여 객관적인 LLM 모델간 성능 비교가 필요했는데,
그동안 제가 개인적으로 했던 번역 성능은 주관적이다 보니 평가지표가 없는지 찾아봤습니다.
LLM 이 평가자가 되어 번역 성능을 평가하는 흥미로운 논문이 있어 리뷰해보려고 합니다.
논문명: A 2-step Framework for Automated Literary Translation Evaluation: Its Promises and Pitfalls
이 연구는 거대 언어 모델(LLM)을 활용한 영어에서 한국어로의 문학 기계번역을 자동화된 방식으로 평가하는 프레임워크를 제안하고, 그 가능성과 한계를 심도 깊게 분석하고 있습니다.
최근 GPT, Claude, Gemini와 같은 LLM 모델들은 나올 때마다 기존의 모델들의 성능을 뛰어넘으며, 전반적인 성능이 빠르게 발전하고 있습니다.
기본적으로 언어간 번역 성능도 뛰어난 편이지만 문학 번역은 단순히 텍스트의 의미를 전달하는 것을 넘어, 미묘한 언어의 미학적, 정서적 사용, 문학적 표현에도 중점을 두어야 합니다.
또한 문화적 맥락이 매우 중요하며, 원문의 뉘앙스, 작가의 의도, 등장인물 간의 관계 등을 섬세하게 포착해야 하기에 일반 기사나 기술자료의 번역보다 난이도가 높은 편입니다.
문제는 이러한 문학 번역의 복잡성 때문에 기존의 성능 평가 지표들, 예를 들어 BLEU나 BLEURT 같은 것들이 문학 번역의 미묘한 뉘앙스를 제대로 평가하지 못한다는 점입니다.
그렇다고 매번 비용이 많이 드는 숙련된 언어 전문가의 평가에만 의존할 수도 없으니,
LLM 에이전트나 파이프라인 개발자들에게 번역이 필요한 기준을 충족하는지 알려줄 수 있는 자동화된, 세분화된 평가 방법이 절실한 상황입니다.
이 논문은 바로 이러한 필요성에서 출발합니다.
이 연구는 문학 번역 평가의 복잡성을 해결하기 위해 두 단계로 구성된 프레임워크를 제안합니다.
프레임워크의 첫 번째 단계는 DA-MQM(Direct Assessment-Multidimensional Quality Metric) 이라고 불립니다.
연구진들은 먼저 기계 번역 시스템이 영어를 한국어로 번역할 때 자주 범하는 네 가지 주요 오류 유형을 식별했습니다.
단어/구/표현 문제: LLM은 지나치게 직역하여 비유적인 표현 등에서 어색하거나 부자연스러운 한국어 단어를 선택할 수 있습니다.
문맥 관련 문제: 문화적, 역사적 뉘앙스가 종종 사라집니다. 예를 들어, 'abolitionist(노예제 폐지론자)'와 같은 용어는 한국어에 직접적인 역사적 대응어가 없어 혼란스러운 번역으로 이어질 수 있습니다.
형식 관련 문제: 구두점, 문장 구조, 일관성 없는 이름 표기 등의 문제는 글의 흐름을 방해할 수 있습니다.
경어법(Honorifics): 이는 한국어에서 매우 중요한 요소입니다. 관계와 사회적 지위를 반영하는 복잡한 경어법 체계가 MT 시스템에 의해 잘못 해석되어 부자연스럽거나 틀린 대화로 이어지는 경우가 많습니다.
이를 위해 전문가들이 직접 설계한 세분화된 평가 rubric (Extensive human curated rubric)을 사용하며,
이 루브릭은 영어-한국어 번역에서 흔히 발생하는 기계번역 오류 유형을 감지하도록 특별히 고안되었습니다.
어휘 선택 (Lexical Choice): 숙어 표현 및 전반적인 단어 선택이 목표 언어의 유창성을 얼마나 잘 보여주는지 평가합니다.
대화에서의 적절한 존대법 사용 (Proper Use of Honorifics in Dialogues): 한국어만의 고유한 특성으로 문학 텍스트에서도 특히 중요한 요소입니다.
존댓말과 반말이 명확하게 구분되어 있는 한국어에서 대화 참여자들의 사회적 지위와 관계를 정확히 반영하는 동사 어미 선택이 자연스러운 한국어 대화를 만들어내는지 평가합니다.
존대법 오류는 독자의 독서 경험에 부정적인 영향을 줄 수 있습니다.
구문 및 문법 (Syntax and Grammar): 문장의 문법적 정확성, 삽입절, 접속사, 문장 연결의 적절성, 문장의 내부 논리 및 구두점 등을 평가하여 한국어로 번역문이 얼마나 자연스럽게 읽히는지 확인합니다.
내용 정확도 (Content Accuracy): 원문의 의미를 얼마나 잘 보존하고 있는지, 특히 문학적 표현이 제대로 번역되었는지 평가합니다.
명확성을 위해 일부 추가나 생략이 있을 수 있지만, 원문의 내용과 맥락에 필수적인 중요한 단어나 구절이 변경되거나 생략되어서는 안 됩니다.
DA-MQM 단계에서는 LLM이 1점부터 5점까지의 척도로 점수를 부여합니다.
기술적으로 완벽한 번역이 반드시 훌륭한 '문학적' 번역은 아닙니다.
VERSE(VERification-based Story-specific Evaluation) 라고 명명된 두 번째 단계는 원작의 고유한 문학적 특성이 잘 보존되었는지를 평가하여 이 문제를 해결합니다.
작동 방식은 다음과 같습니다.
질문 생성: 뛰어난 성능의 LLM(이 연구에서는 GPT-4)에게 원문과 이야기 요약을 컨텍스트로 제공하고, 특정 단락의 문학적 측면에 대한 검증 질문 목록을 생성하도록 지시합니다.
이 질문들은 텍스트의 문학적 구조를 더 깊이 파고들도록 설계되었습니다.
평가: 다른 LLM이 심사관 역할을 하여, 생성된 질문들을 바탕으로 기계 번역 결과물을 1점에서 3점 척도(1점=불만족, 2점=부분 만족, 3점=완전 만족)로 평가합니다.
먼저 고성능 LLM 모델 (이 연구에서는 GPT-4o)이 성공적인 문학 번역에 필요한 검증 질문 목록을 생성합니다.
해당 질문들은 역사적 및 문화적 맥락, 이미지 및 묘사 품질, 인물화, 대인 관계 역학, 관용적 자연스러움, 미묘한 함의, 서사적 속도 및 리듬, 문체적 공명, 전반적인 일관성 및 응집력 등 다양한 문학적 측면을 고려합니다.
그다음, 또 다른 LLM 모델이 이 질문들을 기반으로 기계번역이 해당 기준을 충족하는지 1점에서 3점 척도로 평가합니다.
이 프레임워크는 기존 지표들이 놓치는 문학적인 측면에서의 번역의 섬세한 부분을 고려한 평가라고 할 수 있습니다.
연구진들은 이 평가를 더 쉽게 해석할 수 있도록 LLM이 생성한 질문을 어조(Tone), 스타일(Style), 속도(Pacing), 역사적 배경(Historical Context) 등 9개 카테고리로 분류했습니다.
아래의 레이더 차트는 각기 다른 이야기가 어떤 문학적 측면에 중점을 두어야 하는지를 시각화하여 보여줍니다.
그렇다면 이 프레임워크는 실제로 얼마나 효과적일까요?
연구진들은 자신들의 접근 방식을 검증하기 위해 광범위한 인간 평가를 수행했습니다.
DA-MQM, VERSE 두 단계 모두에서 LLM 기반 평가는 COMET, BERTScore, BLEURT와 같은 전통적인 지표보다 인간의 판단과 훨씬 높은 상관관계를 보였습니다.
특히 VERSE 단계는 다른 방법으로는 얻기 힘든, 문학적 품질에 대한 새롭고 세분화된 분석을 가능하게 합니다.
아래 레이더 차트(논문의 그림 3)에서 볼 수 있듯이, 특정 이야기에 대해 여러 번역 모델이 다양한 문학적 차원을 어떻게 처리하는지 시각화할 수 있습니다.
그림 3: "The Philosopher" 이야기에서 각 모델의 번역에 대한 카테고리별 점수를 나타내는 레이더 차트.
유망한 결과에도 불구하고, 이 연구는 평가자로서 현재 LLM의 몇 가지 주요 한계를 지적합니다.
인간 평가자 간의 합의 수준에 도달 실패: 가장 성능이 좋은 GPT-4o조차도 인간 전문가들 사이에서 나타나는 합의 수준에는 미치지 못했습니다.
LLM이 생성한 번역에 대한 편향: 흥미롭고 중요한 발견은 평가자 LLM이 전문 인간 번역가의 번역보다 다른 LLM이 생성한 번역을 선호하는 경향이 있다는 것입니다.
한 이야기에 대한 A/B 테스트에서 인간 평가자는 50번 중 39번을 전문 인간 번역이 더 낫다고 선택했지만, 가장 높은 점수를 받은 LLM 번역은 단 4번 선택되었습니다.
전문 번역가가 언어적 뉘앙스를 포착하기 위해 원문에서 더 과감하게 벗어나는 경향이 있는데, LLM 평가자는 이러한 전략에 불이익을 주는 것으로 보인다고 분석됩니다.
이 연구는 LLM을 문학 텍스트의 세밀한 평가를 위한 자동화된 도구로 사용하는 가능성을 탐구했으며,
LLM이 유용한 통찰력을 제공하고 기존 지표보다 인간 판단에 더 가까워지고 있음에도 불구하고, 여전히 인간의 판단을 완전히 대체하기에는 한계가 있음을 명확히 보여줍니다.
특히, 한국어의 존대법과 같은 문화적, 언어적 특성을 LLM이 완벽하게 이해하고 평가하는 데는 더 많은 연구가 필요하다는 점이 중요한 시사점으로 다가옵니다.
LLM은 분명 "아주 좋은" 번역과 "아주 나쁜" 번역을 구분하는 데는 뛰어나지만, 높은 품질의 번역물들 사이에서 미묘한 차이를 구별하는 능력은 아직 부족합니다.
하지만 이 프레임워크는 문학 번역에 특화된 해석 가능한 지표를 제공하며, 언어에 구애받지 않고 구현하기 쉽다는 장점이 있습니다.
앞으로는 영어-한국어 외의 다른 언어 쌍으로 확장을 통해 LLM이 다양한 문화적 맥락을 고려할 수 있는지 탐색하는 연구가 필요할 것입니다.
이 연구는 문학 기계번역 평가의 중요한 진전을 보여주면서도, 동시에 우리가 넘어서야 할 도전 과제들을 명확히 제시하고 있습니다.
개인적으로는 Anthropic의 Claude 모델이 제가 좋아하는 문체라서 선호합니다.
Claude Sonnet 모델 버전별로 번역 테스트를 해봤는데 3.5 이상부터는 3.7, 4 모두 크게 차이를 느끼진 못했었습니다.
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.