23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요. SK텔레콤에서 검색/추천 모델링을 담당하고 있는 김선겸입니다.
오늘 Reasoning 모델 기반의 AI 검색 고도화의 주제로 이야기 해 보려고 합니다.
AI 검색 이전에는 주로 키워드 매칭이나 임베딩 기반 벡터 유사도를 기반으로 Relevance Score가 높은 Top-N 결과를 사용자에게 제시하는 방식으로 정보를 제공해 왔습니다.
이 접근 방식은 빠르고 효율적인 검색을 가능하게 했지만, 질문의 의도나 문맥에 대한 이해가 부족해 사용자가 직접 결과를 해석하고 선택해야 하는 한계를 지니고 있었습니다.
특히 복잡한 정보의 연결이나 다단계 추론이 필요한 고차원 질의에서는 이러한 방식의 한계가 더욱 뚜렷하게 드러납니다.
이러한 한계를 극복하고자 최근에는 Reasoning 능력을 내재한 대형 언어 모델이 검색 시스템에 통합되고 있습니다.
단순히 관련 정보를 나열하는 데 그치지 않고, 사용자의 질문을 단계적으로 분석하고 논리적으로 사고하여
최종 답변을 직접 도출하거나 보다 명확한 정보로 정리해 제시하는 형태로 진화하고 있는 것입니다.
이번 글에서는 Reasoning 모델의 핵심 개념과 주요 특징을 살펴본 뒤, 대표적인 추론 방식인 Chain-of-Thought(CoT)의 활용법과 이를 기반으로 한 모델 학습 과정에 대해 소개합니다.
또한 이러한 Reasoning 기반 언어 모델이 실제 SKT AI 검색 시스템과 어떻게 결합되어 고도화를 이끌고 있는지도 함께 살펴보겠습니다.
전통적인 대형 언어 모델(LLM)들이 문맥을 기반으로 한 언어 생성 및 예측에 집중했던 것과 달리,
Reasoning 모델은 문제 해결 과정에서 인간의 사고 과정을 모방하여, 더 깊고 체계적인 사고를 가능하게 합니다.
Reasoning 모델의 핵심 개념과 특징에 대해 알아보도록 하겠습니다.
Reasoning 모델의 핵심 개념
Chain-of-Thought(CoT)
CoT는 문제를 한 번에 해결하려고 시도하는 대신, 이를 여러 하위 단계로 세분화하여 단계별로 사고 과정을 전개해 나가는 방식입니다.
이 기법은 모델이 각 단계에서 중간 추론을 명시적으로 수행하게 유도함으로써, 복잡한 문제라도 보다 체계적이고 논리적으로 접근할 수 있도록 만듭니다.
결과적으로 CoT를 적용하면 모델이 인간처럼 "생각을 풀어가는 과정"을 모방하며, 최종 결론에 도달하는 과정을 투명하게 보여줄 수 있습니다.
Tree-of-Thought(ToT)
ToT는 사고 과정을 단일 경로로 제한하지 않고, 여러 가능한 추론 경로를 동시에 생성하여 탐색하는 접근 방식입니다.
문제 해결을 위해 다양한 가설이나 방법을 고려하고, 각각의 경로를 평가하면서 가장 합리적이고 타당한 답을 선택하는 전략을 취합니다.
이 과정에서 비효율적이거나 부정확한 경로는 가지치기(pruning)하고, 유망한 경로는 더욱 깊게 탐색해 나갑니다.
ToT는 CoT보다 훨씬 더 복잡하고 다양한 가능성을 포괄할 수 있으며, 특히 경로 선택이나 탐색 최적화가 중요한 문제 상황에서 강력한 성능을 발휘합니다.
Reasoning 모델의 특징
Reasoning 모델은 복잡한 수학 문제, 논리적 추론, 코딩 문제처럼 단일 답변 생성만으로는 쉽게 해결할 수 없는 과제들에 대해 탁월한 성능을 발휘합니다.
이 모델은 문제를 해결하는 과정에서 단계별 사고 과정을 명시적으로 노출함으로써, 단순한 정답 예측을 넘어 보다 깊이 있고 신뢰성 있는 문제 해결을 가능하게 만듭니다.
특히 Reasoning 모델은 다음과 같은 주요 장점을 가지고 있습니다
높은 정확도
Reasoning 모델은 문제를 여러 단계로 분해하고 각 단계에서 검증 가능한 추론을 거치기 때문에, 전체적인 오답률이 크게 낮아집니다.
단순히 직관에 의존하는 답변보다, 체계적으로 축적된 추론을 기반으로 한 답변이기 때문에 정확성이 한층 강화됩니다.
해석 가능성
모델이 사고 과정을 외부에 투명하게 드러내기 때문에, 사용자는 답변이 어떻게 도출되었는지 구체적인 설명을 확인할 수 있습니다.
이러한 해석 가능성은 특히 고신뢰가 요구되는 분야(예: 의료, 법률, 과학)에서 모델의 활용 가치를 크게 높여줍니다.
안정성 향상
Reasoning 모델은 문제 해결의 각 단계를 점검하는 구조를 가지고 있어,
중간 추론 과정에서 발생할 수 있는 오류나 비현실적인 답변 생성(일명 "환각(hallucination)" 현상)을 줄이는 데 매우 효과적입니다.
이를 통해 모델의 답변 신뢰성과 일관성이 한층 강화됩니다.
결국, Reasoning 모델은 단순 정답 생성 모델을 넘어, "왜"라는 질문에 답할 수 있는 설명력과, 복잡한 문제를 다루는 데 필요한 높은 정확도와 안정성을 함께 제공하는 방향으로 진화하고 있습니다.
Reasoning 모델과 non-reasoning 모델의 성능 비교
Deepseek-R1(reasoning) 과 DeepSeek-V3(non-reasoning)
대부분의 벤치마크 결과에서 DeepSeek-R1(Reasoning 모델)이 DeepSeek-V3(Non-Reasoning 모델) 대비 더 높은 성능을 보이는 것을 확인할 수 있습니다.
특히 AIME 2024, Codeforces, GPQA Diamond와 같은 벤치마크에서는 두 모델 간 성능 차이가 두드러지게 나타납니다.
이러한 결과는 수학, 과학, 프로그래밍처럼 추론이 요구되는 도메인에서 Reasoning 모델이 더욱 효과적임을 보여줍니다.
다만, 일부 벤치마크에서는 DeepSeek-R1의 성능이 더 높긴 하지만 그 차이가 크지 않은 경우도 관찰됩니다.
GPT모델의 성능 비교 : GPT-4o mini VS. o3-mini
비용 효율성과 추론 속도 측면에서 우수한 GPT-4o mini와 GPT-o3-mini를 비교한 결과는 위와 같습니다.
두 모델은 아키텍처와 파라미터 규모에서 차이가 있기 때문에 절대적으로 공정한 비교는 어렵지만, Reasoning 특화 모델인 GPT-o3-mini는 전반적인 성능 면에서 우위를 보였습니다.
특히 수학, 논리, 코드 생성 등 고차원 추론이 요구되는 과제에서는 성능 격차가 더욱 명확하게 드러났습니다.
GPT모델의 성능 비교 : GPT-4o VS. o3-min
GPT-4o mini의 상대적으로 낮은 성능을 고려하여, 동일 계열의 상위 모델인 GPT-4o와 성능을 비교해보았습니다.
그 결과, AIME 및 Codeforces와 같은 고난도 추론 중심의 벤치마크에서는 두 모델 간 성능 차이가 뚜렷하게 나타났으며,
반면 MMLU나 Simple QA처럼 비교적 단순한 언어 이해 과제에서는 GPT-4o mini가 오히려 더 우수한 성능을 보이기도 했습니다.
앞서 Reasoning 모델의 핵심 개념인 Chain of Thought(CoT)에 대해 간략히 설명했으며,
이번에는 CoT를 활용하는 주요 접근 방식인 Zero-Shot Prompting, In-Context Learning, 그리고 Fine-tuning Model기반 접근법에 대해 보다 구체적으로 살펴보겠습니다.
Zero-Shot CoT
특징
Zero-Shot CoT는 별도의 예시나 추가 학습 없이, 프롬프트에 간단한 지시문(예: "Let's think step by step")만을 추가하여 모델이 자체적으로 단계별 추론을 수행하도록 유도하는 방법입니다.
즉석에서 모델이 내재된 지식을 활용하여 문제를 여러 단계로 분해해 해결할 수 있도록 합니다.
장점
복잡한 예시 없이도 간단한 지시문만으로 적용 가능하여 매우 빠르고 간편합니다.
별도 추가 학습 없이, 모든 작업에 범용적으로 사용될 수 있습니다.
모델이 추론 과정을 서술함으로써, 답변의 신뢰성과 가독성을 자연스럽게 높입니다.
한계
모델 규모가 충분히 크지 않으면 효과가 제한적입니다.
생성된 단계별 추론 과정의 정확성이 항상 보장되지 않습니다.
Few-shot 방식에 비해, 복잡한 문제에 대한 성능 향상 폭이 다소 낮을 수 있습니다.
In-Context Learning 기반 CoT
특징
In-Context Learning에서는 몇 가지 few-shot examples을 프롬프트에 함께 제공하여, 모델이 이를 본떠 새로운 문제를 해결하도록 유도합니다.
이 방식은 예시를 통해 모델에게 문제 해결의 패턴을 학습시키고, 보다 정교한 추론 과정을 진행하게 만듭니다.
장점
적절한 예시를 제공하면, 복잡한 문제에서도 높은 정확도를 기대할 수 있습니다.
모델을 새로 재학습할 필요 없이, 프롬프트 구성만으로 성능을 향상시킬 수 있습니다.
모델이 추론 과정을 명시적으로 출력하여, 사용자가 답변의 근거를 명확히 이해할 수 있습니다.
한계
작업마다 적합한 예시를 설계해야 하므로 프롬프트 작성에 부담이 있습니다.
예시를 많이 추가할 경우 입력 토큰 길이 제한에 부딪힐 수 있습니다.
예시와 유사한 문제에만 성능이 최적화되기 때문에, 전혀 다른 문제 유형에서는 효과가 떨어질 수 있습니다.
Fine-tuning Model 기반 CoT
특징
Fine-tuning Model 방식은 대규모의 연쇄 사고 학습 데이터를 통해 모델 자체를 튜닝하여, 질문을 받으면 내재적으로 단계별 추론을 수행하도록 모델을 학습시키는 방법입니다.
프롬프트에 별도 지시문 없이도, 모델이 알아서 사고 과정을 서술하는 응답을 생성할 수 있습니다.
장점
비교적 작은 모델이라도 튜닝을 통해 고난도 문제 해결 능력을 대폭 향상시킬 수 있습니다.
일관된 단계별 설명을 자동으로 생성하므로, 사용자는 별도의 조작 없이 추론 과정을 확인할 수 있습니다.
특정 과제에 한정되지 않고, 다양한 문제 유형에 대해 전반적인 추론 능력을 동시에 개선할 수 있습니다.
한계
대량의 양질의 학습 데이터 수집과 미세 튜닝 과정에서 막대한 계산 비용이 발생합니다.
튜닝 과정에서 특정 데이터 분포에 편향될 위험이 있어, 새로운 유형의 문제에는 적용이 어려울 수 있습니다.
부적절한 튜닝은 모델의 추론 신뢰도를 저하시키거나, 기존에 학습된 정보를 상실할 위험이 있습니다.
기본적으로 Reasoing 모델로 학습 시키는 방법은 Foundation model을 기반으로 CoT 형식의 Post-Training 기법으로 Reasoning 성능을 높이게 됩니다.
이번 섹션에서는 최근 공개된 DeepSeek-R1 논문을 분석하여, 최신 Reasoning 모델의 학습 방법과 주요 특징을 살펴봅니다.
특히, Base LLM에 대한 Post-Training 기법에 대해서 자세하게 알아보도록 하겠습니다.
DeepSeek-R1-Zero
DeepSeek-V3-Base 모델을 기반으로 순수 강화학습 기반 Reasoning 모델입니다.
강화 학습 알고리즘으로 GRPO(Group Relative Policy Optimization)가 채택되었습니다.
GRPO는 일반적으로 정책 모델과 같은 크기의 비평가 모델을 사용하지 않고 그룹 점수에서 Base Line을 추정하여 학습 비용을 절감합니다.
DeepSeek-R1-Zero의 Prompt 형식
DeepSeek-R1-Zero는 추론 과정과 최종 답변을 명시적으로 구분하는 특수한 프롬프트 형식을 도입했습니다.
A conversation between User and Assistant.
The user asks a question, and the Assistant solves it.
The assistant first thinks about the reasoning process in the mind and then provides the user with the answer.
<think> reasoning process here </think>
<answer> answer here </answer>정확도 보상: 응답이 올바른지 평가합니다. 예를 들어, 수학 문제는 지정된 형식(예: 상자 안)으로 최종 답을 제공해야 하며, 코딩 문제는 컴파일러와 미리 정의된 테스트 케이스를 사용하여 피드백을 생성합니다.
형식 보상: 모델이 생각 과정(reasoning process)을 <think> 및 </think> 태그 사이에 넣도록 강제하는 보상입니다.
DeepSeek-R1-Zero의 모델의 정확도가 학습 과정에서 안정적으로 상승
*DeepSeek-R1-Zero의 training step에 따라서 LLM의 응답 생성 길이가 길어짐
Aha Moment
모델이 단순한 기계적 계산이 아니라, 마치 인간처럼 “생각하고”, “재검토”하며 “반성”하는 과정을 보여주고 있습니다.
강화학습을 통한 모델의 자율 발전 및 복잡한 문제 해결 능력 향상의 중요한 예시로 해석됩니다.
DeepSeek-R1-Zero는 강력한 추론 능력과 순수 강화 학습 기반으로 Reasoning 모델의 학습이 가능하다는 것을 보여주었습니다.
반면 몇가지 문제점도 있었습니다. 가독성이 떨어지고 언어 혼합과 같은 문제점이 대표적이 사례입니다.
DeepSeek-R1
Cold Start
DeepSeek-R1-Zero모델의 결과를 사람이보정해서 정확도 높은 데이터로 보정했습니다.
학습 초기에 모델을 Supervised fine-tuning(SFT)로 진행해서 강화학습 초기에 불안정한 초기 단계를 완화시켰습니다.
Reasoning-oriented Reinforcement Learning
명확한 해답이 있는 잘 정의된 문제를 포함하는 코딩, 수학, 과학 및 논리 추론과 같이 추론에 적합한 데이터를 기반으로 모델의 추론 능력을 높이기 위한 학습 단계입니다.
DeepSeek-R1-Zero에서 사용된 것과 동일한 대규모 강화 학습(RL) 훈련 프로세스를 적용했습니다.
Rejection Sampling and Supervised Fine-Tuning
이 단계에서는 주로 추론에 집중하는 대신 쓰기, 롤플레잉, 기타 범용 작업에서 모델의 역량을 강화하기 위해 다른 도메인의 데이터를 포함해서 학습 했습니다.
RL 수렴 후 생성된 데이터를 걸러내고, 다양한 도메인(글쓰기, 사실 기반 QA 등) 데이터를 포함한 SFT를 추가로 진행하여 모델의 범용성을 확보했습니다.
이를 통해서 Zero에서 다양한 언어가 섞여 나오는 현상을 완화시켰습니다.
80만 개의 샘플 데이터세트를 사용하여 2 epoch 튜닝
Reasoning data 60만개
모델 출력이 혼란스럽거나 읽기 어려운 경우가 있어, 혼합 언어, 긴 문단, 코드 블록이 포함된 Chain-of-Thought(CoT)는 필터링
Non-Reasoning data 20만개
쓰기(Writing), 사실 기반 QA(Factual QA), 자기 인식(Self-Cognition), 번역(Translation) 등과 같은 비추론 데이터
Reinforcement Learning for all Scenarios
모델을 인간 선호도와 더욱 잘 맞추기 위해, 모델의 유용성(Helpfulness)과 무해성(Harmlessness)을 개선하면서 동시에 추론 능력을 향상시키는 것을 목표
Distillation Model
DeepSeek-R1 모델을 Distillation하여 얻어진 작은 모델들은 기반 모델의 종류와 크기에 따라 다양한 성능을 보이지만, Distillation을 통해 작은 모델들도 강력한 추론 능력을 가질 수 있음을 보여 주었습니다.
Qwen, Llama 등 오픈 소스 모델에 약 80만개의 의 증류 데이터를 활용하여 SFT 학습을 수행했습니다.
Distillation Model 또한 벤치마크에서 우수한 성능을 보입니다.
DeepSeek-R1 결론 및 특징
결론
DeepSeek-R1-Zero
강화학습만으로, 콜드스타트 데이터 없이 다양한 작업에서 강력한 성능을 달성하는 순수 RL 접근 방식을 증명.
DeepSeek-R1
콜드스타트 데이터를 활용하고 반복적인 RL 파인튜닝을 적용하여, 여러 작업에서 OpenAI-o1-1217과 견줄 만한 성능을 보이는 강력한 모델로 학습.
개선 방향
일반적인 능력:
DeepSeek-R1은 함수 호출, 다중 턴 대화, 복잡한 역할 수행, JSON 출력 등에서 DeepSeek-V3보다 성능이 떨어짐.
앞으로 장기간의 CoT 활용을 통해 이 부분을 개선할 계획.
언어 혼합 문제:
DeepSeek-R1은 중국어와 영어에 최적화되어 있어, 다른 언어의 질의를 처리할 때 언어 혼용 문제가 발생할 수 있음.
예를 들어, 질의가 영어 또는 중국어가 아닌 다른 언어로 되어 있어도 DeepSeek-R1이 영어로 추론하고 응답할 수 있음.
프롬프트 엔지니어링:
DeepSeek-R1은 프롬프트에 민감하며, few-shot 프롬프트 사용 시 성능이 저하됨. 따라서, 문제 설명과 출력 형식을 직접 명시하는 zero-shot 설정을 권장.
When evaluating DeepSeek-R1, we observe that it is sensitive to prompts. Few-shot prompting consistently degrades its performance. Therefore, we recommend users directly describe the problem and specify the output format using a zero-shot setting for optimal results. |
|---|
소프트웨어 엔지니어링 작업:
향후 버전에서는 rejection sampling이나 비동기 평가 방식을 도입하여 효율을 높일 계획.
지금까지 Reasoning 모델의 특징과 학습 방법에 대해 자세히 살펴보았습니다.
최근 OpenAI에서도 GPT-4.5를 마지막으로, 앞으로의 GPT 모델 발전 방향을 Reasoning 중심으로 설정하고 있습니다.
Reasoning 모델은 현재 뛰어난 성능을 보이며 앞으로의 발전 가능성도 높지만, 기존의 Non-Reasoning 모델과 비교할 때 뚜렷한 단점도 존재합니다.
가장 큰 단점은 바로 추론 속도입니다. Auto-regressive 모델 특성상, 생성해야 할 토큰 수가 많아질수록 최종 결과를 얻기까지 소요되는 시간이 길어질 수밖에 없습니다.
따라서 Reasoning 기반 GPT 모델을 사용할 경우, 간단한 번역과 같은 작업에도 불필요한 사고 과정을 거치는 일이 발생할 수 있습니다.
품질에 큰 차이가 없는 상황에서, 오히려 처리 시간만 늘어나 비효율적인 경험을 제공할 가능성이 있습니다.
이러한 이유로, Reasoning 모델이 꼭 필요한 분야에 효율적으로 적용될 수 있도록 다양한 고도화 작업을 진행하고 있습니다.
앞서 첫 번째 섹션에서 살펴본 성능 그래프의 분석 결과처럼, 문제의 특성에 따라 Reasoning 모델과 Non-Reasoning 모델을 적절히 선택적으로 사용하는 접근이 보다 합리적이라고 할 수 있습니다.
다음으로는, 이러한 Reasoning 모델의 특성을 바탕으로 SKT AI 검색 서비스가 어떻게 고도화를 진행하고 있는지 보다 구체적으로 알아보겠습니다.
Dynamic LLM Selection
AI검색에 유입되는 모든 질문이 동일한 수준의 추론을 요구하는 것은 아닙니다. 질문의 복잡성과 성격에 따라 적절한 LLM을 선택하는 것이 사용자 경험을 최적화하는 핵심입니다.
첫번째 섹션에서 살펴봤던 그래프에서도 그 특징들을 확인 할 수 있습니다.
Reasoning 모델은 비교적 높은 성능을 내기는 하지만, 상대적으로 긴 생성 시간을 요구합니다. 따라서 Task에 적합한 모델을 선택해서 답변을 생성하는 부분은 매우 중요합니다.
시나리오별 모델 적용 예시
Reasoning이 필요 없는 경우
단순 번역이나 요약처럼 복잡한 사고 과정 없이도 해결할 수 있는 질문에는 경량화된 모델을 사용합니다.
예시: "이 문장을 영어로 번역해줘.", "핵심 내용만 요약해줘."
속도가 빠른 Non-reasoning 모델을 사용합니다.
Reasoning이 필요한 경우
수학 문제 풀이, 복잡한 코드 작성 등 논리적 사고를 요구하는 질문에는 고도화된 Reasoning 모델이 필요합니다.
예시: "피타고라스 정리를 증명해줘.", "특정 기능을 가진 프로그램 코드를 작성해줘."
결과의 정확도가 높은 Reasoning 모델을 사용합니다.
AI Search LLM: 검색/추천 특화 Reasoning 모델
정확하고 빠른 AI 검색을 위해서는 서비스의 특성에 최적화된 LLM(Language Model)이 필요합니다.
기존의 일반화된 LLM을 AI 검색 서비스에 적합하게 튜닝하면, 보다 정교하고 사용자 맞춤형 결과를 얻을 수 있습니다.
AI 검색 특화 LLM의 장점
사용자가 정보를 탐색하는 실제 과정을 모델이 학습하여, 사용자의 검색 의도에 최적화된 결과를 제공할 수 있습니다.
LLM 모델의 학습 방향
AI 검색 서비스에 특화된 Reasoning 모델을 구축하기 위해 다음과 같은 학습 방향을 설정합니다.
사람이 정보를 탐색하는 과정을 명확히 이해하고 이를 모델에 반영합니다.
검색 및 추천 과정에서 필요한 Reasoning 능력을 정밀하게 학습합니다.
사용자의 다양한 Context를 복합적으로 고려하여 최적화된 결과를 제공할 수 있도록 모델을 학습합니다.
이러한 학습 방향을 통해 AI Search LLM은 빠르고 정확하며 개인화된 검색 및 추천 경험을 제공합니다.
Deep Research
사용자의 복잡하거나 정보가 분산된 질문에 대해, 다음과 같은 다단계 처리 과정을 통해서 보고서 수준의 답변을 생성하는 기능입니다.
프로세스를 도식화 해보면 아래와 같습니다.
Planning 단계에서 Reasoning 모델을 활용해서 질문/요청에 보다 합리적인 Plan을 세울 수 있습니다.
Reflection 단계에서 현재까지 누적된 정보들을 활용해서 Plan에 최적화된 중간 결과들을 검색하고 정리 할 수 있습니다.
검색 기능에서 적절한 Search Query를 정의하는 부분은 검색결과의 품질과 직결됩니다.
Conclution 단계에서 현재까지 수집된 정보들을 바탕으로 사용자 질문에 적합한 정보들을 체계적으로 정리해서 제공할 수 있습니다.
이처럼 Reasoning 모델은 단순한 정보 제공을 넘어, 복잡한 문제 해결과 고차원적인 추론이 요구되는 AI 검색 환경에서 핵심적인 역할을 수행하고 있습니다.
SKT AI 검색 또한 이러한 Reasoning 모델의 발전 흐름에 맞춰 지속적으로 고도화되며 함께 진화해 나갈 것입니다.
앞으로도 끊임없는 연구와 실험을 통해, 사용자에게 더욱 정밀하고 신뢰할 수 있는 AI 검색 경험을 제공할 수 있도록 최선을 다하겠습니다.
긴 글 끝까지 읽어주셔서 진심으로 감사드립니다.
DeepSeek-AI. (2024). DeepSeek-V3 Technical Report. arXiv preprint arXiv:2412.19437.
DeepSeek-AI. (2024). DeepSeek-V3 Technical Report. arXiv preprint arXiv:2412.19437.
Yao, S., Zhao, J., Yu, D., Du, N., Shafran, I., Narasimhan, K., & Cao, Y. (2023). ReAct: Synergizing Reasoning and Acting in Language Models. arXiv preprint arXiv:2210.03629.
Hao, S., Sukhbaatar, S., Su, D., Li, X., Hu, Z., Weston, J., & Tian, Y. (2024). Training Large Language Models to Reason in a Continuous Latent Space. arXiv preprint arXiv:2412.06769.
https://llm-stats.com/models/compare/gpt-4o-mini-2024-07-18-vs-o3-mini
https://llm-stats.com/models/compare/gpt-4o-2024-08-06-vs-o3-mini
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.