23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요. DEVOCEAN AI Fellowship 7기에서 Computer Use Agent(CUA) 프로젝트를 진행 중인 장교철입니다.
이번 포스트에선 한국에서는 많이 알려지지 않은 CUA에 대한 배경 개념들과 최근 CUA 분야에는 어떤 연구들이 진행되고 있는지 설명드리려고 합니다.
Computer Use Agent를 소개하기에 앞서, 그 기반이 되는 핵심 모델 중 하나인 MLLM(Multi-modal Large Language Model)의 개념을 간단히 설명드리겠습니다.
MLLM(Multi-modal Large Language Model)은 텍스트 외에도 이미지, 비디오, 오디오 등 다양한 형태의 입력을 처리하고 이해할 수 있는 LLM을 의미합니다.
기존 LLM이 자연어를 중심으로 훈련되었다면, MLLM은 이러한 언어 처리 능력을 시각 혹은 청각과 같은 다양한 모달의 정보와 결합함으로써 더욱 풍부한 이해와 응답 생성을 가능하게 합니다.
대표적인 사용 예시로는 이미지를 설명하거나, VQA, Web Interaction Agent, 그리고 action이라는 Modal을 추가한 로봇 perception-action loop 등이 있습니다.
Transformer의 등장으로 텍스트를 임베딩해서 다음 토큰을 생성할 수 있게 된 것처럼, 이미지를 1차원으로 임베딩 한 후 다음 픽셀을 생성하는 방식으로 MLLM이 발전하게 되었습니다.
MLLM의 연구들은 순서대로 ViT, CLIP, BLIP, BLIP-2, SigLIP이 있습니다.
ViT (2020, Dosovitskiy et al.)
ViT(Vision Transformer)는 이미지를 입력받아 패치 단위로 인코딩하는 Transformer 기반의 시각 인코더입니다. 이미지를 고정된 크기의 패치로 나눈 뒤, 각 패치를 벡터로 변환해 Transformer의 입력 시퀀스로 사용하고, 여기에 위치 정보를 더해 Self-Attention을 통해 패치 간의 전역적인 관계를 학습합니다. 최종적으로 [CLS] 토큰을 통해 전체 이미지를 대표하는 임베딩을 생성하며, CNN과 달리 국소 필터 없이도 이미지 내 구조적 관계를 효과적으로 이해할 수 있는 것이 특징입니다.
CLIP (2021, Radford et al., OpenAI)
CLIP(Contrastive Language–Image Pretraining)은 이미지와 텍스트 간 의미적 연관성을 학습하는 범용 멀티모달 인코더입니다. 이미지와 텍스트를 각각 ViT(또는 ResNet)와 Transformer로 인코딩한 후, 해당 쌍이 서로 잘 매칭되는지를 contrastive loss를 통해 학습합니다. 학습된 모델은 자연어로 설명된 개념을 이미지와 연결하는 데 매우 강력하며, 사전학습만으로 다양한 멀티모달 태스크에 zero-shot으로 적용 가능하다는 점에서 큰 영향을 끼쳤습니다.
BLIP (2022, Li et al.) \ BLIP-2 (2023, Li et al.)
BLIP(Bootstrapped Language-Image Pretraining) 시리즈는 이미지-텍스트 쌍의 관계를 이해할 뿐 아니라, 자연어 생성을 수행할 수 있는 멀티모달 생성 모델입니다. BLIP는 이미지에서 설명을 생성하거나 질문에 답하는 태스크에 강점을 가지며, BLIP-2는 vision encoder와 대형 LLM 사이에 lightweight한 Q-former 모듈을 두어 정보 전달을 효율적으로 만듭니다. 이 구조는 이미지 입력을 통해 자연어 응답을 생성하는 instruction-following MLLM의 기반이 되었습니다.
SigLIP (2024, Touvron et al.)
SigLIP(Sigmoid Loss for Language-Image Pretraining)은 CLIP의 개선 버전으로, contrastive learning 시 softmax 기반의 cross-entropy loss 대신 sigmoid 기반의 binary loss를 사용합니다.
이 방식은 쌍마다 독립적으로 정합 여부를 학습하므로 학습이 더 직관적이고 확장성이 뛰어나며, 특히 대규모 데이터에서 안정적인 성능을 보입니다.
구조적으로는 CLIP과 유사하지만, 학습 방식의 차이를 통해 멀티모달 표현 학습의 효율성과 성능을 모두 향상시켰습니다.
LLM 그리고 MLLM의 발전, 그리고 모델의 크기와 표현 능력이 비약적으로 증가함에 따라, 단순한 텍스트 생성기를 넘어 실제 환경과 상호작용할 수 있는 AI Agent의 가능성도 함께 열리게 되었습니다.
AI Agent는 주어진 목표를 달성하기 위해 환경과 지속적으로 상호작용하며, 계획을 수립하고 도구를 사용하며 행동을 실행하는 지능형 시스템입니다.
최근에는 대형 언어 모델을 기반으로 한 언어 중심의 agent가 등장하면서,
자연어 명령을 이해하고 복잡한 문제를 단계적으로 해결하거나 다양한 디지털 환경에서 자율적으로 작업을 수행하는 사례가 빠르게 증가하고 있습니다.
AI Agent는 일반적으로 네 가지 핵심 구성 요소인 planning, tool use, action, memory를 기반으로 작동합니다.
Planning은 주어진 목표를 달성하기 위한 일련의 작업 순서를 설계하는 과정이며, tool use는 외부 도구나 API를 호출하여 작업을 수행하는 단계입니다.
Action은 실제로 계획된 작업을 실행하는 것을 의미하며, memory는 과거의 작업 기록이나 상태를 저장하고 이를 기반으로 이후 판단에 반영하는 역할을 합니다.
이처럼 AI Agent는 단순한 응답 생성을 넘어, 능동적인 판단과 실행을 반복하면서 복잡한 작업을 수행할 수 있는 지능적 시스템으로 발전하고 있습니다.
Chain-of-Thought (2022, Wei et al.)
현재도 많이 쓰이고 있는 Prompting 기법이자 LLM Agent의 세상을 열어준 Chain-of-Thought(CoT)은 복잡한 문제를 해결할 때 중간 추론 단계를 명시적으로 거치도록 유도함으로써 reasoning 능력을 향상시킨 접근입니다.
Prompting 단계에서 문제를 풀게된 Chain-of-Thought(생각의 논리)를 함께 제공해주어 추론 단계에서도 비슷한 논리를 사용하여 유저의 instruction을 해결할 수 있도록 하는 Prompting 기법입니다.
ReAct 논문은 Reasoning + Acting을 의미하는 이름으로 LLM이 Reasoning과 Acting을 번갈아 수행하도록 유도하는 프롬프트 기반 프레임워크를 제안합니다.
모델은 Thought, Action, Observation을 반복하며 문제를 해결해 나가고, 이를 통해 단순 추론이나 단순 행동보다 더 강력한 성능을 보여줍니다.
ReAct는 LLM이 도구를 능동적으로 활용하며 복잡한 작업을 수행할 수 있게 만들어, 보다 "에이전트다운" 행동을 가능하게 합니다.
Reflexion (2023, Shinn et al.)
Reflexion은 수행 결과에 대한 피드백을 통해 agent가 반복적으로 자기 행동을 수정하고 성능을 향상시킬 수 있도록 설계된 구조입니다.
에이전트는 실패한 경험을 바탕으로 새로운 전략을 시도하며 점진적으로 학습해 나가고, 이로 인해 복잡한 작업에서도 점차 높은 성공률을 달성할 수 있습니다.
AI Agent는 LLM의 발전에 따라 빠른 속도로 발전하고 있습니다.
LLM이 단순한 문장 생성 능력을 넘어서 복잡한 문제를 추론하고, 사용자의 의도를 이해하고, 외부 도구를 프롬프트만으로 제어하며,
중간 결과를 기억하고 반복적으로 행동할 수 있는 구조가 가능해지면서, 단일 응답형 모델에서 다단계로 계획하고 실행하는 에이전트 형태로 진화하게 된 것입니다.
이러한 흐름은 Chain-of-Thought, ReAct, Reflexion과 같은 프레임워크를 통해 구체화되었고,
결국 AI가 사람처럼 목표를 세우고 달성하는 능력을 갖춘 '에이전트'로 발전하는 기반이 되었습니다.
AI Agent에 대해 더 자세한 내용은 다음 [링크(https://devocean.sk.com/blog/techBoardDetail.do?ID=166231&boardType=techBlog)를 확인해주세요!
이러한 기술 위에서 다양한 환경에 특화된 agent 시스템들이 등장하고 있습니다. Voyager는 Minecraft와 같은 복잡한 시뮬레이션 환경에서 LLM을 이용해 지속적으로 목표를 생성하고 코드 기반 행동을 실행하는 자율 학습 agent이며, RT-2는 시각적 입력과 언어 명령을 결합해 로봇이 실제 환경에서 작업을 수행할 수 있도록 학습된 embodied agent입니다.
한편, 브라우저 환경이나 웹 UI를 조작하는 agent들도 활발히 개발되고 있습니다. WebShop은 온라인 쇼핑 웹사이트에서 사용자의 목표에 맞게 검색하고 선택을 수행하는 환경을 제시하며, AgentQ는 웹페이지의 구조를 파악하고 질의응답, 클릭, 입력 등의 동작을 수행하는 웹 인터페이스 기반 agent입니다. 최근에는 LiteWebAgent와 같이 경량화된 구조로 다양한 웹 작업을 수행할 수 있는 agent도 제안되고 있으며, 이들은 web-based software, 브라우저 자동화, 그리고 real-world application과의 연동 가능성 측면에서 주목받고 있습니다.
그럼 이제 본격적으로 이번 SKT AI Fellowship 7기의 저희 팀에서 다루는 주제인 Computer Use Agent(CUA)에 대해서 설명드리겠습니다.
LLM의 등장으로 빠르게 발전하고 있는 AI Agent 기술을 기반으로, 브라우저 환경이나 웹 UI를 실제로 조작할 수 있는 Computer Use Agent(CUA)가 주목받고 있습니다.
개발되고 있는 서비스마다 작동 방식에 있어서 약간의 차이는 있겠지만 컴퓨터 화면의 스크린샷을 프레임 별로 촬영하고, 웹의 DOM 정보, 그리고 유저의 instruction을 input으로 MLLM에게 전달합니다.
그럼 CUA의 MLLM은 사용자의 의도를 이해하고 환경을 파악한 후 다음 action을 취하는 방식으로 인간처럼 컴퓨터를 조작하며 다양한 디지털 환경에서 목적을 수행할 수 있는 인공지능 시스템입니다.
MLLM의 언어 이해 능력을 통해 사용자의 명령을 이해하고,
이를 바탕으로 실제 컴퓨터 인터페이스 상에서 마우스 클릭, 키보드 입력, 화면 인식 등을 수행함으로써 웹 브라우저, 파일 탐색기, 응용 프로그램 등의 도구를 직접 사용할 수 있도록 설계됩니다.
기존의 언어 모델이 명령어에 대한 텍스트 응답을 생성하는 데 그쳤다면, CUA는 직접 실행 가능한 행동을 선택하고 조작하는 에이전트입니다.
이러한 시스템은 자연어 명령을 기반으로 한 planning을 수행하고, 화면 요소를 인식하거나 DOM 구조를 분석한 뒤 필요한 도구를 선택해 action을 실행하며, 과거의 상호작용 memory를 반영해 plan을 조정합니다.
즉, CUA는 언어적 추론 능력에 시각적 인지, 도구 사용 능력까지 결합된 복합적 Agent라고 할 수 있고 이 과정에서 MLLM을 활용하게 됩니다.
이를 통해 실제 사용자가 해야 할 반복적인 UI 작업, 정보 검색, 시스템 조작 등을 대체하거나 보조할 수 있는 가능성이 열리고 있습니다.
Webshop은 온라인 쇼핑 웹사이트에서 자연어 명령을 기반으로 제품을 탐색하고 선택하는 agent를 제안하였습니다.
DOM 기반 클릭, 입력, 스크롤 등의 행동을 통해 실제 사용자처럼 웹사이트를 탐색할 수 있으며, 멀티턴 reasoning과 action을 결합해 구매 결정까지 수행합니다.
LiteWebAgent (2025, Zhang et al.)
LiteWebAgent는 VLM 기반 웹 에이전트를 만들 수 있는 오픈소스 프레임워크로,
planning, memory, tree search 같은 기능을 모듈식으로 제공하며 실제 배포 가능한 웹앱과 크롬 확장 형태로 실행할 수 있는 실용적인 시스템입니다. NAACL 2025에도 붙은 논문입니다!
AgentQ는 LLM 기반 웹 에이전트가 복잡한 reasoning 작업을 보다 효과적으로 처리할 수 있도록 설계되었습니다.
이 시스템은 Monte Carlo Tree Search (MCTS)와 self-critique, 그리고 Direct Preference Optimization (DPO)을 통해 에이전트가 성공과 실패 경로 pair를 preference pair로 학습하게 됩니다.
결과적으로 WebShop 시뮬레이션 환경에서 18.6% → 81.7% 성능 향상, 온라인 예약 시나리오에서는 95.4% 성공률을 달성하며 GPT‑4 및 인간 평균 성능을 뛰어넘었습니다.
미국의 유명한 CUA 스타트업 MultiOn과 Stanford가 작성한 논문으로 ICML 2025에 투고하였으나 Reject라는 결과를 받았습니다.
하지만 AgentQ의 GitHub Repo를 보시면 프로젝트 코드의 정리가 굉장히 깔끔하게 되어있어, CUA에 관심있으신 분들은 AgentQ를 baseline code로 사용하셔도 좋을 것 같습니다.
이렇듯 LLM의 발전으로 AI Agent를 더 효율적으로 사용해 Computer 제어를 자동화할 수 있는 가능성이 커졌습니다.
다음에는 실제로 AgentQ의 코드와 논문을 뜯어보고 맛보며 CUA와 AgentQ에 대해서 더 깊은 이해를 갖는 시간을 갖도록 하겠습니다!
FYI. DEVOCEAN AI Fellowship을 통해 프로젝트를 시작하며, 첫 번째 블로그 포스트를 작성하게 되었습니다.
평소에 블로그에 글을 자주 쓰지 않다 보니, 짧은 글 한 편을 완성하는 데에도 생각보다 많은 시간이 걸린다는 것을 새삼 느꼈습니다.
이번 DEVOCEAN AI Fellowship 7기를 통해 배우게 될 지식과 경험들을 꾸준히 공유하며, Computer Use Agent라는 주제가 여러분께 좀 더 친숙하게 다가갈 수 있도록 노력하겠습니다!
궁금한 점이나 제안사항이 있으시면 언제든지 댓글로 편하게 남겨주세요!
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.