데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      AAA팀: Autonomous Agent Enabling 기술 개발 - 연구계획(1)

      7기_전현석 25.06.14
      98 1 0
      DEVOTEE 요약
      이 연구는 "Autonomous Agent"를 활용한 기술 개발로, 사용자의 목표를 스스로 달성하는 에이전트를 만드는 것을 목표로 합니다. LaVague, WebShop, AgentQ 등 기존 프레임워크를 활용해 웹/모바일 환경에서 반복 작업을 자동화하고, 개인화된 UI Transition Graph를 통해 사용자 맞춤형 운영을 구현하며, Edge Computing과 Federated Learning으로 데이터 프라이버시를 보호합니다. 최종적으로 사용자의 행동 패턴을 학습하여 작업을 효율적으로 재현하고, 개인화된 Operator Agent 시스템을 구축하는 데 중점을 둡니다.

      안녕하세요! AAA의 장교철, 전현석, 김기태입니다.

      저희는 요즘 핫한 Autonomous Agent Enabling 기술 개발을 주제로 연구를 진행하게 되었습니다!


      1. 연구 배경

      1.1 Agentic AI 및 Autonomous Agent

      Agentic AI는 (M)LLM을 바탕으로 Perception → Plan → Action → Self-Reflection 루프를 자체적으로 실행해 사용자의 목표를 달성하는 Autonomous Agent를 지칭합니다.

      이러한 에이전트는 “목표 지향적(task-oriented)이며, 환경을 인지, 추론하고 행동까지 진행한다”는 점에서 전통적 챗봇과 구분됩니다.

      이에 산업계 역시 고객 상담, 문서 작성, 데이터 분석 등의 여러 workflow를 Autonomous Agent에게 위임하고 일의 효율성을 높이는 방향으로 빠르게 진화하고 있습니다.

      그러나 보다 Task의 단계가 복잡해지거나, 더 나아가 개개인이 원하는 Tailored된 Agent에 대해서는 아직 연구가 더딘 상황입니다.

      image.png

      1.2 GUI 자동화 프레임워크 및 Operator Agent

      (M)LLM이 생성한 자연어 Plan을 곧바로 클릭, 입력, 스크롤과 같은 행동 시퀀스로 번역하는 Large-Action Model(LAM) 계열 프레임워크가 등장하면서,

      사용자는 별도의 스크립트 작성 없이도 웹 및 모바일 그리고 OS 기반 UI를 실시간 제어할 수 있게 되었습니다. 이러한 AI Agent를 Operator agent 혹은 GUI Agent라고 합니다.

      대표적인 Operator agent로는 Claude의 Computer Use, OpenAI의 Operator 가 있습니다.

      image (1).png

      저희는 이번 프로젝트에서 Web app을 타겟으로 대표적인 오픈소스 Web Operator Agent인 LaVague, Webshop, AgentQ의 솔루션을 활용하여 앞서 제시한 문제를 해결하려 합니다.

      이러한 프레임워크들은 웹 문서의 구조화된 표현인 Document Object Model(DOM) 구조를 파싱하고, 내부 플래너가 UI State 공간을 탐색해 Optimal Action을 즉시 실행합니다.

      • LaVague는 화면의 DOM을 분석해 목표 달성에 필요한 액션 시퀀스를 실시간 합성하며, Llama 3 8B와 같은 로컬 모델을 사용합니다.

      • WebShop은 실제 제품을 포함한 대규모 e-commerce 환경을 시뮬레이션하며, 자연어 지시사항을 이해하고 검색, 제품 선택, 옵션 지정 등 복잡한 웹 인터랙션을 수행하는 벤치마크로, 강화학습과 모방학습을 통해 에이전트를 훈련시킵니다.

      • Agent Q는 LLM의 자체 피드백을 Monte Carlo Tree Search(MCTS)에 사용하는 Reflective-MCTS 방식을 도입해, 동적 UI에서도 탐색, 백업, 재계획 루프를 수행하며 높은 성공률을 보인 모델입니다.

      이러한 장점들을 종합해 개개인에 맞는 UI Transition Graph를 생성하고 Human-In-The-Loop 파이프라인을 구축해,

      그 과정에서 쌓인 데이터를 통한 강화학습으로 다양한 상황에서의 skill-set을 확보, 결과적으로 이를 Replay 하는 방식 통해 실제 사용성을 높이려 합니다.


      1.3 개인화 및 Edge Computing

      개인화된 Autonomous Agent를 구현하기 위해선 클릭 패턴과 선호 피드백과 같은 민감 데이터를 지속적으로 학습해야 합니다.

      하지만, 이를 중앙 서버로 직접 전송하면 프라이버시 침해와 네트워크 지연 문제가 발생합니다. 이러한 한계를 해결하기 위해 Edge Device + Federated Learning(FL) 아키텍처가 주목받고 있습니다.

      FL은 익명화된 파라미터만 서버로 보내 공동 모델을 훈련하는 방법으로써 Private 데이터를 안전하게 훈련할 수 있다는 장점이 있습니다.

      이에 양자화와 Continual Learning 기술을 적용하면 모델 크기와 메모리 사용량을 크게 줄일 수 있어 Edge-FL에 continual learning을 결합한 이러한 파이프라인이 Edge-AI의 핵심 패턴으로 정의됩니다.

      결국, Edge 환경에서 구동되는 개인화 모델은 사용자의 최신 행동 패턴을 실시간으로 반영하면서도 프라이버시를 보존하고, GUI Agent의 안정성과 응답성을 동시에 유지할 수 있게 합니다.

      결과적으로 저희 프로젝트에서도 이와 같은 개개인의 데이터를 보호하기 위한 솔루션이 바탕이 되어야 할 것입니다.

      image (2).png


      2. 연구 목표

      정리하자면 본 연구의 최종 목표는 강화학습을 통해 사용자의 선호 데이터를 학습하여 일상 생활의 반복 작업을 자동화하고,

      Moderator Agent를 도입하여 개인 맞춤형 Operator Agent 시스템을 개발함으로써 사용자 경험을 개선하는 것입니다.

      그림1.png

      • GUI Autonomous Agent 개발

        • LaVague, Webshop, AgentQ와 같은 프레임워크를 사용하여 다양한 웹 및 모바일 환경에서 사용자의 작업을 저장하고 Device를 제어하는 GUI 자동화 엔진을 개발합니다.

      • 개인화된 UI Transition Graph 구축 및 활용

        • Moderator Agent가 사용자의 행동과 피드백을 실시간으로 분석하여 개인에게 최적화된 UI Transition Graph를 동적으로 생성하는 시스템을 개발합니다.

          이 그래프는 그래프DB에 저장되어, 복잡한 사용자 작업 흐름을 효율적으로 관리하고 검색할 수 있도록 합니다.

      • 그래프 기반의 작업 재현(Replay) 및 협력 파이프라인 구축

        • Operator Agent가 그래프DB에 저장된 사용자의 UI Transition Graph를 불러와 작업을 그대로 재현(replay)하는 기능을 구현합니다.

          A2A/MCP 기반의 통신을 통해 Agent마다 특정 작업에 유능한 Domain-specific Agent를 구성합니다. 또한, 복잡한 작업의 경우 이런 Agent들을 주어진 요구사항에 알맞게 호출할 수 있도록 합니다.


      3. 연구 계획

      본 연구는 약 5개월간 다음의 단계로 진행됩니다.


      3.1 핵심 기술 통합 및 DB 스키마 설계 (6월 ~ 7월)

      • LaVague 및 AgentQ를 고도화하여 웹/앱 제어를 위한 기반 모듈을 구축합니다.

      • 그래프DB를 설정하고, UI Transition Graph를 효과적으로 저장하기 위한 노드 및 관계 스키마를 설계합니다.

      3.2 Agent 시스템 및 그래프 생성 로직 개발 (7월 ~ 8월)

      • Moderator Agent에 사용자의 GUI 인터랙션을 분석하여 UI Transition Graph의 노드와 엣지로 변환하고, 이를 그래프DB에 기록하는 핵심 로직을 개발합니다.

      3.3 그래프 기반 작업 재현 및 최적화 (8월 ~ 9월)

      • Operator Agent가 그래프DB에서 특정 사용자의 UI Transition Graph를 쿼리하여 작업을 자율적으로 재현하는 기능을 구현합니다.

      • MCTS와 같은 그래프 탐색 알고리즘과 작업 실행 속도를 최적화합니다.

      3.4 종합 평가 및 고도화 (10월)

      • 실제 일상 과업을 대상으로 구축된 UI Transition Graph의 정확성과 작업 재현 성공률을 종합적으로 평가합니다.

      • 연구 결과를 분석 및 문서화하고, 최종 시스템의 구조와 성능을 정리하며 프로젝트를 마무리합니다.


      마지막으로 항상 가르침을 주시는 김동현 멘토님께 감사하다는 말씀드리며 연구계획서 마칩니다.

      열심히 연구하여 좋은 결과 있도록 노력하는 AAA가 되겠습니다.

      감사합니다!

      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      7기_전현석 님의 최신 블로그

      더보기