데보션앱 소개페이지 바로가기
로그인 선택

신고하기

CLOSE
신고사유 (대표 사유 1개)
상세내용 (선택)
0/200
  • 신고한 게시글은 더 이상 보이지 않습니다.
  • 이용약관과 운영정책에 따라 신고사유에 해당하는지 검토 후 조치됩니다.
  • 허위 신고인 경우, 신고자의 서비스 이용이 제한될 수 있으니 유의하시어 신중하게 신고해 주세요.
(이 회원이 작성한 모든 댓글과 커뮤니티 게시물이 보이지 않고, 알림도 오지 않습니다.)

미리보기

커뮤니티

      1,234

      badge 23.06.15

      글 등록

      카테고리를 선택해주세요.

      DEVOTEE를 활성화 시키면
      지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.

      버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.

      임시저장함에 저장되었습니다. 저장일시 : 2022.5.17 14:29:08

      임시저장함

      제목을 선택하시면 이어서 작성이 가능하며,
      최대 20건까지 저장합니다.
      컨텐츠 유형, 제목, 저장일시, 삭제로 이뤄진 임시저장 목록
      컨텐츠 유형 제목 저장일 삭제

      데보션 블로그 게재 요청

      CLOSE
      • *
      • *

      본인인증

      효율적인 데보션 서비스 이용 및
      고객님의 소중한 개인정보보호를 위해
      본인인증을 진행해주세요. 본인인증 미 진행 시 로그인이 제한됩니다.
      본인인증 실패

      본인인증 로그인에 실패하였습니다.
      회원이 아니시거나 본인인증 등록이
      완료되지 않은 사용자입니다.

      회원정보 연결

      AAA팀: Autonomous Agent Enabling 기술 개발 - 연구과정(2)

      7기_장교철 25.09.19
      135 2 0
      DEVOTEE 요약
      AAA 팀은 일상생활에 활용 가능한 Mobile GUI Agent 개발을 목표로 연구를 진행 중입니다. 초기에는 GUI Agent와 관련된 개념을 학습하고 Computer Use Agent 연구를 통해 기반을 다졌으며, 이후 연구 타겟을 Mobile Use Agent로 전환해 다양한 기술과 벤치마크 실험을 수행했습니다. 현재는 추론 시간을 줄이고 개인정보 보호를 보장하기 위해 On-device 환경에서 작동 가능한 시스템을 구현하며, UTG Replay Policy를 활용해 효율성을 높이는 데 집중하고 있습니다.
      DEVOTEE 추천 블로그

      안녕하세요! AAA의 장교철, 전현석, 김기태입니다.


      저희는 실제 핸드폰에서 효율적으로 핸드폰을 조작하는 Mobile GUI Agent를 개발하고 있고,

      이 포스트를 통해 현재 처음 연구 계획서를 공개한 시점에서 얼마나 주제가 발전되었고 얼마나 진행되었는지 공유하고자 합니다.


      1. 처음 계획 한 주제




      먼저 첫 연구계획 포스트에서 어떤 내용에 대해 말씀드렸는지 간단하게 요약드리겠습니다.


      6월 14일에 처음 공개한 저희 포스트에서는 GUI Agent, Operator Agent라는 개념이 생소하게 느껴지실 분들을 위해

      Autonomous Agent, GUI Agent, Federated Learning과 같은 개념을 소개드리고,

      Autonomous Agent Enabling 기술 개발이라는 목표 아래 어떻게 구현 할지 저희의 연구 목표와 계획에 대해서 설명을 드렸습니다.

      Operator Agent와 Autonomous Agent Enabling 기술에 대해서는 아래 Devocean 포스트도 같이 참고해주시면 이해하시는데 도움이 많이 될 것 같습니다.


      2. 지금까지의 여정

      첫 포스트 이후로 저희는 GUI Agent라는 개념에 더욱 친숙해 지기 위하여 김동현 멘토님과 함께 정말 많은 논문을 읽고 다양한 프로그램들을 구현하고 개발하며 수 많은 내공을 쌓아왔습니다.

      이를 통해 더욱 뚜렷한 문제 정의와 역할 분배로 최종 발표에서 자랑할 수 있는 저희의 프로토타입을 개발하고 있습니다.

      이번 중간 보고에서는 저희가 5월 말에 있었던 OT이래로 어떠한 경험을 했고, 이러한 경험들이 어떤 결론에 도달해 저희에게 변화를 주었는지 이야기를 들려드리려고 합니다.

      6월

      6월에는 GUI Agent 연구를 위한 기반을 다지는 데 집중했습니다.

      이를 위해 다양한 Computer Use 시뮬레이터와 논문, 오픈소스 프로젝트를 직접 구현하고 실험하며 문제 정의를 구체화했습니다.

      특히 AgentQ 논문을 읽고 구현하고 실행해보며 MCTS가 DPO 학습에 활용되는 방식과 MLLM이 컴퓨터 조작 코드를 구현하는 원리를 이해했습니다.

      또한 AgentQ의 POMDP 문제를 시각화하기 위해 GraphDB와 연동한 시각화 기능을 구현했습니다.

      마지막으로 Webshop이라는 대표적인 Computer Use Agent 벤치마크를 실행하며 GUI Agent 환경 세팅이 얼마나 까다롭고 어려운지 체감했습니다.


      7월

      7월에는 GUI Agent 연구를 확장해 Mobile Use Agent로 응용하는 데 집중했습니다.


      Computer Use Agent보다 Mobile Use Agent가 일상 생활에서 더 많은 usage가 있을 것이라 생각했고, 여러 고민 끝에 Computer Use Agent에서 Mobile Use Agent로 연구의 타겟을 전환했고,

      Autonomous Agent Enabling을 위한 실질적인 응용 기술들을 학습하며 다양한 논문과 벤치마크를 스터디하였습니다.

      또 AgentQ와 같은 Web Agent 시뮬레이터를 더 쉽게 활용할 수 있도록, Chat Interface를 통해 웹을 조작하는 UI를 개발하였고,

      AutoDroid라는 대표적인 Mobile Agent 프로젝트를 활용해 핸드폰 화면 기반의 UTG를 그려보는 실험도 진행했습니다.


      8월

      8월에는 Mobile Use Agent의 문제 정의를 확립하고 구현 방향을 구체화했습니다.


      ACL 2025 학회에 갔다오면서 Mobile Use Agent의 필요성을 확인하였습니다.

      멘토님과 팀원들과의 사전 조사와 여러 차례 회의를 통해 Mobile Use에 대한 수요 증가를 확인했고, 일상 생활에서 활용 가능한 Mobile Use Agent를 구현하기로 결정했습니다.

      또한 Mobile Use는 On-premise와 On-device 환경 모두에서 작동할 수 있기 때문에, 두 가지 상황을 병렬적으로 시도하며 구현 가능성을 탐색했습니다.


      9월(현재)

      최종 발표를 앞두고 저희 AAA 팀은 명확해진 문제 정의를 바탕으로 구현에 집중하고 있습니다.


      짧은 시간을 효율적으로 활용하기 위해 김동현 멘토님의 지휘 아래 다음과 같이 역할을 분담하여 구현하고 있습니다.

      저는 오픈소스 LLM을 On-premise 환경에서 실행하기 위한 파이프라인 개선 및 추론 코드를 구현하고 있으며,

      현석님은 LLM이 Action을 출력해 ADB를 통해 스마트폰을 조작하는 파이프라인을 구축하고 Mobile GUI Agent의 더 빠른 작동을 위해 UTG Replay Policy를 사용해 더 빠른 추론을 하는 방식을 구현 중 입니다.

      기태님은 On-device 방식으로 구현하는 것에 집중하여, 모델을 직접 스마트폰에 올려 Accessibility Layer를 활용해 조작하는 방법을 연구하고 있습니다.



      3. 목표

      여러 차례 시도와 피보팅 끝에 저희의 연구 목표는 일상생활을 편리하게 만들어줄 Mobile Use Agent를 개발하는 것으로 정리되었습니다.

      이를 위해 추론 시간을 최소화하고, 개인정보 보호를 위해 On-device 환경에서 SLM을 구동하는 것을 구현하는 것으로 최종 목표로 설정했습니다.

      3.1 On-device용 SLM 개발

      On-device에서 실행하기 위해서는 GPT API와 같은 Closed LLM을 쓸 수 없으므로, GUI Grounding 성능이 좋은 Small Language Model(SLM)이 필요합니다.

      현재 중국의 여러 기업에서 8B 이하 크기의 SLM을 내놓고 있지만 실제 활용에는 성능이 부족한 상황입니다.

      따라서 저희는 일상생활 데이터를 수집 및 학습하여, 일상 특화 Multi-modal SLM을 구현하려 합니다.

      3.2 On-device 구현

      Mobile GUI Agent는 사용자 경험이 핵심이므로, 개인정보 보호를 보장하는 On-device 실행 환경을 우선적으로 구현하고 있습니다.

      3.3 UTG Replay Policy 구현

      GUI Agent가 매번 사용자 명령을 받을 때마다 SLM 추론에 의존하면 계산 자원이 부족해 속도가 느려지고 사용성이 떨어집니다.

      이를 해결하기 위해 UTG를 생성하고, 동일한 Task에서는 UTG Replay Policy를 활용하여 빠른 추론을 가능하게 만들고자 합니다.


      4. 연구 계획

      앞으로 남은 약 한 달 동안은 UTG Replay Policy, 모델 학습, On-device SLM 구현을 완성하고 최종 발표까지 준비하는 것에 집중합니다.

      구체적인 일정은 다음과 같습니다.

      • 9월 넷째 주: UTG Replay Policy, 모델 학습, On-device SLM 구현

      • 10월 첫째 주: 각자 구현 마무리

      • 10월 둘째 주: 팀원별로 구현한 결과 통합

      • 10월 셋째 주: 전체 개발 마무리

      • 10월 넷째 주: 발표 자료 제작 및 최종 발표 준비


      5. 마무리

      이번 SKT 프로젝트는 4개월 넘게 매주 멘토님의 인사이트와 팀원들의 헌신 속에서 달려온 여정이었습니다.

      남은 기간 동안에도 지금까지의 노력이 헛되지 않도록 최선을 다해, 저희 스스로도 만족할 수 있는 Mobile Use Agent를 완성해 선보이겠습니다.


      긴 글 읽어주셔서 감사합니다!


      TMI. 제가 프로젝트를 할 때 기록하는 습관이 있어서 이렇게 기록해 두었는데, 어느새 보니 매주 기록하게 되었네요. ㅋㅋㅋ


      댓글 0

      DEVOTEE를 활성화 시키면
      지금 작성한 댓글에 AI가 댓글을 달아줍니다.

      7기_장교철 님의 최신 블로그

      더보기

      DEVOTEE 추천 블로그

      동영상 기고하기