23.06.15
DEVOTEE를 활성화 시키면
지금 작성한 커뮤니티 글에 대해 1개의 댓글을 달아줍니다.
버튼을 누르면 글 수정 시 ChatGPT가 작성한 댓글이 수정됩니다.
| 컨텐츠 유형 | 제목 | 저장일 | 삭제 |
|---|
본인인증 로그인에 실패하였습니다.
회원이 아니시거나 본인인증 등록이
완료되지 않은 사용자입니다.
안녕하세요 🐰
저희는 On Device상의 (인지/판단/실행) 모델 파이프라인 기술 개발 과제를 수행 중인 SKT AI Fellowship 6기 O.DA (On Device AI) 팀 이선민, 장윤서, 권수영 입니다.
이번 포스트에서는 저희가 진행하고 있는 연구 과제 소개 및 연구 계획에 대해 말씀드리겠습니다.
The proliferation of personalized experiences delivered via mobile applications has been a dominant theme of the last decade of personal computing.
On Device AI는 디바이스 내 NPU(신경망 칩)을 이용하여 인터넷 연결 없이 생성형 AI를 실행할 수 있게 만든 기술입니다. ChatGPT를 시작으로 작년 한해 동안 On Device AI가 탑재된 휴대폰이 출시되면서, 모바일 애플리케이션을 통해 개인화된 경험을 제공하는 기술이 대두되고 있습니다.
그래서 저희는 이번 연구 과제를 통해 사용자 장치에 인공지능 모델을 직접 삽입함으로써 인터넷 없이 자체적으로 인지/판단/행동의 기능을 수행할 수 있도록 파이프라인을 구축할 예정입니다.
LAM(Large Action Model) 은 사용자의 의도와 행동을 이해하고 이를 바탕으로 연결된 장치 내에서 특정 작업을 수행하는 것에 중점을 둔 모델입니다. 최근 PAA(Personal AI Agent Service)와 같이 사용자에게 개인화된 경험을 제공하는 것이 중요해지면서, Apple, Qualcomm 등 많은 기업들이 LAM을 이용한 서비스 로직 개발에 열을 올리고 있습니다.
올해 1월, Rabbit Inc.에서 Rabbit R1을 발표했습니다. Rabbit R1은 디바이스 OS 자체가 LAM 기반으로 작동되는 개인 AI 비서 단말기로, 유저의 명령에 따른 실행 처리 결과를 돌려줍니다. 애플리케이션 형태로 설치되어야하는 기존 휴대폰과 다르게 AI 모델이 장치와 일체형으로 심어져있어 simple한 형태로 task를 수행할 수 있다는 장점이 있습니다.
저희는 Rabbit R1의 작동 단계를 조사하면서, On-Device와 Server 내에 LAM 파이프라인을 구축할 수 있는 방법을 계획했습니다.
올해 6월 11일, WWDC 2024를 통해 Apple은 개인 지능형 시스템인 Apple Intelligence를 발표했습니다. 새롭게 발표된 기술들 중 App intent는 Siri를 이용해서 LAM task를 실행하는 기능입니다.
저희는 Apple Intelligence를 조사하면서, Adapter(Small Model Weight)를 이용해 다양한 task에 빠르게 tuning되도록 LLM Foundation Model을 학습하는 방법과 서로 다른 앱끼리 사용자의 데이터를 공유하는 방법을 계획하게 되었습니다.
저희 연구 과제는 On-device상의 인지/판단/실행 모델 파이프라인 기술 개발로 기기 내 AI 시스템이 음성, 사진, 비디오 등 다양한 사용자 프롬프트를 받아 인지, 판단하고 사용자 요청에 맞는 Task를 수행할 수 있는 On Device AI 플랫폼을 구축하는 것이 목표입니다.
저희가 각 파이프라인마다 진행하고자하는 ✨연구 목표✨는 다음과 같습니다.
1. [인지] 온 디바이스 상의 ML/LLM 활용 서비스 구성 시 유저의 멀티모달 인풋에 대한 Task 단위의 처리 구성 및 재활용
2. [판단] Langchain과 RAG 데이터를 이용한 On-Device LLM 모델 구축
3. [실행] 사용자 측면에서 어플리케이션에 대한 인지/판단모델 이후의 실행을 구성함에 있어 유연함 제공하고 다양한 어플리케이션 연계
저희는 사용자가 다양한 input을 넣어도 사용자의 의도를 정확하게 인지할 수 있도록, 여러 input feature를 연결하는 연구를 진행할 예정입니다.
저희는 Langchain과 RAG 데이터를 이용해 App knowledge를 학습하여 LAM input prompt를 정확하게 생성*하는 On-Device LLM 모델을 구축할 예정입니다.
저희는 서버에서 LAM(Large Action Model)이 LLM으로부터 받은 skillset들을 안드로이드에서 구동 가능한 Action으로 바꾸어 전달하고 On-Device Event Play Engine이 이를 받아 기기에서 수행할 수 있도록 실행 파이프라인을 구축할 예정입니다.
그리고 연구 기간 중 시간이 된다면 UTG 관련 정보들에 대한 embedding을 학습한 Transformer 기반 모델을 구현할 예정입니다.
(이 연구까지 경험할 수 있도록! 열심히 진행해볼 예정입니다 🧐)
Google Mediapipe는 오픈소스의 크로스 플랫폼으로 3D 객체 감지, 신체 포즈 및 손 랜드마크 감지 등 머신러닝 파이프라인 구축을 위한 다양한 솔루션을 제공합니다.
저희는 Google Mediapipe의 다양한 task 해결 기술을 접목시켜 Multi-modal prompt를 입력받을 수 있는 인지 파이프라인을 구축할 예정입니다.
Gemma는 구글 Gemini를 기반으로 제작된 on device용 경량 거대 언어 모델입니다. 현재 오픈소스로 공개되어 있으며 Google Mediapipe에서 웹/안드로이드 기반 inference 기능을 제공합니다.
저희는 경량화 모델인 Google Gemma를 이용해서 안드로이드 기기에서 돌아갈 수 있을 정도의 가벼운 LLM을 구현할 예정입니다. Mediapipe inference code를 이용해 온디바이스용 Lightweight LLM을 구현하고 task에 맞게 fine-tuning을 진행할 예정입니다.
RAG(Retrieval Augmented Generation)은 LLM의 사실 관계 오류의 단점을 보완하기 위해 외부 지식 베이스를 참조하여 LLM이 생성하는 출력을 최적화하는 프로세스로 Device 내 사용자 개인 데이터와 연관이 있는 액션을 취하기 위해 사용되는 기술입니다.
저희는 LAM 서버 또는 device 내의 replay engine과 상호작용하며 적절한 prompt와 query를 생성하는 데에 RAG 기술을 활용할 예정입니다.
대규모 언어 모델(LLM)을 활용해 유저 프롬프트 받고 유저 intent에 맞는 적합한 모바일 앱 액션을 구동시키는 모바일 작업 자동화 LAM AI Agent를 개발하고자 합니다.
오프라인 단계에서 앱을 탐색하고, 결과를 UTG에 기록합니다. UTG 결과는 Memory Generator을 거쳐 task - action 쌍으로 메모리에 저장됩니다.
온라인 단계에서 사용자가 명령을 입력하면 프롬프트 생성기가 작업, UI 상태 설명, 앱 메모리의 관련 정보를 기반으로 프롬프트를 생성하고, LLM에 전달, LLM은 메모리의 엡 UI 정보를 기반으로 Action guidance을 받아 앱 내에서 적절한 Action이 수행되도록 합니다.
저희는 LAM AI Agent를 개발하여 사용자의 prompt를 이해한 실행 모델 파이프라인을 개발하고자 합니다.
앞으로 5개월동안 저희 연구 일정을 간략히 정리해보았습니다.
On Device AI를 따서 만들어진 저희 O.DA 팀은 이화여자대학교 학부생 이선민, 장윤서, 권수영으로 이루어진 팀입니다.
멘토님과 일주일에 1번씩 회의 진행을 원칙으로 한다.
(단, 격주로 대면 회의, 온라인 회의를 번갈아가며 진행할 예정임)
대면 회의 : 금요일 점심시간대에 SKT타워에서 진행 예정
온라인 회의 : 디스코드 음성 채널을 통해 진행 예정
팀원들과 매주 월요일, 수요일 오후 6시 대면 회의를 원칙으로 한다.
(단, 진행할 내용이 많을 경우 추가 회의를 진행할 예정임)
저희 O.DA팀은 Notion, Slack, Discord, Velog를 이용해서 연구를 진행하고 있습니다.
Notion : 연구 실험 결과 및 선행 논문들을 정리하여 팀원들과 함께 기록하고 있습니다.
Discord : 회의록 및 회의 일정을 공유하고 있습니다.
Slack : 멘토님과 함께 연구 프로젝트 중 발생하는 이슈 및 관련 자료들을 공유하고 있습니다.
Velog : Sunmin.velog에 매주 회의록을 기록하고 있습니다.
저희 팀원 모두 멀티모달 LLM 모델 및 LAM 모델을 On Device AI에 적용하는 연구에 관심이 많아서 대학원 진학 후에도 관련된 분야에서 연구를 이어나가려고 하고 있습니다. 이번 연구 프로젝트가 저희의 진로에 좋은 자양분이 될 수 있도록 이 기회를 소중히 여기며 앞으로 다양한 모습으로 DEVOCEAN에 찾아오겠습니다!
🔥김동현 멘토님🔥의 도움을 받아 5개월동안 연구 과제를 해결하기 위해 최선을 다할 예정이니 많은 관심 부탁드립니다!
PromptRPA: Generating Robotic Process Automation on Smartphones from Textual Prompts (Tsinghua UniversityBeijingChina, Tian Huang et al. 2024)
Language Is Not All You Need: Aligning Perception with Language Models (Microsoft, Shaohan Huang et al. 2023)
Visual Instruction Tuning (University of Wisconsin–Madison, Haotian Liu et al. 2023)
Large Language Models: A Survey (Shervin Minaee et al. 2024)
Gemma: Open Models Based on Gemini Research and Technology (Google DeepMind, Gemma Team, 2024)
A Survey on Knowledge Distillation of Large Language Models (The University of Hong Kong, Xiaohan Xu et al. 2024)
TVM: an automated end-to-end optimizing compiler for deep learning, T Chen et al, 2018
TOKEN MERGING: YOUR VIT BUT FASTER (Georgia Tech, Daniel Bolya et al, 2023)
Think Big, Generate Quick: LLM-to-SLM for Fast Autoregressive Decoding (Qualcomm AI Research, Benjamin Bergner et al. 2024)
Ringer: Web Automation by Demonstration (Shaon Barman et al. 2024)
PRewrite: Prompt Rewriting with Reinforcement Learning (Google Research, Weize Kong et al. 2024)
https://www.rabbit.tech/research
https://llava-vl.github.io/
https://www.rabbit.tech/rabbit-os
https://semiconductor.samsung.com/kr/solutions/technology/on-device-ai/
https://www.rabbit.tech/rabbit-os
https://github.com/haotian-liu/LLaVA
https://www.youtube.com/watch?v=RXeOiIDNNek
https://www.youtube.com/watch?v=RXeOiIDNNek
DEVOTEE를 활성화 시키면
지금 작성한 댓글에 AI가 댓글을 달아줍니다.