챗봇 딥러닝 - 글자, 사진, 영상을 동시에 처리하는 딥마인드의 딥러닝 모델

글 수 283

글자, 사진, 영상을 동시에 처리하는 딥마인드의 딥러닝 모델 - Flamingo

조회 수 1429 추천 수 0 2022.05.10 18:53:37

깊은바다 *.68.249.160 http://aidev.co.kr/11347

알파고로 유명한 딥마인드는 원래 강화학습을 주로 했는데요. 최근 Gopher, RETRO, Chinchilla 등 뛰어난 언어모델들을 잇달아 공개하고 있습니다. 이번에 발표한 Flamingo 역시 정말 놀랍습니다.

우선 기존 GPT-3 같은 언어모델(Language Model)에서 더 발전했습니다. 멀티모달로 글자, 사진, 영상을 모두 처리할 수 있는 VLM(Visual Language Model)입니다. GPT-3의 175B보다 작은 80B의 파라미터를 가지고 있습니다. 또한 다른 초거대모델처럼 별도의 파인튜닝 없이 퓨샷러닝이 가능합니다.

Flamingo 모델은 영상을 벡터로 변환하는 Visual Encoder와 언어전용모델인 LM Block이 별도로 존재합니다. 각각 사전훈련을 끝내고 가중치는 업데이트가 안되도록 고정시킵니다. 거기에 Perceiver Resampler와 GATED XATTN-DENSE 층을 추가하여 여기만 새롭게 학습이 되도록 했습니다.

학습 데이터는 주로 웹에서 크롤링을 했습니다. 첫째, 사진과 캡션설명. 둘째, 동영상과 자막. 셋째, 사진과 글자가 같이 나열된 웹페이지. 이렇게 3가지 종류로 구성되어 있습니다.

테스트 결과를 보면 기존 파인튜닝된 멀티모달 모델들을 32샷으로 모두 능가했습니다. 사진과 설명이 주어지면 대답을 하거나, 동영상에 대한 질문도 정확하게 맞춥니다. 특히 챗봇에 적용했을 때가 가장 인상적이었습니다.

개인적으로 딥마인드가 세계최고의 AI 연구소가 아닐까 생각합니다. 알파고, 알파스타, 알파폴드, 알파코드 등 불가능해 보였던 분야를 하나씩 정복했습니다. 이제 대화 인공지능에서도 조만간 새로운 이정표를 만들어낼 것 같습니다.

https://www.deepmind.com/blog/tackling-multiple-tasks-with-a-single-visual-language-model

이 게시물을

엮인글 :

List of Articles

제목	글쓴이	날짜	조회 수
KoGPT2 v2.0 공개	깊은바다	2021-05-03	1589
GPT2로 글을 작성하는 사이트 - StoryAI	깊은바다	2019-10-11	1582
KoNLPy를 이용하여 Huggingface Transformers 학습하기	깊은바다	2020-09-20	1573
Java에서 Word2vec 사용하기	깊은바다	2018-05-05	1567
글쓰는 법을 배우는 신경망	깊은바다	2016-03-25	1539
딥러닝 자연어처리 라이브러리 - Pororo	깊은바다	2021-02-03	1529
일상대화 챗봇 레플리카(Replika)의 구현 방식	깊은바다	2020-12-22	1509
딥러닝으로 미소녀 챗봇 만들기	깊은바다	2018-06-01	1498
챗봇의 슬롯 채우기(Slot Filling)와 DST(Dialogue State Tracking)	깊은바다	2021-08-19	1474
GPT-3로 NPC와 대화를 할 수 있는 게임 시뮬레이터	깊은바다	2021-02-22	1463
문장의 유사성을 예측하고 평가하는 AI - 카카오 심슨	깊은바다	2019-03-20	1462
한국어 형태소 분석기 성능 비교 - khaiii	깊은바다	2018-12-10	1447
GPT가 스스로 계획을 세워서 실행한다면 - AutoGPT와 LangChain	깊은바다	2023-04-18	1447
문장을 사진으로 변환하는 StackGAN [1]	깊은바다	2018-09-17	1435
페이스북이 발표한 사전훈련 언어모델 RoBERTa	깊은바다	2019-07-30	1429

쓰기

첫 페이지 1 2 3 4 5 6 7 8 9 10 끝 페이지