레플리
글 수 203

문장을 사진으로 변환하는 GPT-3 모델, DALL-E

조회 수 983 추천 수 0 2021.01.09 16:29:54


DALL·E가 '오픈AI가 적힌 작은 간판'이라는 주문에 따라 만든 이미지(사진=오픈AI 블로그)

 

http://www.aitimes.com/news/articleView.html?idxno=135460

 

 

 

문장을 이미지로 변환하는 딥러닝은 예전부터 계속 연구되어 왔던 분야입니다. 대표적으로 StackGAN(http://aidev.co.kr/chatbotdeeplearning/5894)을 들 수 있습니다. 작년 9월에 앨런 AI연구소에서 발표한 X-LXMERT(https://prior.allenai.org/projects/x-lxmert)가 가장 뛰어난 성능을 보였습니다. 하지만 아직 사진의 품질이 매우 떨어지는 편이었습니다.

 

얼마 전 OpenAI가 공개한 DALL-E는 오직 트랜스포머 구조만 사용한 모델입니다. GPT-3를 약간 수정했는데요. GPT-3는 문장을 넣으면 문장이 나오지만, DALL-E는 사진이 출력되도록 훈련했습니다. 보시는 바와 같이 놀랄 만한 수준의 이미지들을 생성하고 있습니다. 훈련한 데이터에 없을 것 같은 특이한 문장도 상당히 정확하게 사진으로 만들어 냅니다. 예를 들어, 'OpenAI가 적힌 간판'은 실제로는 없는 데이터입니다. 하지만 그 뜻을 이해하여 기존 간판의 이미지와 OpenAI라는 이미지를 조합하여 하나의 사진으로 합성합니다.

 

지금까지 딥러닝 모델들은 그 용도에 따라 각각 다른 구조를 가지고 있었습니다. 이미지 인식은 CNN, 이미지 생성은 GAN, 자연어처리는 LSTM이 대표적입니다. 트랜스포머는 처음 자연어처리에서 시작되었지만 지금은 이미지 인식에도 CNN을 능가할 정도입니다. 이젠 이미지 생성도 GAN을 대체하고 있습니다. 앞으로 정말 트랜스포머가 딥러닝을 통일하는 날이 오게 될까요.

 

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수sort
Text-to-Video 생성 서비스인 Pika, 5500만달러 투자 유치 file 깊은바다 2023-11-29 149
OpenAI의 Sora로 만든 단편영화 file 깊은바다 2024-03-26 158
누구나 쉽게 AI 인플루언서를 만드는 시대 - Aitana Lopez file 깊은바다 2024-01-04 172
인도의 생성AI 영화 - Maharaja in Denims 깊은바다 2024-01-16 197
AI의 미래 - Coatue가 주목한 AI 산업 트렌드 깊은바다 2023-11-28 201
만약 ChatGPT가 영상으로 세상을 이해하게 된다면? file 깊은바다 2024-02-16 256
초거대AI를 API로 썼을 때 경쟁업체와 차별화를 하려면 깊은바다 2023-03-20 300
GPT : 도래한 초거대 AI의 시대, 빅테크가 주도할 수 밖에 없는 이유 file 깊은바다 2022-12-22 330
어도비의 생성AI 프로그램 - Firefly 깊은바다 2023-03-23 348
가구 카탈로그를 만들어주는 생성AI - 뚝딱 AI 스튜디오 file 깊은바다 2023-09-22 359
World Models를 만든 David Ha, 구글에서 StabilityAI로 이적 file 깊은바다 2022-10-11 361
딥러닝 시대에 글로벌 대기업들을 따라잡을 수 있을까 깊은바다 2020-01-30 370
생성 AI의 시대, 진짜 메타버스가 온다 깊은바다 2023-04-04 373
인공지능이 가상의 온라인 모델을 만들어낸다면? 깊은바다 2019-03-15 404
사인필드 시트콤을 패러디한 AI 생성 애니메이션 방송 file 깊은바다 2023-02-01 404