레플리
글 수 283

6B 파라미터의 GPT-J_6B 오픈소스 모델

조회 수 3138 추천 수 0 2021.07.01 12:18:15


 

https://arankomatsuzaki.wordpress.com/2021/06/04/gpt-j/

 

 

 

EleutherAI는 오픈소스 GPT-3인 GPT-Neo를 공개했습니다. GPT-2의 파라미터가 1.5B, GPT-3는 175B입니다. GPT-Neo는 현재까지 2.7B까지 나왔습니다.

 

이번에는 6B 사이즈인 GPT-J-6B를 내놓았습니다. 800GB 텍스트에서 400B개의 토큰으로 학습했습니다. TPU v3-256으로 5주가 걸렸다고 합니다. 시간당 192$이니 192x5x7x24=161,280$입니다. 대충 2억정도 들었네요.

 

GPT-Neo와의 가장 큰 차이점은 제로샷이 된다는 것입니다. 별도의 파인튜닝 없이도 질문만 넣으면 다양한 태스크가 가능합니다. 샘플 아웃풋을 보면 수학계산, 기계독해(MRC), 코딩 등의 예를 보여주고 있습니다.

 

 

 

< 테스트 페이지 >

https://6b.eleuther.ai/

 

< GitHub >

https://github.com/kingoflolz/mesh-transformer-jax

 

엮인글 :
List of Articles
제목 글쓴이 날짜sort 조회 수
구글 듀플렉스에 대한 소개 깊은바다 2018-07-30 183
딥러닝을 이용한 자연어 처리 깊은바다 2018-08-01 523
사람의 말로 표현하는 페이지(PAIGE) - 자연어생성 깊은바다 2018-08-04 660
딥러닝으로 욕설 탐지하기 깊은바다 2018-08-06 1881
딥러닝을 이용한 지역 컨텍스트 검색 깊은바다 2018-08-10 222
추천시스템이 word2vec을 만났을때 깊은바다 2018-08-22 1032
문장의 유사도를 파악하는 구글의 universal-sentence-encoder file 깊은바다 2018-08-29 1596
스탠포드 자연어처리 강의 - The Limits and Future of NLP 깊은바다 2018-08-30 395
소설 쓰는 딥러닝 file 깊은바다 2018-08-31 1388
포자랩스의 작사/작곡 인공지능 file 깊은바다 2018-08-31 641
네이버 영화 리뷰 감정 분석 깊은바다 2018-09-07 3292
딥러닝과 자연어처리의 집중 메커니즘 깊은바다 2018-09-08 1019
딥러닝으로 상식 구축 - Event2Mind 깊은바다 2018-09-14 373
문장을 사진으로 변환하는 StackGAN [1] 깊은바다 2018-09-17 1435
페르소나를 가진 대화 학습 - Personalizing Dialogue Agents file 깊은바다 2018-09-19 618