레플리
글 수 284

6B 파라미터의 GPT-J_6B 오픈소스 모델

조회 수 3139 추천 수 0 2021.07.01 12:18:15


 

https://arankomatsuzaki.wordpress.com/2021/06/04/gpt-j/

 

 

 

EleutherAI는 오픈소스 GPT-3인 GPT-Neo를 공개했습니다. GPT-2의 파라미터가 1.5B, GPT-3는 175B입니다. GPT-Neo는 현재까지 2.7B까지 나왔습니다.

 

이번에는 6B 사이즈인 GPT-J-6B를 내놓았습니다. 800GB 텍스트에서 400B개의 토큰으로 학습했습니다. TPU v3-256으로 5주가 걸렸다고 합니다. 시간당 192$이니 192x5x7x24=161,280$입니다. 대충 2억정도 들었네요.

 

GPT-Neo와의 가장 큰 차이점은 제로샷이 된다는 것입니다. 별도의 파인튜닝 없이도 질문만 넣으면 다양한 태스크가 가능합니다. 샘플 아웃풋을 보면 수학계산, 기계독해(MRC), 코딩 등의 예를 보여주고 있습니다.

 

 

 

< 테스트 페이지 >

https://6b.eleuther.ai/

 

< GitHub >

https://github.com/kingoflolz/mesh-transformer-jax

 

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수sort
GPT-2를 사용한 텍스트 압축 기법 file 깊은바다 2021-02-19 473
텐서플로에서 사전 훈련된 임베딩을 사용하는 예제 깊은바다 2019-02-02 480
주석을 프로그램으로 변환하는 GPT 모델 깊은바다 2020-06-21 480
썰로 푸는 NLP 깊은바다 2018-10-11 494
카카오의 딥러닝 기반 형태소 분석기 깊은바다 2018-11-30 497
ChatGPT의 오픈소스 버전 - ColossalChat file 깊은바다 2023-03-30 504
ChatGPT는 새로운 검색엔진이 될까 file 깊은바다 2022-12-06 507
검색기반 거대모델인 딥마인드의 RETRO 깊은바다 2021-12-20 511
꼼꼼하고 이해하기 쉬운 ELECTRA 논문 리뷰 깊은바다 2020-05-15 512
딥러닝 학습으로 배우는 대화 인공지능 - 구글 듀플렉스 깊은바다 2018-05-09 515
딥러닝을 이용한 자연어 처리 깊은바다 2018-08-01 523
RAG 아키텍처를 위한 임베딩 모델의 선택에 대해 깊은바다 2023-09-14 525
아카라이브 AI 언어모델 로컬 채널 file 깊은바다 2023-05-23 533
RNN과 Torch로 발라드곡 작사하기 깊은바다 2018-03-23 538
좋은 응답을 골라내는 모델 만들기 - 핑퐁의 답변매칭 알고리즘 깊은바다 2020-12-10 553