레플리
글 수 283

페이스북이 발표한 사전훈련 언어모델 RoBERTa

조회 수 1429 추천 수 0 2019.07.30 15:48:50


K-001.png

 

K-002.png

 

https://arxiv.org/pdf/1907.11692.pdf

 

 

 

며칠 전 페이스북에서 새로운 사전훈련 언어모델을 발표했습니다. 아직 그룹에 공유가 되지 않은 것 같아 간단하게 정리하였습니다. RoBERTa(Robustly Optimized BERT Pretraining Approach)는 BERT를 기반으로 하지만 다음과 같이 몇 가지 개선 사항이 있습니다.

 

1. NSP(Next Sentence Prediction) 제거

-> 기존 BERT는 특정 단어를 마스킹하여 맞히는 것과, 두 문장이 이어지는지 판단하는 두 가지 방법으로 학습을 합니다. 여기서 NSP를 빼고 마스킹만 사용하였습니다.

 

2. Dynamic Masking

-> 전처리에서 마스킹을 미리 하지 않고, 모델에 입력할 때 매번 마스킹을 변경합니다.

 

3. 학습 데이터 증가

-> 16GB에서 160GB로 10배 커졌습니다.

 

 

 

사진의 결과를 보면 RoBERTa가 BERT보다 월등한 성능을 보입니다. 또한 최근 공개된 XLNet을 근소한 차이로 앞서고 있습니다. 앞으로 사전훈련 방법을 개선한 다양한 모델이 나오지 않을까 생각됩니다.

List of Articles
제목 글쓴이 날짜sort 조회 수
GPT-3를 사용하여 코딩을 하는 MS의 파워FX 깊은바다 2021-06-01 249
일상대화 딥러닝 모델들을 쉽게 실행할 수 있는 Openchat 깊은바다 2021-06-01 569
구글의 딥러닝 대화 모델 - LaMDA 깊은바다 2021-06-13 587
GPT-3를 활용하여 주석을 코드로 바꿔주는 GitHub Copilot 깊은바다 2021-06-30 356
6B 파라미터의 GPT-J_6B 오픈소스 모델 깊은바다 2021-07-01 3138
GPT-3 데모 사이트 - gpt3demo.com 깊은바다 2021-07-13 3707
인터넷 검색을 하고 장기기억을 저장하는 페이스북의 챗봇 - Blenderbot 2 file 깊은바다 2021-07-19 654
죽은 약혼자를 챗봇으로 살려낸 남자 - Project December 깊은바다 2021-07-27 561
챗봇의 슬롯 채우기(Slot Filling)와 DST(Dialogue State Tracking) file 깊은바다 2021-08-19 1474
네이버의 초거대모델인 HyperCLOVA 논문 file 깊은바다 2021-09-13 556
문장을 벡터로 변환하는 방법들 깊은바다 2021-09-16 931
부적절한 문장을 판단해주는 딥러닝 모델 - Ask Delphi file 깊은바다 2021-11-08 399
여러 한국어 GPT 모델들 file [1] 봄눈 2021-11-21 3337
HyperCLOVA로 만드는 캐릭터 챗봇 file 깊은바다 2021-11-26 762
검색기반 거대모델인 딥마인드의 RETRO 깊은바다 2021-12-20 511