챗봇 딥러닝 - 초거대모델의 파인튜닝 방법

글 수 282

초거대모델의 파인튜닝 방법 - P-tuning과 LoRA

조회 수 12006 추천 수 0 2022.04.05 01:15:09

깊은바다 *.68.249.160 http://aidev.co.kr/11272

BERT 이후로 딥러닝 자연어처리는 사전훈련 모델(pre-trained model)이 기본이 되었습니다. 보통 위키피디아 같은 데이터로 사전훈련을 하면 언어의 기본적인 특징을 이해하게 됩니다. 그다음 개별 태스크에 맞게 새로운 데이터로 재학습을 하는 파인튜닝(fine-tuning)을 거칩니다.

반면에 GPT-3 같은 초거대모델은 파인튜닝 없이 퓨샷러닝(few-shot learning)을 바로 사용합니다. 입력 프롬프트에 어떤 태스크인지 설명만 넣어주면, 그 뜻을 이해하고 알아서 그렇게 동작을 합니다. 예를 들어, 번역이라면 다음과 같이 몇 가지 예시를 프롬프트에 포함합니다. 그러면 사랑이란 단어의 영어 표현을 자동으로 채워줍니다.

사과 : apple

자동차 : car

책 : book

사랑 :

물론 초거대모델도 파인튜닝을 하면 더 성능이 높아집니다. 하지만 실제로 적용하기는 어렵습니다. 워낙 파라미터 사이즈가 크기 때문입니다. 재학습을 하는데 시간과 자원이 너무 많이 소요되니까요.

이런 문제점을 해결하는 방법으로 P-tuning과 LoRA가 있습니다. 둘 다 기본 원리는 비슷합니다. 사전훈련된 가중치는 그대로 두고, 거기에 별도로 추가된 레이어만 새로운 데이터로 학습을 합니다.

P-tuning은 임베딩 레이어에 BiLSTM과 MLP 레이어를 붙입니다. 이렇게 하면 프롬프트의 임베딩이 학습 데이터에 딱 맞게 나오도록 할 수 있습니다. LoRA는 사전훈련 모델의 중간중간에 adapter 레이어를 넣습니다. 그리고 사전훈련 레이어와 adapter 레이어의 결과를 합쳐서 출력값을 생성합니다.

GPT-3도 2021년 12월에 파인튜닝 기능이 새로 생겼습니다. 정확한 알고리즘은 공개되지 않았습니다. 아마 P-tuning이나 LoRA 같이 일부 가중치를 추가하여 거기만 새로 학습하는 방식일 것 같습니다. 재학습을 하는데 데이터 크기에 따라 비용이 부과됩니다. 또한 파인튜닝한 모델을 사용할 경우, 기존보다 2배 정도 가격이 더 비쌉니다. 네이버의 하이퍼클로바도 이런 파인튜닝 기능을 지원할 것 같습니다.

< HyperCLOVA – Korean GPT3 >

https://deview.kr/2021/sessions/440

< GPT Understands, Too (P-tuning) >

https://arxiv.org/abs/2103.10385

< P-tuning 예제 >

https://github.com/.../8.GPT3/8.4.gpt2_p_tuning_NSMC.ipynb

< LoRA: Low-Rank Adaptation of Large Language Models >

https://arxiv.org/abs/2106.09685

< GPT-3 Fine-tuning >

https://beta.openai.com/docs/guides/fine-tuning

이 게시물을

엮인글 :

List of Articles

제목	글쓴이	날짜	조회 수
Gluon으로구현해보는 한영기계번역 모형	깊은바다	2018-04-13	274
사진을 인식할 수 있는 ChatGPT 멀티모달 버전 공개	깊은바다	2023-09-26	276
ChatGPT 원티드 플러그인 사용 화면	깊은바다	2023-04-07	278
오픈소스 LLM이 ChatGPT를 대체할 수 있을	깊은바다	2023-05-05	294
LLM의 미래는 자율행동과 멀티 에이전트	깊은바다	2023-08-30	298
화면을 보고 스마트폰 앱 사용방법을 배우는 모델 - AppAgent	깊은바다	2024-01-08	300
Koko 심리상담 서비스에서 GPT-3 대답 추천 기능을 도입	깊은바다	2023-01-11	302
Generative AI — 시장 구조, 기회, moat에 대한 몇 가지 생각	깊은바다	2023-06-27	302
네이버 케어콜의 장기기억 기능 - 맞춤 케어를 위한 기억하기 챗봇	깊은바다	2023-03-01	305
LLM의 시대에도 자연어처리를 배워야할까	깊은바다	2023-05-29	316
ChatGPT 톺아보기 - 인공지능의 역사부터 신경망, 초거대AI, ChatGPT까지	깊은바다	2023-02-01	318
GPT-3.5와 하이퍼클로바의 한국어 대결	깊은바다	2023-05-12	318
GenAI 컨퍼런스 대담 요약 - 어떻게 AI가 비즈니스를 재편할 것인가	깊은바다	2023-03-08	319
노암 촘스키의 ChatGPT 기고문	깊은바다	2023-03-09	319
OpenAI, 성능은 높아지고 가격은 싸진 새로운 모델 공개	깊은바다	2024-01-26	319

쓰기

첫 페이지 1 2 3 4 5 6 7 8 9 10 끝 페이지