레플리
글 수 293

Llama 2의 RLHF 구현 방법

조회 수 1632 추천 수 0 2023.07.19 20:31:41


https://www.facebook.com/rosinality/posts/6768879263164448

 

 

 

Llama 2의 가장 큰 특징은 역시 RLHF입니다. 이 과정에 대해서 자세히 설명한 글입니다. RLHF의 1단계는 SFT입니다. 사람이 질문에 대한 정답을 작성하고 이를 지도학습으로 배웁니다. 2단계는 사람이 모델이 생성한 답변에 점수를 매겨 reward model을 만듭니다. 3단계는 이를 사용해서 모델이 스스로 최적의 문장을 만드는 방법을 학습합니다. SFT보다 RL이 모델의 성능을 높이는데 더 효과적이라고 합니다. 직접 소설을 쓰는 것보다 좋은 소설을 판별하는게 더 쉬운 것처럼요.

 

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수sort
일상대화 딥러닝 모델들을 쉽게 실행할 수 있는 Openchat 깊은바다 2021-06-01 1567
LLaMA나 Mistral이 계속 무료로 유지될 수 있을까 깊은바다 2024-03-05 1570
네이버의 초거대모델인 HyperCLOVA 논문 file 깊은바다 2021-09-13 1572
GPT3로 하는 리액트 프로그래밍 file 깊은바다 2020-07-19 1575
GPT-4에 CoT 프롬프를 적용하여 2023 수능 국어 1등급 달성 file 깊은바다 2023-08-08 1598
GPT3가 상식을 가지고 있을까 깊은바다 2020-07-24 1605
카카오미니의 명령어 분류 방법 - GloVe와 CNN 사용 깊은바다 2018-05-07 1609
GPT-3 패러다임을 바꿀 미친 성능의 인공지능 등장 및 활용 사례 10가지 깊은바다 2020-09-14 1610
워드 임베딩에 대한 아주 쉬운 설명 - The Illustrated Word2vec 깊은바다 2019-04-09 1616
GPT-3를 헬스케어 서비스에 적용했을 때의 문제점들 깊은바다 2020-11-04 1620
구글의 딥러닝 대화 모델 - LaMDA 깊은바다 2021-06-13 1623
Llama 2의 RLHF 구현 방법 깊은바다 2023-07-19 1632
HyperCLOVA로 만드는 캐릭터 챗봇 file 깊은바다 2021-11-26 1633
딥러닝 자연어처리 강의 - Natural Language Processing with PyTorch 깊은바다 2019-07-06 1637
화면을 보고 스마트폰 앱 사용방법을 배우는 모델 - AppAgent file 깊은바다 2024-01-08 1646