레플리
글 수 282

BERT로 토익 문제를 푸는 프로젝트

조회 수 2279 추천 수 0 2019.04.30 16:57:51


K-001.png

 

https://github.com/graykode/toeicbert?fbclid=IwAR2hoCQE02CaR00m-RZCHwQM_kYd1LgxxMSrucYSTtA52ZUhtvq5i_G2tFk

 

 

 

BERT로 토익 문제를 푸는 프로젝트입니다. 따로 토익문제 데이터로 훈련하지 않고, 사전훈련된 모델을 그냥 사용했습니다. 그런데도 70%의 정확도를 보인다고 합니다.

 

BERT는 기본적으로 두 가지 방법으로 학습을 합니다. 하나는 문장의 특정 단어를 마스킹으로 가리고 그 단어를 예측합니다. 두 번째는 두 문장이 입력으로 들어가면 서로 연결되는 의미인지 T/F로 판단합니다.

 

토익 문제를 풀기 위해서는 마스킹 방식의 BertForMaskedLM 모델을 바로 적용할 수 있습니다. 4가지의 예제 단어를 라벨로 하여 각각 모델의 예측값(얼마나 정확한지를 나타내는 loss)를 얻습니다. 그리고 손실오차가 가장 작은 단어를 정답으로 판단합니다.

 

앞으로 딥러닝 자연어처리를 기반으로 한 재미있는 프로젝트들이 더 많아질 것 같습니다.

List of Articles
제목 글쓴이 날짜 조회 수
사진을 인식할 수 있는 ChatGPT 멀티모달 버전 공개 file 깊은바다 2023-09-26 279
Poe에 추가된 업스테이지의 LLM, Solar-70b file 깊은바다 2023-09-18 435
RAG 아키텍처를 위한 임베딩 모델의 선택에 대해 깊은바다 2023-09-14 518
LLM의 미래는 자율행동과 멀티 에이전트 깊은바다 2023-08-30 298
LLM이 서로 협력하여 프로그램을 개발 - ChatDev file 깊은바다 2023-08-16 750
GPT-4에 CoT 프롬프를 적용하여 2023 수능 국어 1등급 달성 file 깊은바다 2023-08-08 621
LLM의 창발적인 현상인 CoT(Chain of Thouht) 소개 file 깊은바다 2023-07-27 704
RAG 아키텍처의 이해 깊은바다 2023-07-23 1326
GPT-4 세부구조에 대한 정보 유출 깊은바다 2023-07-20 457
Llama 2의 RLHF 구현 방법 깊은바다 2023-07-19 720
한국어 LLM 민주화의 시작 KoAlpaca file 깊은바다 2023-07-17 1055
레포트를 써주는 LLM - GPT Researcher file 깊은바다 2023-07-13 405
LLM 챗봇의 특징 2가지 - RAG와 Function 깊은바다 2023-07-06 1191
RAG(Retrieval-Augmented Generation) - LLM의 환각을 줄이는 방법 file 깊은바다 2023-07-04 9639
Generative AI — 시장 구조, 기회, moat에 대한 몇 가지 생각 깊은바다 2023-06-27 302