레플리
글 수 281

욕설을 찾는 BERT 모델 - Purifier

조회 수 3234 추천 수 0 2019.08.28 02:54:11


ap_graph

 

https://github.com/teammatmul/project-purifier

 

 

 

BERT로 욕설을 판단하는 모델입니다. 웹사이트에서 바로 테스트 해보실 수 있습니다. 띄어쓰기를 하지 않거나 중간에 기호가 삽입되면 약간 정확도가 떨어집니다. 그 외에는 상당히 잘 찾아냅니다.

 

욕설의 위치를 마스킹하는 기능도 추가되었습니다. 데이터셋은 단지 '욕설/정상'으로만 라벨이 달려있습니다. 설명에는 puri attention layer를 사용하여 욕설인 토큰을 찾는다고 합니다.

 

무엇보다 크롤링한 10만개의 문장들에 일일이 라벨을 달았다는게 대단합니다. 게다나 욕설을 읽는 스트레스까지 포함하면 고생이 상당했을 텐데요^^; 모델을 구현하는 능력도 중요하지만, 데이터 수집하고 정제하는 노력도 필수적인 것 같습니다.

 

 

 

< 테스트 사이트 >

-> http://www.matmul.net/purifier

엮인글 :
List of Articles
제목 글쓴이 날짜sort 조회 수
한국어로 대화하는 생성 모델의 학습을 위한 여정 - Transformer와 GPT2 깊은바다 2020-08-13 3565
KoGPT2, KoBERT, KoELECTRA로 만든 심리상담 챗봇 file 깊은바다 2020-08-05 6307
GPT3가 상식을 가지고 있을까 깊은바다 2020-07-24 739
GPT3 튜링 테스트 깊은바다 2020-07-23 668
네이버 뉴스 댓글로 사전훈련한 구어체 모델 - KcBERT 깊은바다 2020-07-20 813
GPT3로 하는 리액트 프로그래밍 file 깊은바다 2020-07-19 769
GPT2에서 문장 생성 시 단어를 확률에 따라 선택하는 방법 깊은바다 2020-07-16 2183
오픈소스 한국어 딥러닝 챗봇 - Kochat 깊은바다 2020-07-03 2498
KoGPT2를 파인튜닝하여 만든 챗봇 깊은바다 2020-06-23 3493
주석을 프로그램으로 변환하는 GPT 모델 깊은바다 2020-06-21 478
소설을 생성하는 NarrativeKoGPT2 file 깊은바다 2020-06-19 2189
GPT3 유료화 기능 소개 영상 깊은바다 2020-06-15 914
GPT2를 테스트해볼 수 있는 사이트 - Talk to Transformer file 깊은바다 2020-06-05 615
퓨샷(few-shot) 러닝에 최적화된 GPT3 모델 file 깊은바다 2020-05-30 1154
KoGPT2로 한국어 노래 가사 생성하기 깊은바다 2020-05-21 1837