글 수 62

카카오의 딥러닝 기반 형태소 분석기

조회 수 65 추천 수 0 2018.11.30 20:05:10


 

https://brunch.co.kr/@kakao-it/308

 

 

 

카카오의 딥러닝 형태소분석기 khaiii가 공개되었습니다. 보통 규칙 기반은 먼저 가능한 품사 조합들을 미리 정해진 룰에 따라 목록을 만듭니다. 그리고 사람에 의해 품사가 태깅된 코퍼스에서 가장 확률이 높은 항목을 찾습니다.

 

입력 : 디자인하여
목록 : 디자인(NNG) * 하(VV / XSV / XSA / NNG) * 여(EC / EF / IC) = 12개
결정 : 디자인(NNG) - 하(XSV) - 여(EC) -> 가장 높은 확률!

 

 

 

딥러닝으로도 형태소분석을 할 수 있는데 RNN 같은 방식을 많이 사용합니다. 그러나 khaiii는 빠른 속도를 위해 CNN으로 되어있습니다. 특히 단어 단위가 아니라 음절(한글자) 기준으로 동작합니다. 중심 글자 양 옆으로 정해진 윈도우 만큼 입력을 받고 주변의 글자들을 참고하여 품사를 분류합니다.

 

세종 코퍼스의 오류를 수정하고 새로운 데이터를 추가하여 공개를 하려고 했는데 저작권 문제로 불가능하다고 합니다. 좋은 학습 자료를 활용하지 못해서 안타깝네요.

 

 

 

< 소스 코드 >
-> https://github.com/kakao/khaiii

엮인글 :

하이루

2018.12.03 08:24:12
*.249.191.10

감사합니다.

List of Articles
제목 글쓴이 날짜 조회 수
한국어 형태소 분석기 성능 비교 - khaiii [1] 깊은바다 2018-12-10 32
카카오 형태소 분석기(khaiii) 설치와 은전한닢(mecab) 형태소 분석기 비교 [1] 깊은바다 2018-12-02 152
카카오의 딥러닝 기반 형태소 분석기 [1] 깊은바다 2018-11-30 65
위키정보를 찾아 잡담을 하는 딥러닝 모델 - Wizard Of Wikipedia file [1] 깊은바다 2018-11-29 63
구글 듀플렉스(Duplex) 상용화 시작 [3] 깊은바다 2018-11-26 60
딥러닝 자연어처리 튜토리얼 - DLK2NLP [2] 깊은바다 2018-11-24 88
커뮤니케이션과 AI - Multi-channel CNN을 이용한 한국어 감성분석 [1] 깊은바다 2018-11-22 284
개체명인식 with Naver [1] 깊은바다 2018-11-20 80
사전학습을 통한 구글의 자연어처리 언어 모델 - BERT file 깊은바다 2018-11-03 268
RNN seq2seq 간단한 대화모델 깊은바다 2018-10-23 139
구글의 Transformer 신경망 모델 [2] 깊은바다 2018-10-13 171
Seq2Seq와 어텐션 기법을 애니메이션으로 쉽게 설명한 글 깊은바다 2018-10-12 103
썰로 푸는 NLP 깊은바다 2018-10-11 150
딥러닝을 이용한 자연어처리의 연구동향 깊은바다 2018-10-04 155
다이나믹 메모리 네트워크 정리 file 깊은바다 2018-09-29 142