레플리
글 수 293

카카오의 딥러닝 기반 형태소 분석기

조회 수 516 추천 수 0 2018.11.30 20:05:10


 

https://brunch.co.kr/@kakao-it/308

 

 

 

카카오의 딥러닝 형태소분석기 khaiii가 공개되었습니다. 보통 규칙 기반은 먼저 가능한 품사 조합들을 미리 정해진 룰에 따라 목록을 만듭니다. 그리고 사람에 의해 품사가 태깅된 코퍼스에서 가장 확률이 높은 항목을 찾습니다.

 

입력 : 디자인하여
목록 : 디자인(NNG) * 하(VV / XSV / XSA / NNG) * 여(EC / EF / IC) = 12개
결정 : 디자인(NNG) - 하(XSV) - 여(EC) -> 가장 높은 확률!

 

 

 

딥러닝으로도 형태소분석을 할 수 있는데 RNN 같은 방식을 많이 사용합니다. 그러나 khaiii는 빠른 속도를 위해 CNN으로 되어있습니다. 특히 단어 단위가 아니라 음절(한글자) 기준으로 동작합니다. 중심 글자 양 옆으로 정해진 윈도우 만큼 입력을 받고 주변의 글자들을 참고하여 품사를 분류합니다.

 

세종 코퍼스의 오류를 수정하고 새로운 데이터를 추가하여 공개를 하려고 했는데 저작권 문제로 불가능하다고 합니다. 좋은 학습 자료를 활용하지 못해서 안타깝네요.

 

 

 

< 소스 코드 >
-> https://github.com/kakao/khaiii

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수
Word2Vec 테스트 사이트 file 깊은바다 2019-01-13 1327
딥러닝 자연어처리 - RNN에서 BERT까지 [2] 깊은바다 2019-01-07 1835
BERT를 이용한 챗봇 구현 file 깊은바다 2019-01-07 4172
사전훈련 자연어처리 모델의 발전과정 - The Illustrated BERT, ELMo, and co. 깊은바다 2019-01-01 1424
2018 Amazon Prize에서 우승한 Gunrock 소셜봇 file 깊은바다 2018-12-26 591
BERT 톺아보기 깊은바다 2018-12-17 26575
한국어 형태소 분석기 성능 비교 - khaiii 깊은바다 2018-12-10 1484
카카오 형태소 분석기(khaiii) 설치와 은전한닢(mecab) 형태소 분석기 비교 깊은바다 2018-12-02 2855
카카오의 딥러닝 기반 형태소 분석기 깊은바다 2018-11-30 516
위키정보를 찾아 잡담을 하는 딥러닝 모델 - Wizard Of Wikipedia file 깊은바다 2018-11-29 943
구글 듀플렉스(Duplex) 상용화 시작 [2] 깊은바다 2018-11-26 669
딥러닝 자연어처리 튜토리얼 - DLK2NLP [1] 깊은바다 2018-11-24 1242
커뮤니케이션과 AI - Multi-channel CNN을 이용한 한국어 감성분석 깊은바다 2018-11-22 1187
개체명인식 with Naver 깊은바다 2018-11-20 2351
사전학습을 통한 구글의 자연어처리 언어 모델 - BERT file 깊은바다 2018-11-03 4337