글 수 44

노가다 없이 한국어 뉴스/댓글 데이터 분석하기

조회 수 110 추천 수 0 2018.10.30 15:12:31


https://drive.google.com/file/d/0BzuQe1Onrxp6VE5JcllfMW5SMmc/view

 

 

 

예전에 '노가다 없는 텍스트 분석을 위한 한국어 NLP'라는 Pycon2017에 발표된 내용을 소개한 적이 있습니다.

 

http://aidev.co.kr/nlp/4728

 

여기에 용언추출과 품사판별 등 새로운 내용이 추가된 발표자료입니다.

 

 

 

보통 형태소분석기는 규칙이나 사전 및 코퍼스(품사가 사람에 의해 태그된)를 통해 형태소를 판별합니다. 하지만 사전에 없는 단어가 포함된 문장에서는 올바른 결과를 생성하지 못합니다. 이를 해결하기 위해 cohension이라는 기법을 사용했는데 단어가 분리되는 지점을 통계적으로 계산하여 판별합니다.

 

아이오아이는걸그룹이다
: 아 -> 이 (14%)
: 아이 -> 오 (6%)
: 아이오 -> 아 (87%)
: 아이오아 -> 이 (100%)
: 아이오아이 -> 는 (27%)

 

위와 같이 '아이오아이+는'에서 다시 확률이 작아지는데 여기서 단어가 나누어진다는 것을 알 수 있습니다.

 

 

 

단점은 용언으로 품사를 나눌때 정확하지 않다는 점입니다. 단순히 캐릭터 기준으로 단어를 자르기 때문에 용언의 어근을 정확히 추출하지 못합니다. 그래서 같은 어근을 가진 단어가 별개로 인식되기도 합니다.

 

갔다
-> 가+았+다 (형태소분석기)
-> 갔+다 (cohension)

 

가다
-> 가+다 (형태소분석기)
-> 가+다 (cohension)

 

 

 

발표 자료에 나온 단어 추출, 토크나이저, 품사판별, 전처리 등 다양한 기능들이 포함된 자연어처리 라이브러리를 따로 제공하고 있으니 참고 바랍니다.

 

< soynlp >
-> https://github.com/lovit/soynlp

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수
NUGU Knowledge Base - 지식베이스 [1] 깊은바다 2018-11-10 39
텍스트 분석을 자동으로 해주는 서비스 - KoALA [1] 깊은바다 2018-10-31 102
노가다 없이 한국어 뉴스/댓글 데이터 분석하기 깊은바다 2018-10-30 110
자연어(NLP) 처리 기초 정리 깊은바다 2018-10-22 154
무엇이든 물어보세요, 지식그래프 : 카카오미니와 검색 적용 소개 깊은바다 2018-09-27 137
우리말 자연어처리 기술 - 과거와 현재 깊은바다 2018-08-28 264
엑소브레인의 질의응답 기능 file 깊은바다 2018-08-18 154
엑소브레인 강연 자료 깊은바다 2018-07-19 179
C++로 만든 형태소 분석기 - KIWI 깊은바다 2018-07-02 248
간편한 토픽 모델링 툴 Tomoto Gui 깊은바다 2018-06-14 173
클로바 Interaction Model의 이해 및 설계/제작 노하우 - 자연어처리 방법 깊은바다 2018-06-06 223
SentiWordNet과 감성분석 깊은바다 2018-06-04 235
한국어 오픈소스 자연어처리 라이브러리 - Koshort 깊은바다 2018-05-20 838
기계번역기의 발전과 역사 깊은바다 2018-05-10 87
소셜 미디어 감성분석을 통한 주가 예측 깊은바다 2018-04-28 283