레플리
글 수 72

노가다 없이 한국어 뉴스/댓글 데이터 분석하기

조회 수 3094 추천 수 0 2018.10.30 15:12:31


https://drive.google.com/file/d/0BzuQe1Onrxp6VE5JcllfMW5SMmc/view

 

 

 

예전에 '노가다 없는 텍스트 분석을 위한 한국어 NLP'라는 Pycon2017에 발표된 내용을 소개한 적이 있습니다.

 

http://aidev.co.kr/nlp/4728

 

여기에 용언추출과 품사판별 등 새로운 내용이 추가된 발표자료입니다.

 

 

 

보통 형태소분석기는 규칙이나 사전 및 코퍼스(품사가 사람에 의해 태그된)를 통해 형태소를 판별합니다. 하지만 사전에 없는 단어가 포함된 문장에서는 올바른 결과를 생성하지 못합니다. 이를 해결하기 위해 cohension이라는 기법을 사용했는데 단어가 분리되는 지점을 통계적으로 계산하여 판별합니다.

 

아이오아이는걸그룹이다
: 아 -> 이 (14%)
: 아이 -> 오 (6%)
: 아이오 -> 아 (87%)
: 아이오아 -> 이 (100%)
: 아이오아이 -> 는 (27%)

 

위와 같이 '아이오아이+는'에서 다시 확률이 작아지는데 여기서 단어가 나누어진다는 것을 알 수 있습니다.

 

 

 

단점은 용언으로 품사를 나눌때 정확하지 않다는 점입니다. 단순히 캐릭터 기준으로 단어를 자르기 때문에 용언의 어근을 정확히 추출하지 못합니다. 그래서 같은 어근을 가진 단어가 별개로 인식되기도 합니다.

 

갔다
-> 가+았+다 (형태소분석기)
-> 갔+다 (cohension)

 

가다
-> 가+다 (형태소분석기)
-> 가+다 (cohension)

 

 

 

발표 자료에 나온 단어 추출, 토크나이저, 품사판별, 전처리 등 다양한 기능들이 포함된 자연어처리 라이브러리를 따로 제공하고 있으니 참고 바랍니다.

 

< soynlp >
-> https://github.com/lovit/soynlp

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수sort
파이썬으로 3줄 요약기 만들기 깊은바다 2018-01-19 10808
마르코프 체인을 사용한 자동 문장 생성 file 깊은바다 2017-04-05 8976
한국어 문장 분리기, KSS(Korean Sentence Splitter) 파이썬 포팅 file 깊은바다 2020-12-23 6151
한국어 채팅 데이터로 머신러닝 하기 깊은바다 2018-04-25 6086
자연어(NLP) 처리 기초 정리 깊은바다 2018-10-22 5766
자바 형태소 분석기 open-korean-txt 깊은바다 2017-04-11 5431
WordPiece와 BPE(Byte Pair Encoding) 깊은바다 2019-06-17 4735
한국어 자연어처리 데이터셋 - KorQuAD 깊은바다 2018-12-21 4724
한국어 전처리 기법 모음 깊은바다 2020-07-31 4539
빠르고 성능 좋은 형태소분석기 MeCab-Ko 깊은바다 2017-05-02 4422
문서에서 핵심 단어를 찾는 TF-IDF 알고리즘 file 깊은바다 2017-09-07 4253
한글 NLP with Python - KoNLPy 사용법 [2] 깊은바다 2017-12-08 4028
노가다 없는 텍스트 분석을 위한 한국어 NLP 깊은바다 2018-04-26 3902
한글 자모 분리 및 합치기 파이썬 패키지 [1] 깊은바다 2020-03-03 3241
TextRank 기법을 이용한 핵심 어구 추출 및 텍스트 요약 file 깊은바다 2018-12-28 3228