자연어처리 - 노가다 없이 한국어 뉴스/댓글 데이터 분석하기

글 수 72

노가다 없이 한국어 뉴스/댓글 데이터 분석하기

조회 수 3094 추천 수 0 2018.10.30 15:12:31

깊은바다 *.203.215.247 http://aidev.co.kr/6204

https://drive.google.com/file/d/0BzuQe1Onrxp6VE5JcllfMW5SMmc/view

예전에 '노가다 없는 텍스트 분석을 위한 한국어 NLP'라는 Pycon2017에 발표된 내용을 소개한 적이 있습니다.

http://aidev.co.kr/nlp/4728

여기에 용언추출과 품사판별 등 새로운 내용이 추가된 발표자료입니다.

보통 형태소분석기는 규칙이나 사전 및 코퍼스(품사가 사람에 의해 태그된)를 통해 형태소를 판별합니다. 하지만 사전에 없는 단어가 포함된 문장에서는 올바른 결과를 생성하지 못합니다. 이를 해결하기 위해 cohension이라는 기법을 사용했는데 단어가 분리되는 지점을 통계적으로 계산하여 판별합니다.

아이오아이는걸그룹이다
: 아 -> 이 (14%)
: 아이 -> 오 (6%)
: 아이오 -> 아 (87%)
: 아이오아 -> 이 (100%)
: 아이오아이 -> 는 (27%)

위와 같이 '아이오아이+는'에서 다시 확률이 작아지는데 여기서 단어가 나누어진다는 것을 알 수 있습니다.

단점은 용언으로 품사를 나눌때 정확하지 않다는 점입니다. 단순히 캐릭터 기준으로 단어를 자르기 때문에 용언의 어근을 정확히 추출하지 못합니다. 그래서 같은 어근을 가진 단어가 별개로 인식되기도 합니다.

갔다
-> 가+았+다 (형태소분석기)
-> 갔+다 (cohension)

가다
-> 가+다 (형태소분석기)
-> 가+다 (cohension)

발표 자료에 나온 단어 추출, 토크나이저, 품사판별, 전처리 등 다양한 기능들이 포함된 자연어처리 라이브러리를 따로 제공하고 있으니 참고 바랍니다.

< soynlp >
-> https://github.com/lovit/soynlp

이 게시물을

엮인글 :

List of Articles

제목	글쓴이	날짜	조회 수
세종 말뭉치보다 9배 더 큰 한글 코퍼스 공개 - 모두의 말뭉치	깊은바다	2020-08-27	3158
노가다 없이 한국어 뉴스/댓글 데이터 분석하기	깊은바다	2018-10-30	3094
검색을 통해 지식그래프를 바로 생성하는 알고리즘	깊은바다	2019-08-02	3052
한국어 오픈소스 자연어처리 라이브러리 - Koshort	깊은바다	2018-05-20	2938
단어 간 유사도 파악 방법	깊은바다	2018-02-01	2855
개인 성격 분석(Watson Personality Insights) 데모	깊은바다	2017-10-02	2812
네이버 사용자를 만족시켜라 - 의도파악과 의미검색	깊은바다	2018-01-28	2664
텍스트 분석을 자동으로 해주는 서비스 - KoALA	깊은바다	2018-10-31	2088
구글 신경망 번역의 원리	깊은바다	2017-02-28	1985
자연어처리의 개념	깊은바다	2018-03-24	1930
문서의 카테고리를 분류할 수 있는 나이브 베이즈 알고리즘	깊은바다	2017-08-31	1881
형태소 분석의 이해	깊은바다	2017-05-01	1798
KoNLPy - 파이썬 한국어 NLP	깊은바다	2017-06-14	1693
파이썬 한국어 말뭉치 패키지 - Korpora	깊은바다	2020-09-12	1513
SentiWordNet과 감성분석	깊은바다	2018-06-04	1456

쓰기

첫 페이지 1 2 3 4 5 끝 페이지