레플리
글 수 72

노가다 없이 한국어 뉴스/댓글 데이터 분석하기

조회 수 3094 추천 수 0 2018.10.30 15:12:31


https://drive.google.com/file/d/0BzuQe1Onrxp6VE5JcllfMW5SMmc/view

 

 

 

예전에 '노가다 없는 텍스트 분석을 위한 한국어 NLP'라는 Pycon2017에 발표된 내용을 소개한 적이 있습니다.

 

http://aidev.co.kr/nlp/4728

 

여기에 용언추출과 품사판별 등 새로운 내용이 추가된 발표자료입니다.

 

 

 

보통 형태소분석기는 규칙이나 사전 및 코퍼스(품사가 사람에 의해 태그된)를 통해 형태소를 판별합니다. 하지만 사전에 없는 단어가 포함된 문장에서는 올바른 결과를 생성하지 못합니다. 이를 해결하기 위해 cohension이라는 기법을 사용했는데 단어가 분리되는 지점을 통계적으로 계산하여 판별합니다.

 

아이오아이는걸그룹이다
: 아 -> 이 (14%)
: 아이 -> 오 (6%)
: 아이오 -> 아 (87%)
: 아이오아 -> 이 (100%)
: 아이오아이 -> 는 (27%)

 

위와 같이 '아이오아이+는'에서 다시 확률이 작아지는데 여기서 단어가 나누어진다는 것을 알 수 있습니다.

 

 

 

단점은 용언으로 품사를 나눌때 정확하지 않다는 점입니다. 단순히 캐릭터 기준으로 단어를 자르기 때문에 용언의 어근을 정확히 추출하지 못합니다. 그래서 같은 어근을 가진 단어가 별개로 인식되기도 합니다.

 

갔다
-> 가+았+다 (형태소분석기)
-> 갔+다 (cohension)

 

가다
-> 가+다 (형태소분석기)
-> 가+다 (cohension)

 

 

 

발표 자료에 나온 단어 추출, 토크나이저, 품사판별, 전처리 등 다양한 기능들이 포함된 자연어처리 라이브러리를 따로 제공하고 있으니 참고 바랍니다.

 

< soynlp >
-> https://github.com/lovit/soynlp

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수sort
스마트 스피커에서의 음악 재생 발화 오류 교정 file 깊은바다 2019-03-28 407
인간의 언어를 이해하는 기계, NLU에는 어떤 것이 있을까? 깊은바다 2020-06-05 417
엑소브레인 강연 자료 깊은바다 2018-07-19 423
차원이 다른 구글 번역기의 도래 깊은바다 2017-02-28 427
기계번역기의 발전과 역사 깊은바다 2018-05-10 476
윈도우에서 간편하게 Mecab 설치방법 - pyeunjeon 깊은바다 2021-06-15 500
엑소브레인의 질의응답 기능 file 깊은바다 2018-08-18 526
예일대의 자연어-SQL 데이터셋, Spider 깊은바다 2020-07-12 531
자연어처리 벤치마크인 SuperGLUE도 인간의 기록을 경신 [1] 깊은바다 2021-01-21 550
모두의 말뭉치에 새로운 일상 대화 추가 file 깊은바다 2021-04-06 562
토론하는 인공지능 - IBM Project Debater file 깊은바다 2019-01-16 579
네이버 검색과 개인화 깊은바다 2018-11-20 619
IBM 왓슨의 자연어처리 방식 깊은바다 2020-06-26 626
엑소브레인 자연어 질의응답 기술 file 깊은바다 2018-03-25 627
클로바 Interaction Model의 이해 및 설계/제작 노하우 - 자연어처리 방법 깊은바다 2018-06-06 642