- AI Dev - 인공지능 개발자 모임
- 정보공유
- 자연어처리
https://drive.google.com/file/d/0BzuQe1Onrxp6VE5JcllfMW5SMmc/view
예전에 '노가다 없는 텍스트 분석을 위한 한국어 NLP'라는 Pycon2017에 발표된 내용을 소개한 적이 있습니다.
여기에 용언추출과 품사판별 등 새로운 내용이 추가된 발표자료입니다.
보통 형태소분석기는 규칙이나 사전 및 코퍼스(품사가 사람에 의해 태그된)를 통해 형태소를 판별합니다. 하지만 사전에 없는 단어가 포함된 문장에서는 올바른 결과를 생성하지 못합니다. 이를 해결하기 위해 cohension이라는 기법을 사용했는데 단어가 분리되는 지점을 통계적으로 계산하여 판별합니다.
아이오아이는걸그룹이다
: 아 -> 이 (14%)
: 아이 -> 오 (6%)
: 아이오 -> 아 (87%)
: 아이오아 -> 이 (100%)
: 아이오아이 -> 는 (27%)
위와 같이 '아이오아이+는'에서 다시 확률이 작아지는데 여기서 단어가 나누어진다는 것을 알 수 있습니다.
단점은 용언으로 품사를 나눌때 정확하지 않다는 점입니다. 단순히 캐릭터 기준으로 단어를 자르기 때문에 용언의 어근을 정확히 추출하지 못합니다. 그래서 같은 어근을 가진 단어가 별개로 인식되기도 합니다.
갔다
-> 가+았+다 (형태소분석기)
-> 갔+다 (cohension)
가다
-> 가+다 (형태소분석기)
-> 가+다 (cohension)
발표 자료에 나온 단어 추출, 토크나이저, 품사판별, 전처리 등 다양한 기능들이 포함된 자연어처리 라이브러리를 따로 제공하고 있으니 참고 바랍니다.
< soynlp >
-> https://github.com/lovit/soynlp