레플리
글 수 282

카카오의 딥러닝 기반 형태소 분석기

조회 수 497 추천 수 0 2018.11.30 20:05:10


 

https://brunch.co.kr/@kakao-it/308

 

 

 

카카오의 딥러닝 형태소분석기 khaiii가 공개되었습니다. 보통 규칙 기반은 먼저 가능한 품사 조합들을 미리 정해진 룰에 따라 목록을 만듭니다. 그리고 사람에 의해 품사가 태깅된 코퍼스에서 가장 확률이 높은 항목을 찾습니다.

 

입력 : 디자인하여
목록 : 디자인(NNG) * 하(VV / XSV / XSA / NNG) * 여(EC / EF / IC) = 12개
결정 : 디자인(NNG) - 하(XSV) - 여(EC) -> 가장 높은 확률!

 

 

 

딥러닝으로도 형태소분석을 할 수 있는데 RNN 같은 방식을 많이 사용합니다. 그러나 khaiii는 빠른 속도를 위해 CNN으로 되어있습니다. 특히 단어 단위가 아니라 음절(한글자) 기준으로 동작합니다. 중심 글자 양 옆으로 정해진 윈도우 만큼 입력을 받고 주변의 글자들을 참고하여 품사를 분류합니다.

 

세종 코퍼스의 오류를 수정하고 새로운 데이터를 추가하여 공개를 하려고 했는데 저작권 문제로 불가능하다고 합니다. 좋은 학습 자료를 활용하지 못해서 안타깝네요.

 

 

 

< 소스 코드 >
-> https://github.com/kakao/khaiii

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수sort
구글의 초거대모델 PaLM의 추론과 상식 능력 file 깊은바다 2022-05-20 838
DALL-E를 능가하는 OpenAI의 GLIDE 깊은바다 2021-12-27 836
네이버 뉴스 댓글로 사전훈련한 구어체 모델 - KcBERT 깊은바다 2020-07-20 813
러시아의 구글 얀덱스, 100B 초거대모델 무료 공개 깊은바다 2022-06-26 806
GPT-3 패러다임을 바꿀 미친 성능의 인공지능 등장 및 활용 사례 10가지 깊은바다 2020-09-14 799
ChatGPT 프롬프트 엔지니어링 - 다양한 말투로 대답하기 file 깊은바다 2023-02-17 798
ChatGPT와 유사한 서비스 - Chatsonic file 깊은바다 2023-01-09 794
GPT3로 하는 리액트 프로그래밍 file 깊은바다 2020-07-19 769
HyperCLOVA로 만드는 캐릭터 챗봇 file 깊은바다 2021-11-26 761
LLM이 서로 협력하여 프로그램을 개발 - ChatDev file 깊은바다 2023-08-16 750
GPT3가 상식을 가지고 있을까 깊은바다 2020-07-24 741
Llama 2의 RLHF 구현 방법 깊은바다 2023-07-19 717
GPT-3를 헬스케어 서비스에 적용했을 때의 문제점들 깊은바다 2020-11-04 707
LLM의 창발적인 현상인 CoT(Chain of Thouht) 소개 file 깊은바다 2023-07-27 704
워드 임베딩에 대한 아주 쉬운 설명 - The Illustrated Word2vec 깊은바다 2019-04-09 703