레플리
글 수 283

한국어 형태소 분석기 성능 비교 - khaiii

조회 수 1447 추천 수 0 2018.12.10 17:39:07


https://iostream.tistory.com/144?fbclid=IwAR3FX3lo2njXmTPYyPdsBJhk_KdfRPVLjPcwH70wo31z-GSkNikzQUNyLm8

 

 

 

최근에 공개된 카카오의 딥러닝 형태소분석기와 다른 제품들을 비교한 글입니다. 특히 띄어쓰기에서 가장 많은 차이를 보이고 있습니다.

 

한글은 영어와 다르게 단어들이 붙어있어도 대부분 독해가 가능합니다. 그래서 구어체(특히 카톡같은 메신저에서)는 띄어쓰기를 생략하는 경우가 아주 많습니다. 제가 mecab을 쓰는 이유가 속도가 빨라서이기도 하지만 띄어쓰기 여부에 상관없이 형태소분석이 잘 되기 때문입니다.

 

khaiii는 한글자 단위로 입력이 들어가는데 빈칸도 하나의 캐릭터로 처리합니다. 그래서 사전기반의 다른 형태소분석기와 다르게 띄어쓰기 처리가 전혀 안된다는 단점이 있습니다. 실제로 현업에 사용하기 위해서는 이에 대한 기능이 반드시 필요할 듯 합니다. 앞으로 지속적인 업데이트가 될거라 생각합니다.

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수
LLM Multi Agent: Customer Service를 기깔나게 자동화하는 방법 file [1] 깊은바다 2023-10-09 647
사진을 인식할 수 있는 ChatGPT 멀티모달 버전 공개 file 깊은바다 2023-09-26 279
Poe에 추가된 업스테이지의 LLM, Solar-70b file 깊은바다 2023-09-18 438
RAG 아키텍처를 위한 임베딩 모델의 선택에 대해 깊은바다 2023-09-14 519
LLM의 미래는 자율행동과 멀티 에이전트 깊은바다 2023-08-30 300
LLM이 서로 협력하여 프로그램을 개발 - ChatDev file 깊은바다 2023-08-16 751
GPT-4에 CoT 프롬프를 적용하여 2023 수능 국어 1등급 달성 file 깊은바다 2023-08-08 623
LLM의 창발적인 현상인 CoT(Chain of Thouht) 소개 file 깊은바다 2023-07-27 708
RAG 아키텍처의 이해 깊은바다 2023-07-23 1329
GPT-4 세부구조에 대한 정보 유출 깊은바다 2023-07-20 458
Llama 2의 RLHF 구현 방법 깊은바다 2023-07-19 727
한국어 LLM 민주화의 시작 KoAlpaca file 깊은바다 2023-07-17 1060
레포트를 써주는 LLM - GPT Researcher file 깊은바다 2023-07-13 411
LLM 챗봇의 특징 2가지 - RAG와 Function 깊은바다 2023-07-06 1200
RAG(Retrieval-Augmented Generation) - LLM의 환각을 줄이는 방법 file 깊은바다 2023-07-04 9683