레플리
글 수 282

한국어 형태소 분석기 성능 비교 - khaiii

조회 수 1447 추천 수 0 2018.12.10 17:39:07


https://iostream.tistory.com/144?fbclid=IwAR3FX3lo2njXmTPYyPdsBJhk_KdfRPVLjPcwH70wo31z-GSkNikzQUNyLm8

 

 

 

최근에 공개된 카카오의 딥러닝 형태소분석기와 다른 제품들을 비교한 글입니다. 특히 띄어쓰기에서 가장 많은 차이를 보이고 있습니다.

 

한글은 영어와 다르게 단어들이 붙어있어도 대부분 독해가 가능합니다. 그래서 구어체(특히 카톡같은 메신저에서)는 띄어쓰기를 생략하는 경우가 아주 많습니다. 제가 mecab을 쓰는 이유가 속도가 빨라서이기도 하지만 띄어쓰기 여부에 상관없이 형태소분석이 잘 되기 때문입니다.

 

khaiii는 한글자 단위로 입력이 들어가는데 빈칸도 하나의 캐릭터로 처리합니다. 그래서 사전기반의 다른 형태소분석기와 다르게 띄어쓰기 처리가 전혀 안된다는 단점이 있습니다. 실제로 현업에 사용하기 위해서는 이에 대한 기능이 반드시 필요할 듯 합니다. 앞으로 지속적인 업데이트가 될거라 생각합니다.

엮인글 :
List of Articles
제목 글쓴이 날짜 조회 수
클로바X의 사용량 제한 - QPM과 TPM 깊은바다 2024-04-01 92
Pi를 만든 Inflection AI, MS로 대거 이직한 이유 깊은바다 2024-03-25 109
LLaMA나 Mistral이 계속 무료로 유지될 수 있을까 깊은바다 2024-03-05 236
GPT-3.5와 클로바X 가격 비교 file 깊은바다 2024-02-25 267
OpenAI, 성능은 높아지고 가격은 싸진 새로운 모델 공개 file 깊은바다 2024-01-26 321
AI 휴대용 기기 R1을 만든 Rabbit의 대표 Jesse Lyu 깊은바다 2024-01-12 247
화면을 보고 스마트폰 앱 사용방법을 배우는 모델 - AppAgent file 깊은바다 2024-01-08 300
LLM의 새로운 기법 - Merge와 DPO file 깊은바다 2024-01-02 1138
업스테이지 SOLAR 10.7B에서 사용한 DUS 모델 확장 방법 file 깊은바다 2023-12-27 452
죽은 아들의 AI 아바타를 만든 중국의 부모 file 깊은바다 2023-12-21 180
Private sLLM - 어떻게 만들고 어떻게 배포할까? file 깊은바다 2023-12-18 353
GPT-4가 내 여자친구보다 나를 더 잘 알까? file 깊은바다 2023-12-12 166
FSM과 생성 에이전트의 차이점 깊은바다 2023-11-22 183
RAG를 사용한 페르소나 챗봇 - ChatHaruhi file 깊은바다 2023-10-17 706
LLM Multi Agent: Customer Service를 기깔나게 자동화하는 방법 file [1] 깊은바다 2023-10-09 641