레플리
글 수 72


K-001.png

 

https://news.naver.com/main/read.nhn?mode=LSD&mid=sec&sid1=103&oid=014&aid=0004482548

 

 

 

"국립국어원은 인공지능의 한국어 처리 능력 향상에 필수적인 한국어 학습 자료 13종 18억 어절 분량을 25일 국립국어원 '모두의 말뭉치' 사이트에서 공개한다고 밝혔다."

 

"문화체육관광부와 국립국어원은 1998년에서 2007년까지 '21세기 세종계획'을 추진해 약 2억 어절의 자료를 구축, 공개한 바 있다. 10여 년이 지난 뒤 이번에 다시 공개하는 자료는 예전보다 9배 많은 것으로 그동안 공개된 학습 자료의 부족으로 곤란을 겪던 한국어 처리 기술이 든든한 지원군을 만날 수 있게 되었다."

 

 

 

그동안 한국어는 보통 세종 말뭉치를 사용했습니다. 이번에 9배나 더 큰 규모의 새로운 말뭉치가 공개됐습니다. 특히 메신저 대화, 웹 자료 등 구어체 텍스트가 많은게 특징입니다. 아래 사이트에서 신청 후 받으실 수 있습니다.

 

 

 

< 모두의 말뭉치 >
https://corpus.korean.go.kr/

 

List of Articles
제목 글쓴이 날짜 조회 수sort
세종 말뭉치보다 9배 더 큰 한글 코퍼스 공개 - 모두의 말뭉치 file 깊은바다 2020-08-27 3155
노가다 없이 한국어 뉴스/댓글 데이터 분석하기 깊은바다 2018-10-30 3094
검색을 통해 지식그래프를 바로 생성하는 알고리즘 file 깊은바다 2019-08-02 3052
한국어 오픈소스 자연어처리 라이브러리 - Koshort 깊은바다 2018-05-20 2937
단어 간 유사도 파악 방법 깊은바다 2018-02-01 2855
개인 성격 분석(Watson Personality Insights) 데모 file 깊은바다 2017-10-02 2812
네이버 사용자를 만족시켜라 - 의도파악과 의미검색 깊은바다 2018-01-28 2664
텍스트 분석을 자동으로 해주는 서비스 - KoALA 깊은바다 2018-10-31 2088
구글 신경망 번역의 원리 깊은바다 2017-02-28 1984
자연어처리의 개념 깊은바다 2018-03-24 1930
문서의 카테고리를 분류할 수 있는 나이브 베이즈 알고리즘 깊은바다 2017-08-31 1881
형태소 분석의 이해 깊은바다 2017-05-01 1798
KoNLPy - 파이썬 한국어 NLP 깊은바다 2017-06-14 1693
파이썬 한국어 말뭉치 패키지 - Korpora file 깊은바다 2020-09-12 1512
SentiWordNet과 감성분석 깊은바다 2018-06-04 1456