레플리
글 수 72

한국어 채팅 데이터로 머신러닝 하기

조회 수 6086 추천 수 0 2018.04.25 16:02:46


Word Embedding - Word2Vec
• 단어 정보를 이용하여 머신러닝을 하려면 단어를 vector로 변환해주어야 합니다.

• 이를 word embedding 또는 word representation이라고 합...

 

https://www.slideshare.net/hanseokjo5/little-big-data-1-94862151

 

 

 

스캐터랩은 카톡감정분석, 연애의 과학 등 모바일 앱을 개발하는 회사입니다. 카톡 대화내용을 분석하여 두 사람 사이의 감정이나 정보들을 알려주고 연애에 대해 조언을 하주는 서비스입니다.

 

여기서 어떻게 자연어처리를 했는지 설명하는 슬라이드입니다. 메신저 대화는 문법에 맞지 않은 문장이 많은데 이를 해결한 방법이 많은 참고가 될 것 같습니다.

 

 

 

현재 세계에서 한글 대화 데이터를 가장 많이 보유한 회사가 스캐터랩이 아닐까 생각합니다. 메신저 회사는 공개한 바에 따르면 대화 내용을 영구적으로 보관하지 않는다고 합니다.

 

머신러닝에 있어서 가장 중요한 것은 무엇보다 데이터입니다. 그만큼 앞으로 자연어분석에 있어 이 회사가 유리한 위치를 차지할 가능성이 높습니다. 최근에는 자연스러운 일상 대화를 제공하는 핑퐁이라는 챗봇 API를 공개했는데 앞으로 여러 챗봇에서 사용되지 않을까 싶습니다.

엮인글 :
List of Articles
제목 글쓴이 날짜sort 조회 수
자연어로 빅데이터 분석 - 왓슨 애널리틱스 깊은바다 2016-03-21 732
사진을 문장으로 변환하는 구글의 새로운 기술 file 깊은바다 2016-03-25 835
자연어처리와 형태소분석의 기초 깊은바다 2016-03-31 1215
차원이 다른 구글 번역기의 도래 깊은바다 2017-02-28 427
구글 신경망 번역의 원리 깊은바다 2017-02-28 1984
네이버 번역앱 파파고 개발자 인터뷰 file 깊은바다 2017-02-28 1421
국민대 강승식 교수의 형태소 분석기 깊은바다 2017-03-24 1285
마르코프 체인을 사용한 자동 문장 생성 file 깊은바다 2017-04-05 8977
자바 형태소 분석기 open-korean-txt 깊은바다 2017-04-11 5435
형태소 분석의 이해 깊은바다 2017-05-01 1798
마르코프 체인으로 만든 p봇 깊은바다 2017-05-01 894
빠르고 성능 좋은 형태소분석기 MeCab-Ko 깊은바다 2017-05-02 4422
KoNLPy - 파이썬 한국어 NLP 깊은바다 2017-06-14 1693
문서의 카테고리를 분류할 수 있는 나이브 베이즈 알고리즘 깊은바다 2017-08-31 1881
문서에서 핵심 단어를 찾는 TF-IDF 알고리즘 file 깊은바다 2017-09-07 4258