레플리
글 수 281


img

 

https://tykimos.github.io/2017/08/17/Text_Input_Binary_Classification_Model_Recipe/

 

 

 

영화정보 사이트인 IMDb의 영화평점 데이터를 사용해서 케라스로 학습하는 코드입니다. 자연어를 어떻게 벡터로 임베딩을 하는지 간단하게 설명해 보겠습니다.

 

먼저 데이터셋에 있는 모든 단어를 빈도수에 따라 정렬하고 ID를 부여합니다. 보통 편의를 위해서 최대 단어수를 지정합니다. 여기서는 5개의 단어만 존재한다고 가정하고 빈도수는 임의로 설정하겠습니다.

 

--------------------
love -> 0
i -> 1
so -> 2
you -> 3
much -> 4
--------------------

 

그리고 문장의 단어를 ID로 변환합니다.

 

----------------------------
i love you so much
-> [1, 0, 3, 2, 4]
----------------------------

 

 

 

만약 단어의 수가 적다면 다음과 같이 간단하게 각각의 ID를 벡터로 지정하는 One-Hot Encoding으로 변환할 수도 있습니다.

 

-------------------------------------
i -> (0, 1, 0, 0, 0)
love -> (1, 0, 0, 0, 0)
you -> (0, 0, 0, 1, 0)
so -> (0, 0, 1, 0, 0)
much -> (0, 0, 0, 0, 1)
-------------------------------------

 

 

 

하지만 보통은 차원의 수를 줄이기 위해 임베딩 함수를 이용합니다. 전체 단어수는 5, 임베딩 벡터 크기는 3, 한 문장의 단어 개수는 5일때 아래와 같이 구현을 합니다.

 

----------------------------------------------------------------
model.add(Embedding(5, 3, input_length=5))
----------------------------------------------------------------

 

임베딩의 초기값은 랜덤하게 지정이 되고 학습을 통해 조금씩 업데이트 됩니다. Word2Vec 같은 방식을 사용하여 초기값을 설정할 수도 있습니다.

 

---------------------------------
i -> (0.5, 0.1, 0.7)
love -> (0.2, 0.6, 0.3)
you -> (0.9, 0.7, 0.5)
so -> (0.4, 0.7, 0.1)
much -> (0.3, 0.4, 0.5)

 

i love you so much
-> {[0.5, 0.1, 0.7], [0.2, 0.6, 0.3], [0.9, 0.7, 0.5], [0.4, 0.7, 0.1], [0.3, 0.4, 0.5]}
---------------------------------

엮인글 :

NeuroWhAI

2018.04.04 03:09:28
*.64.194.131

seq2seq 예시를 만들었는데 임베딩 레이어를 넣어보려고 했더니 정작 디코딩은 어떻게 해야할지 모르겠더라구요. 임베딩한 값을 다시 단어로 바꾸려면 뭐라고 검색을 해봐야 할까요 ㅠ

깊은바다

2018.04.04 23:06:47
*.68.247.188

원핫인코딩 예제는 많은데 임베딩으로 되어 있는 것은 저도 찾기가 어렵네요^^; 제 생각에는 벡터 유사도 비교를 해서 가장 비슷한 걸로 표시하면 될 것 같은데요.

NeuroWhAI

2018.04.05 03:26:04
*.64.194.131

음 역시 가장 가까운 벡터값을 가진 단어를 선택하도록 탐색하는 수 밖에 없겠네요..

List of Articles
제목 글쓴이 날짜sort 조회 수
Pi를 만든 Inflection AI, MS로 대거 이직한 이유 깊은바다 2024-03-25 46
LLaMA나 Mistral이 계속 무료로 유지될 수 있을까 깊은바다 2024-03-05 147
GPT-3.5와 클로바X 가격 비교 file 깊은바다 2024-02-25 187
OpenAI, 성능은 높아지고 가격은 싸진 새로운 모델 공개 file 깊은바다 2024-01-26 293
AI 휴대용 기기 R1을 만든 Rabbit의 대표 Jesse Lyu 깊은바다 2024-01-12 234
화면을 보고 스마트폰 앱 사용방법을 배우는 모델 - AppAgent file 깊은바다 2024-01-08 269
LLM의 새로운 기법 - Merge와 DPO file 깊은바다 2024-01-02 959
업스테이지 SOLAR 10.7B에서 사용한 DUS 모델 확장 방법 file 깊은바다 2023-12-27 375
죽은 아들의 AI 아바타를 만든 중국의 부모 file 깊은바다 2023-12-21 165
Private sLLM - 어떻게 만들고 어떻게 배포할까? file 깊은바다 2023-12-18 299
GPT-4가 내 여자친구보다 나를 더 잘 알까? file 깊은바다 2023-12-12 148
FSM과 생성 에이전트의 차이점 깊은바다 2023-11-22 164
RAG를 사용한 페르소나 챗봇 - ChatHaruhi file 깊은바다 2023-10-17 635
LLM Multi Agent: Customer Service를 기깔나게 자동화하는 방법 file [1] 깊은바다 2023-10-09 568
사진을 인식할 수 있는 ChatGPT 멀티모달 버전 공개 file 깊은바다 2023-09-26 272