Yoshua Bengio 등이 2003년에 발표한 'A Neural Probabilistic Language Model' 논문은 전통적 n-gram 기반 언어 모델의 한계를 극복하기 위해 신경망을 활용한 확률적 언어 모델(Neural Probabilistic Language Model)을 제안한다.
이 논문은 단어의 분산 표현을 학습하면서, 동시에 단어 시퀀스의 결합 확률도 학습하는 혁신적인 접근법을 제시한다.
여기서 분산 표현은 임베딩을 의미한다.
주요 내용 요약
1. 기존 언어 모델의 한계
- 전통적 n-gram 모델은 주어진 단어 시퀀스에서 (n-1)개의 이전 단어만 보고 다음 단어의 확률을 예측한다.
- n-gram 모델은 훈련 데이터에 없는 시퀀스에 대해 일반화가 어렵고, 단어의 의미적 유사성을 반영하지 못한다.
- 이런 한계는 '차원의 저주'라고 부를 수 있고, 실제로 테스트에서 마주하는 시퀀스가 훈련에서 본 것과 다를 확률이 높다.
2. 제안된 모델의 핵심 아이디어
- 단어를 고차원 임베딩 공간에 분산 표현으로 매핑한다.
- 신경망(MLP, Multi-Layer Perceptron)을 사용하여 (n-1)개의 이전 단어 임베딩을 입력받아 다음 단어의 확률 분포를 예측한다.
- 이 과정에서 단어 임베딩과 조건부 확률 함수 $P(w_t|w_{t-1}, \cdots, w_{t-n+1}$를 동시에 학습한다.
3. 모델 구조 및 학습 방법
- 입력: (n-1)개의 이전 단어를 임베딩 벡터로 변환하여 연결한다.
- 은닉층: 비선형 활성화 함수(tanh 등)를 사용하는 은닉층을 거친다.
- 출력층: 어휘 집합(V)의 크기만큼의 score vector를 산출하고, softmax 함수를 통해 다음 단어의 확률 분포를 출력한다.
- 학습: 실제 다음 단어와 예측 확률 분포가 일치하도록 cross-entropy loss를 최소화하면서 학습을 진행한다.
4. 일반화와 분산 표현의 장점
- 임베딩 공간에서 의미적으로 비슷한 단어들이 가까이 위치하기 때문에 훈련 데이터에 없던 시퀀스도 유사 단어 조합일 경우 높은 확률을 부여할 수 있다.
- 예를 들어, 'The cat is walking in the bedroom'을 봤다고 한다면 'A dog was running in a room'도 자연스럽게 높은 확률로 예측할 수 있다.
5. 실험 및 성능 평가
- 실험 결과 NPLM은 기존 n-gram 모델보다 퍼플렉시티가 낮아 더 우수한 성능을 보인다.
장점, 한계와 도전 과제, 후속 영향
장점
- 분산 표현 도입: 단어 임베딩 개념을 도입해, 이후 word2vec, GloVe 등 다양한 임베딩 기반 모델의 기초가 되었다.
- 일반화 능력 향상: 훈련 데이터에 없는 조합도 의미적 유사성을 활용해 처리가 가능하다.
- 신경망 활용: 비선형 함수와 다층 구조를 통해 기존 n-gram의 한계를 극복했다.
한계 및 도전과제
- 계산량: 당시 기준 수백만 파라미터와 대규모 데이터셋을 효과적으로 학습하는 것이 큰 도전이었고, 어려움을 겪었다.
- 긴 문맥 처리 한계: n-gram 구조를 따르기 때문에 여전히 긴 문맥을 완전히 반영하지는 못했다. 논문에서도 RNN 등을 언급하고 있으며, RNN, LSTM, Transformer 등으로 발전하면서 이 한계가 극복되었다.
'A Neural Probabilistic Language Model' 논문은 신경망과 분산 표현을 결합하여 언어 모델의 일반화 성능을 크게 향상시켰다. n-gram의 한계를 극복하고, Word Embedding이라는 새로운 패러다임을 제시함으로써, 이후 NLP 분야의 급격한 발전을 이끌었다.
'데이터 사이언스 공부' 카테고리의 다른 글
| [논문 번역] MixMatch: A Holistic Approach to Semi-Supervised Learning (1) (0) | 2025.04.28 |
|---|---|
| [논문 번역] A Neural Probabilistic Language Model (2) (1) | 2025.04.25 |
| 00. [논문 번역] Attention is All You Need (2) (0) | 2025.04.07 |
| 00. [논문 번역] Attention is All You Need (1) (0) | 2025.04.07 |
| 00. np.log와 np.log1p의 차이 (0) | 2024.11.14 |