개요
LeNet은 1988년부터 1998년 사이에 AT&T 벨 연구소(AT&T Bell Laboratories)의 연구 그룹이 얀 르쿤(Yann LeCun)을 중심으로 개발한 합성곱 신경망(Convolutional Neural Network, CNN) 아키텍처 시리즈이다. LeNet은 손으로 쓴 숫자와 문자(필기체)가 포함된 작은 흑백 이미지를 인식하도록 설계되었으며, 실제로 미국 ATM 기기에서 수표 금액을 읽는 용도로 상용화되었다.
일반적으로 별도의 번호 없이 "LeNet"이라고만 지칭할 경우, 가장 널리 알려진 1998년 버전인 LeNet-5를 의미한다.
개발 역사
- 1988년: 얀 르쿤이 AT&T 벨 연구소에 합류하여 필기체 우편번호 인식 신경망 연구 시작.
- 1989년: LeNet-1(프로토타입) 발표. 역전파(backpropagation) 알고리즘을 실제 응용에 적용한 최초의 사례 중 하나. 미국 우정청(USPS)의 필기체 우편번호 데이터로 학습.
- 1994년: MNIST 데이터베이스 개발 및 LeNet-4 등장.
- 1998년: 얀 르쿤, 레온 보투(Leon Bottou), 요슈아 벤지오(Yoshua Bengio), 패트릭 해프너(Patrick Haffner)가 LeNet-5를 포함한 논문 "Gradient-based learning applied to document recognition" 발표. 이 논문은 현재까지도 딥러닝 분야에서 가장 많이 인용된 논문 중 하나.
LeNet-5 아키텍처
LeNet-5는 총 7개 레이어(입력 제외)로 구성되며, 약 60,000개의 학습 가능한 파라미터를 가진다.
| 레이어 | 유형 | 입력 → 출력 크기 | 설명 |
|---|---|---|---|
| 입력 | - | 1 × 32 × 32 | 흑백 이미지 |
| C1 | 합성곱(Convolution) | 1×32×32 → 6×28×28 | 5×5 커널 6개 |
| S2 | 서브샘플링(Subsampling) | 6×28×28 → 6×14×14 | 2×2 평균 풀링 (학습 가능한 가중치 포함) |
| C3 | 합성곱 | 6×14×14 → 16×10×10 | 5×5 커널 (부분 연결 패턴 사용) |
| S4 | 서브샘플링 | 16×10×10 → 16×5×5 | 2×2 평균 풀링 |
| C5 | 합성곱 | 16×5×5 → 120×1×1 | 16×5×5 커널 120개 |
| F6 | 완전연결(Fully Connected) | 120 → 84 | 84개 유닛 |
| 출력 | RBF (방사 기저 함수) | 84 → 10 | 10개 숫자 클래스(0~9) |
주요 특징
- 합성곱 + 서브샘플링(풀링) + 비선형 활성함수의 조합으로 구성
- 활성함수로 tanh(하이퍼볼릭 탄젠트) 사용 (LeCun's tanh: 1.7159·tanh(2x/3))
- 희소 연결(Sparse connection) 패턴을 사용하여 계산 복잡도 감소
- 출력층에 RBF(Radial Basis Function) 유닛 사용
응용 분야
LeNet의 가장 대표적인 응용은 필기체 숫자 인식이다. 1989년 LeNet 개발 이후, AT&T DSP-32C 디지털 신호 프로세서에 탑재되어 초당 10개의 숫자를 정규화 및 분류할 수 있었다. 이후 NCR(AT&T에 인수됨)과 협력하여 ATM 기기에서 수표 금액을 읽는 시스템으로 상용화되었다. 2001년 기준으로 미국 내 전체 수표의 약 10%인 하루 약 2,000만 장의 수표를 처리한 것으로 추정된다.
역사적 의의
LeNet은 합성곱 신경망(CNN)의 시초로 평가된다. LeNet이 정의한 합성곱 레이어, 풀링 레이어, 완전연결 레이어의 기본 구성 요소는 이후 등장한 AlexNet(2012), VGGNet, GoogLeNet, ResNet 등 모든 현대 CNN 아키텍처의 기초가 되었다. 다만 당시에는 GPU 등 하드웨어의 부족과 SVM 등 다른 알고리즘과의 경쟁으로 인해 널리 주목받지 못했으나, 2012년 AlexNet의 성공 이후 CNN이 컴퓨터 비전 분야의 지배적 방법론으로 자리잡는 계기를 마련했다.