트레이닝 셋(training set)은 기계 학습(machine learning) 및 인공지능 분야에서 모델을 학습시키는 데 사용되는 데이터의 집합을 의미한다. 일반적으로 입력 벡터(input vector)와 이에 대응하는 정답 또는 목표 값인 응답 벡터(answer vector)로 구성되며, 지도 학습(supervised learning) 방법과 함께 사용된다.
트레이닝 셋의 주요 목적은 인공지능 모델(예: 신경망, 나이브 베이즈 분류기 등)이 데이터의 패턴을 학습하고, 입력과 출력 간의 관계를 파악하도록 훈련(train)시키는 것이다. 학습 과정에서 모델은 트레이닝 셋을 반복적으로 처리하며 가중치(weight)와 바이어스(bias) 같은 모델 파라미터를 점진적으로 업데이트한다. 이때 손실 함수(loss function)를 통해 모델의 예측값과 실제 정답 간의 차이를 측정하고, 그 차이를 최소화하는 방향으로 파라미터가 조정된다.
실무에서는 보유한 전체 데이터를 트레이닝 셋, 검증 셋(validation set), 테스트 셋(test set)으로 분할하여 사용하는 것이 일반적이다. 트레이닝 셋은 모델 학습에 직접 사용되고, 검증 셋은 학습 과정에서 모델의 하이퍼파라미터를 튜닝하거나 과적합(overfitting)을 방지하는 데 사용되며, 테스트 셋은 최종 학습이 완료된 모델의 성능을 평가하기 위해 별도로 보관된다. 전통적으로 전체 데이터의 약 70%를 트레이닝 셋으로, 나머지 30%를 테스트 셋으로 할당하는 방식이 널리 사용되지만, 데이터의 규모와 특성에 따라 비율은 달라질 수 있다.
트레이닝 셋의 구성과 품질은 모델의 성능에 결정적인 영향을 미친다. 데이터에 편향(bias)이 있거나 노이즈가 포함된 경우, 모델이 왜곡된 패턴을 학습하여 실제 환경에서 제대로 작동하지 않을 수 있다. 따라서 트레이닝 셋은 해당 문제 영역을 대표할 수 있도록 신중하게 수집되고 전처리되어야 한다.