F 스코어(F-score)는 이진 분류(binary classification) 및 정보 검색(information retrieval) 시스템의 통계 분석에서 예측 성능을 측정하는 지표이다. F 측도(F-measure)라고도 불린다. 이는 테스트의 정밀도(precision)와 재현율(recall)을 통해 계산된다. 정밀도는 양성으로 예측된 모든 샘플의 수로 나눈 참양성(True Positive) 결과 수이며, 재현율은 실제 양성인 모든 샘플의 수로 나눈 참양성 결과 수이다. 정밀도는 양성 예측 값(positive predictive value)이라고도 하며, 재현율은 진단 이진 분류에서 민감도(sensitivity)라고도 한다.
가장 널리 사용되는 형태는 F1 스코어(F1 score)로, 정밀도와 재현율의 조화 평균(harmonic mean)이다. F1 스코어는 하나의 측정값으로 정밀도와 재현율을 대칭적으로 나타낸다. F 스코어의 가능한 최댓값은 1.0으로 완벽한 정밀도와 재현율을 의미하며, 최솟값은 0이다.
더 일반화된 형태로 Fβ 스코어가 있으며, 여기서 β는 양의 실수로 재현율이 정밀도보다 몇 배 더 중요한지를 나타낸다. β=1이면 F1(균형), β=2이면 재현율에 더 높은 가중치, β=0.5이면 정밀도에 더 높은 가중치를 부여한다.
F 스코어의 명칭(F-measure)은 1992년 제4차 메시지 이해 학술회의(MUC-4)에서 도입될 때, Van Rijsbergen의 저서에 등장하는 다른 F 함수의 이름에서 유래한 것으로 알려져 있다.
F 스코어는 정보 검색에서 검색, 문서 분류, 질의 분류 성능 측정에 널리 사용되며, 자연어 처리 분야에서 개체명 인식, 단어 분할 등의 평가에도 폭넓게 활용된다. 또한 기계 학습에서 분류 모델의 성능 평가 지표로도 사용된다. 다만 F 스코어는 참음성(True Negative)을 고려하지 않으므로, 일부 연구자들은 매튜스 상관 계수(MCC)나 Cohen의 카파 계수 등이 이진 분류 평가에 더 적합하다고 지적하기도 한다.