WIPIVERSE

환각 (인공지능)

인공지능(AI)에서의 환각(hallucination, 할루시네이션)은 대규모 언어 모델(LLM)이나 생성형 AI가 실제로 존재하지 않거나 사실과 다른 정보를 마치 진실인 것처럼 그럴듯하게 생성하는 현상을 의미한다. 이 용어는 인간 심리학에서의 환각 현상에 빗대어 명명되었으며, AI가 학습 데이터에 기반하지 않은 내용을 확신에 차서 출력하는 특성을 비유적으로 표현한 것이다.

개념 및 정의

AI 환각은 모델이 학습 데이터의 패턴을 기반으로 확률적으로 텍스트나 이미지를 생성하는 과정에서 사실 검증 없이 잘못된 정보를 생성하는 현상이다. 이는 모델이 '이해'가 아닌 '확률적 생성'을 수행하기 때문에 발생한다. OpenAI는 언어 모델이 환각을 일으키는 이유에 대해, 기존의 평가 방식이 모델이 정답을 맞히면 점수를 주고 모른다고 답하면 0점을 부여하기 때문에, 모델이 불확실한 상황에서도 답을 추측하도록 학습하는 경향이 있다고 설명한다. IBM은 AI 환각을 "대규모 언어 모델이 존재하지 않는 패턴이나 객체를 인식·출력하는 현상"으로 정의한다.

발생 원인

AI 환각의 발생 원인은 크게 데이터, 훈련 방식, 추론 과정의 세 가지 측면으로 나눌 수 있다.

데이터 측면: 사전 훈련 데이터에 가짜 뉴스나 근거 없는 소문과 같은 잘못된 정보가 포함될 경우 모델이 이를 사실인 것처럼 암기하고 생성할 가능성이 높다. 또한 훈련 데이터에 성별이나 국적 등 사회적 편향이 내재된 경우 모델이 특정 편향을 증폭시켜 환각을 생성할 수 있다. 훈련 데이터에서 드물게 등장하는 전문적이거나 희소한 지식(롱테일 지식)의 경우에도 환각이 발생하기 쉽다.

훈련 방식 측면: 대부분의 LLM은 인과 언어 모델링(causal language modeling) 방식으로 훈련되는데, 이는 앞에 나온 단어들을 보고 다음에 올 단어를 예측하는 단방향적 훈련 방식으로 문맥 간 복잡한 상호의존성을 완전히 반영하지 못한다. 또한 모델이 훈련 중에는 정답을 보고 배우지만 실제 생성 시에는 스스로 만든 이전 단어에 의존해 다음 단어를 예측하는 과정에서 초기 오류가 연쇄적으로 확대되는 노출편향(exposure bias)이 발생한다.

추론 과정 측면: LLM은 답변의 다양성과 창의성을 높이기 위해 무작위성을 도입한 디코딩 전략을 사용하는데, 이러한 무작위성이 높아질수록 비사실적인 내용을 생성할 위험이 증가한다. 또한 모델이 유창성에 지나치게 집중한 나머지 명령어를 망각하고 환각으로 이어질 가능성도 있다.

유형 분류

AI 환각은 다양한 기준으로 분류된다.

출처 기반 분류(전통적 분류):

  • 내재적 환각(Intrinsic Hallucination): AI 모델에게 답변의 근거가 될 자료가 제공되었을 때, 그 자료를 잘못 해석하거나 계산 오류를 일으켜 모순되는 정보를 생성하는 경우.
  • 외재적 환각(Extrinsic Hallucination): 답변의 근거가 될 자료가 제공되지 않았거나 자료 밖의 지식을 사용할 때, 모델의 답변이 객관적 사실과 모순되는 경우.

형태 기반 분류(LLM 등장 이후):

  • 사실성 환각(Factuality Hallucination): 생성된 내용이 실제 세계의 사실과 불일치하는 경우. '사실적 모순'(개체 오류, 관계 오류)과 '사실 조작'(검증 불가능성, 과장된 주장)으로 세분화된다.
  • 충실성 환각(Faithfulness Hallucination): 생성된 내용이 사용자 입력으로부터 벗어나거나 내용 내부에 자체적인 일관성이 부족한 경우. 지시 불일치, 맥락 불일치, 논리적 불일치로 세분화된다.

사용 사례 기반 분류(NTT 데이터): 시각적 환각, 텍스트 환각, 콘텐츠 확장 환각, 추론 환각, 편향 환각, 맥락적 환각 등으로 구분된다.

주요 사례

AI 환각의 대표적인 사례로는 다음과 같은 것들이 알려져 있다.

  • 세종대왕 맥북프로 던짐 사건: 2023년 초기 ChatGPT가 "세종대왕이 맥북프로를 던졌다"는 허위 정보를 생성한 사례로, 한국 대중에게 AI 환각 현상을 각인시킨 대표적 사례이다.
  • Google Bard의 오류: Google의 Bard 챗봇이 제임스 웹 우주망원경이 태양계 밖 행성의 세계 최초 이미지를 포착했다고 잘못 주장한 사례.
  • 법률 분야: 변호사가 ChatGPT가 생성한 허위 판례를 아무런 검토 없이 법원에 제출한 사례, 경찰이 ChatGPT를 활용해 존재하지 않는 법리를 인용한 불송치 결정문을 작성한 사례 등이 보고되었다.
  • 의료 분야: 영국 NHS 시스템에서 AI가 환자 기록을 요약하는 과정에서 실제로 존재하지 않는 당뇨병 진단과 약물 정보를 생성한 사례가 알려져 있다.

대응 및 완화 방안

AI 환각을 줄이기 위한 다양한 기술적 접근법이 연구·적용되고 있다.

  • 검색 증강 생성(RAG): 모델이 외부 데이터베이스나 문서를 실시간으로 검색하여 관련 정보를 참조한 후 답변을 생성하는 방식.
  • Chain-of-Verification(CoVe): 모델이 초기 응답을 생성한 후 스스로 검증 질문을 만들고 독립적으로 평가하여 최종 응답을 도출하는 구조.
  • 인간 피드백 기반 강화학습(RLHF): 인간 평가자의 선호도에 따라 모델을 학습시키는 기법.
  • 고품질 학습 데이터 사용: 다양하고 균형 잡힌 데이터로 모델을 학습시켜 편향을 최소화.
  • 응답 제한 및 필터링: 확률적 임곗값과 필터링 도구를 사용하여 모델의 출력 경계를 정의.

창의적 활용 가능성

AI 환각은 부정적 측면만 있는 것은 아니다. 예술·디자인 분야에서는 AI 환각이 초현실적이고 상상력이 풍부한 이미지를 생성하는 창작 도구로 활용된다. 과학 연구 분야에서는 2024년 노벨화학상 수상자 데이비드 베이커(David Baker) 교수의 연구팀이 AI 환각을 활용하여 자연에 존재하지 않는 새로운 단백질을 설계하는 성과를 거두었다. 또한 박테리아 감염을 줄이는 새로운 카테터 설계에도 AI 환각이 활용된 사례가 보고되었다.

용어에 대한 논의

일부 과학자들은 '환각(hallucination)'이라는 용어가 마약에 취한 상태를 연상시키고, 기술적 문제를 인격화하여 AI가 의지를 가지고 헛소리를 내뱉는다는 이미지를 준다며 '예측 오류(prediction error)'나 '출력 왜곡(output distortion)' 등으로 대체해야 한다는 주장을 제기하기도 한다. 한국지능정보사회진흥원(NIA)의 2025년 보고서에서는 '추론적 편차(Inferential Deviation)'와 같은 중립적·기능적 용어로의 재해석을 제안한 바 있다.

둘러보기

더 찾아볼 만한 주제

    전체 문서 보기