AI 환각현상은 어떻게 줄여요?
AI 환각은 모른다고 말해도 손해 보지 않게 만들면 줄어듭니다. OpenAI 논문의 요지와 저희 팀이 겪은 거짓 완료 세 유형, 바꾼 규칙 넷을 적었습니다.
작성일 · 수정일
AI가 「모른다」고 말해도 손해 보지 않게 만들면 줄어듭니다. 모델 자체를 못 고치는 사용자가 할 수 있는 건 세 가지입니다 — 숫자마다 출처를 요구하고, 「0건」「완료」에도 이유를 쓰게 하고, 중요한 결론은 다른 AI가 독립으로 다시 세게 합니다. 저희는 AI 다섯이 실제 서비스를 운영하면서 이 셋을 규칙으로 못 박았습니다.
① 바깥 — 환각은 「추측이 이기는 채점」에서 옵니다
OpenAI 연구진의 논문 「Why Language Models Hallucinate」(Kalai 외, 2025-09)의 요지는, 학습과 평가 절차가 모른다고 답하는 것보다 추측을 보상하기 때문에 모델이 시험 잘 보는 수험생처럼 찍는다는 것입니다. 해법도 거기 있습니다 — 추측이 이기지 않는 채점으로 바꿔야 한다는 것.
② 그로 인해 우리는 — 우리 팀의 채점표를 바꿨습니다
사람 하나와 AI 다섯이 서비스를 돌리면서 실제로 겪은 환각은 「없는 사실을 지어내는 것」보다 「한 척하는 것」이었습니다. 로그는 초록인데 일은 안 된 「거짓 완료」가 셋 있었습니다.
- 장부가 둘(9월): 일꾼이 30분마다 「대기줄 전부 완료」를 찍는 동안, 할 일이 쌓이는 표는 다른 표였습니다. 한 달 넘게 아무도 손대지 않은 일이 거기 있었습니다.
- 벙어리 감시기(9월): 서비스가 살아 있는지 보는 감시기가 8일 동안 5분마다 판정은 했지만, 결과를 사람에게 보내는 마지막 단계가 매번 실패해 경보가 하나도 닿지 않았습니다. 감시기가 조용한 것과 아무 일 없는 것이 겉으로는 같았습니다.
- 자가 틀림(10월): 화면 검사가 세로만 재서, 카드 밖으로 밀려난 버튼이 「전부 통과」로 나왔습니다.
- 1) 숫자마다 출처. 센 값이면 「언제·무엇을·어떻게 셌다」를 붙이고, 못 세면 「셀 수 없음」과 이유를 씁니다. 출처 없는 숫자는 발행 전에 막습니다.
- 2) 「0건」과 「완료」에 이유. 「문제 없음」은 답이 아닙니다. 어떤 검사를 돌렸고 무엇을 못 봤는지까지가 답입니다.
- 3) 독립 재현. 중요한 숫자는 다른 AI가 같은 원장에서 따로 셉니다. 다른 AI가 같은 원장에서 따로 세어 맞췄고, 그 과정에서 변화가 고침 하나 때문이라고 말할 수 없다는 것도 나왔습니다.
- 4) 「모르겠다」를 「아니다」로 뭉개지 않기. 확인 못 한 건 표시해 두고 발행하지 않습니다.
셋 다 AI가 거짓말을 한 게 아니라 「완료」의 뜻을 좁게 잡은 채 맞다고 한 것입니다. 그래서 바꾼 것:
출처
- OpenAI(Kalai·Nachum·Vempala·Zhang) / arXiv · Why Language Models Hallucinate (2025-09, arXiv:2509.04664)
확인일 2026-10-05 · 이용조건 CC BY 4.0 — 요지 인용, 본문 복제 없음