AI 도구·· 낭순

AI가 쓴 문서, 회사에 내기 전 무엇부터 확인하나


AI가 써 준 보고서를 그대로 넘기기는 불안한데, 스무 장짜리 문서를 문장마다 검색해 볼 시간은 없습니다. 그래서 대부분은 훑어보고 냅니다.

전부를 같은 무게로 확인할 필요는 없습니다. 오류는 문서에 고르게 흩어지지 않고 특정한 종류의 문장에 몰립니다. 어떤 종류인지는 모델을 만든 쪽이 논문으로 설명해 뒀고, 인용이 어느 층에서 무너지는지도 대규모로 측정돼 있습니다. AI 생성 문서 사실 확인은 전부 하는 일이 아니라 순서를 정하는 일입니다.

이 글은 그 순서를 만들고, 마지막에 남는 문제 — 근거를 못 찾은 문장을 그대로 낼지 고칠지 뺄지 — 에 답합니다.

오류는 주제가 아니라 「문장의 종류」에 몰립니다

먼저 열어야 할 것은 아래 다섯 가지 중 하나가 들어 있는 문장입니다.

이런 게 들어 있으면 문서에서는 이렇게 생겼습니다
고유명사 사람 이름, 기관·제품 이름, 보고서 제목
연도·날짜 발표 연도, 시행일, 사건 일자
번호 법령 조문 번호, 사건번호, 규격 번호
통계 수치 비율, 건수, 금액
인용문 큰따옴표로 묶인 남의 말이나 원문 문장

판단·의견·요약 문장은 여기 들어가지 않습니다. 다섯의 공통점은 규칙으로 유도할 수 없어 어딘가에서 외워 와야만 하는 값이라는 것입니다. 문서에서 이 문장들만 골라내면 확인 대상이 줄어듭니다.

왜 하필 이 다섯인지는, 모델이 없는 사실을 그럴듯하게 지어내는 현상(흔히 환각이라고 부릅니다)을 다룬 논문에 설명이 있습니다. Adam Tauman Kalai · Ofir Nachum · Santosh S. Vempala · Edwin Zhang이 쓴 「Why Language Models Hallucinate」(arXiv:2509.04664, 2025년 9월 4일 공개, 학술지 게재본은 아닙니다)입니다. 저자 넷 중 셋이 OpenAI, 하나가 조지아텍 소속입니다.

논문은 이런 값을 arbitrary facts라 부릅니다. 간결한 규칙으로는 설명되지 않아, 훈련 데이터에 그 사실이 들어 있어야만 알 수 있는 것들입니다.

여기서 논문이 세우는 것은 하한입니다. 「모른다」고 답한 경우를 빼고 셌을 때 훈련 데이터에 정확히 한 번만 등장하는 프롬프트를 singleton이라 부르고, 그 비율만큼은 최소한 틀린다는 형태의 부등식을 제시합니다. 논문이 든 예시도 조건문입니다 — 생일 사실의 20%가 사전학습 데이터에 정확히 한 번씩 나온다고 가정하면 사전학습만 거친 기본 모델은 적어도 그만큼에서 환각을 낼 것으로 기대된다는 서술이지, 측정값도 상한도 아닙니다.

논문에 실린 실험이 이 성격을 보여 줍니다. 저자 중 한 사람의 박사학위 논문 제목을 물었더니 세 모델이 서로 다른 제목과 연도를 냈고 셋 다 틀렸습니다. 생일을 물었을 때는 한 오픈소스 모델이 세 번의 시도에서 서로 다른 세 날짜를 냈습니다. 왜 모른다고 답하지 않느냐가 논문의 본론입니다.

“We argue that language models hallucinate because the training and evaluation procedures reward guessing over acknowledging uncertainty” — arXiv:2509.04664 초록

옮기면 훈련과 평가 절차가 불확실성을 인정하는 것보다 추측을 더 보상해 왔다는 주장입니다. 모른다고 두는 것보다 그럴듯하게 채우는 쪽이 점수를 받아 왔다는 뜻이죠. 참고로 논문이 내놓는 해법은 벤치마크 채점 방식을 고치자는 제안이지, 프롬프트 팁이 아닙니다.

링크가 열리는지 보는 것으로는 걸러지지 않습니다

초안을 검토할 때 대부분은 출처가 붙어 있는지, 링크가 열리는지를 봅니다. 그 검사는 거의 전부 통과합니다.

PwC 미국 법인 연구진(Hailey Onweller 외)이 14개 모델·130개 리서치 질의를 대상으로 인용을 세 층으로 나눠 따로 측정한 arXiv 공개본이 있습니다. 이 절에서 인용하는 논문들도 모두 arXiv에 올라온 공개본이고, 학술지에 실렸는지까지는 확인하지 않았습니다. 3년 전 연구를 나란히 놓으면 이렇게 됩니다.

어느 층을 보는가 측정값 (다섯 줄 모두 높을수록 좋음) 출처·대상
링크가 살아 있는가 (link validity) 94% 초과 PwC 공개본 · 최상위(프런티어) 모델
그 문서가 주제에 맞는가 (relevance) 80% 초과 PwC 공개본 · 프런티어 모델
그 주장이 사실인가 (factual accuracy) 39~77% PwC 공개본 · 프런티어 모델
붙어 있는 인용이 그 문장을 뒷받침하는가 74.5% Liu 외 · 2023년 도구 4종
문장이 인용으로 완전히 뒷받침되는가 51.5% Liu 외 · 2023년 도구 4종

“even the strongest frontier models maintain link validity above 94% and relevance above 80%, yet achieve only 39–77% factual accuracy” — Onweller 외, arXiv:2605.06635

여기서 39~77%는 맞은 비율입니다. 링크 검사와 주제 검사는 대부분 통과하는데, 사실 검사에서는 프런티어 모델 중 가장 낮은 값이 39%까지 내려갑니다. 이 값들은 전부 검색이 연동된 상태에서 잰 것입니다. 검색을 켠다고 사라지는 문제가 아닙니다.

표의 아래 두 줄은 Nelson F. Liu · Tianyi Zhang · Percy Liang이 2023년 생성형 검색 도구 네 종(Bing Chat, NeevaAI, Perplexity.ai, YouChat)을 잰 값입니다(arXiv:2304.09848).

의학 논문 쪽 결과는 더 구체적입니다. ChatGPT-3.5가 만든 참고문헌 115건 중 47%가 아예 지어낸 것이었고, 46%는 실재하지만 부정확했으며, 진짜이면서 정확한 것은 7%였습니다(Bhattacharyya 외, Cureus 2023).

여기서 무서운 쪽은 47%가 아니라 46%입니다. 지어낸 참고문헌은 검색하면 없다는 게 바로 나옵니다. 실재하는 문헌에 없는 내용을 붙여 놓은 쪽이 안 걸립니다. 22개 공영미디어 기관이 14개 언어로 3,000여 개 답변을 평가한 EBU·BBC 공동연구(2025-10)에서도, 출처가 누락·오도되거나 잘못 붙은 중대 문제가 든 답변이 31%로 정확성 관련 중대 문제(20%)보다 많았습니다.

그럼 딥리서치처럼 더 깊이 찾게 하면 되지 않느냐 — 같은 PwC arXiv 공개본이 도구 호출(모델이 검색 같은 외부 기능을 불러 쓰는 것)을 2회에서 150회까지 늘려 가며 따로 실험했고, 결론을 이렇게 적었습니다.

“more retrieval does not produce more accurate citations” — Onweller 외, arXiv:2605.06635

옮기면 더 많이 찾아본다고 더 정확한 인용이 나오지는 않는다는 것입니다. 다만 이 실험은 모델 두 종을 대상으로 한 것이고, 각 단계에서 인용이 몇 개씩 생겼는지는 논문이 밝히지 않아 인용이 늘면서 비율이 내려간 것인지까지는 구분되지 않습니다.

링크가 안 열릴 때의 해석도 바꿔 둘 만합니다. Delip Rao · Eric Wong · Chris Callison-Burch가 22만여 개 인용 URL을 조사한 arXiv 공개본은 인용 URL의 313%가 조작된 것이고 518%가 연결되지 않는다고 적습니다. 그중 OpenAI의 검색 연동 모델 네 종에서는 연결 안 되는 비율과 조작된 비율이 같았고 오래돼 사라진 링크는 0이었습니다. 링크가 죽어 있으면 페이지가 없어졌나 보다가 아니라, 처음부터 없던 주소를 의심하는 편이 맞습니다.

확인의 마지막 층은 링크가 열리는가가 아니라 그 페이지 안에 그 문장이 있는가입니다.

확인이 쉬운 순서가 아니라, 실패가 몰려 있는 순서로

  1. 문장 고르기. 문서를 훑으면서 앞 절의 다섯 가지가 든 문장에만 표시합니다. 판단·의견·요약 문장은 건너뜁니다. 몇 개가 나오는지는 문서 종류마다 달라 이 글이 대신 세어 줄 수 없습니다. 첫 두 쪽만 표시해 보고 그 개수로 전체를 가늠하세요.
  2. 존재부터 확인. 표시한 문장 중 실재 여부부터 물어야 하는 것을 먼저 엽니다. 판례 사건번호, 법령 조문 번호, 논문 제목과 연도, 보고서 이름, 통계 명칭, 인명과 직함. 그중 조회처가 정해져 있는 것부터 여세요 — 법령과 조문 번호는 국가법령정보센터에서 조문 단위로 열리고, 논문은 arXiv 같은 공개 저장소나 PMC에 제목을 그대로 넣으면 있는지 없는지가 바로 나옵니다. 판례 사건번호는 대법원 법원행정처가 2026년 2월 20일 사법정보공개포털에 연 ‘허위 사건번호 확인’ 서비스에서 실재 여부를 확인할 수 있습니다(뉴스1 2026-02-20). 통계 명칭과 인명은 분야마다 조회처가 갈려서 이 글이 한 곳으로 지정하지 않습니다. 앞 절의 하한이 걸려 있는 자리가 여기입니다.
  3. 출처가 붙은 문장은 링크를 열고 그 페이지 안에서 찾기. 링크가 열리는 것으로 끝내지 말고 해당 숫자나 표현을 그 페이지에서 직접 검색합니다. 앞의 표에서 가장 낮았던 층이 여기입니다. 결과는 두 갈래로 갈립니다 — 원문을 열었는데 그 내용이 없으면 확인 실패이고, 유료·로그인·긴 PDF·영문이라 아예 못 열었으면 미확인입니다. 확인 실패는 다음 절의 처리 규칙으로 넘기고, 미확인은 무엇을 못 열었는지를 문장 옆에 적어 함께 냅니다. 둘을 같은 표시로 뭉개면 검토자가 처음부터 다시 엽니다.
  4. 날짜와 계산. 제도·가격·버전처럼 바뀌는 값은 원문이 어느 시점 기준인지 보고, 합계·비율이 문서 안에서 서로 맞는지 봅니다. 맞는 숫자를 틀린 시점에 붙인 오류는 링크가 멀쩡해서 더 안 보입니다.

「미확인」은 줄일 수 있습니다. 유료나 로그인 벽에 막혔으면 초록·요약 페이지에 그 수치가 실려 있는지 먼저 보고, 학술 문헌이면 같은 제목의 공개본(preprint)이 따로 올라와 있는지 제목으로 검색해 보세요. 긴 PDF는 통째로 읽지 말고 브라우저 뷰어에서 숫자나 고유명사를 그대로 찾으면 됩니다 — 영문 자료도 숫자와 고유명사는 번역 없이 그대로 검색됩니다. 여기까지 해 보고도 안 열리면 그때 미확인으로 남기되, 어디까지 시도했는지를 함께 적어 두세요. 검토자가 같은 벽을 두 번 만나지 않습니다.

건너뛰어도 되는 것도 정해 둡시다. 문서 구조, 표현 다듬기, 그리고 AI 탐지기 돌려 보기입니다(탐지기는 뒤에서 따로 다룹니다). 시간이 30분뿐이라면 2번과 3번에 다 쓰는 편이 낫습니다.

근거를 못 찾은 문장은 빼세요. 대신 자리를 남기세요

여기서 손이 멈춥니다. 갈래는 셋입니다. 빼거나, 단정을 낮추거나, 확인 경로를 적어 두거나.

제조사 공식 문서 중 이 처리 규칙까지 적어 둔 곳이 있습니다. Anthropic의 환각 감소 문서는 주장마다 뒷받침하는 인용을 찾게 하고, 못 찾으면 그 주장을 철회하라고 씁니다.

“If it can’t find a quote, it must retract the claim.” — Claude Docs, Reduce hallucinations

같은 문서의 예시 프롬프트는 한 걸음 더 갑니다. 삭제한 자리에 빈 대괄호를 남겨 어디가 빠졌는지 표시하게 합니다. 모델용 지시지만 사람이 초안을 손볼 때 그대로 쓸 수 있습니다.

회사에 내는 문서라면 빼는 쪽을 권합니다. 확인 안 된 문장을 “~로 알려져 있다”로 낮춰 두면 문서 안에서는 살아남지만, 그 문장을 읽은 사람이 회의에서 그대로 인용합니다. 근거의 강도는 전달되지 않고 문장만 전달됩니다.

그 문장이 논지에 꼭 필요하다면 표현을 흐리는 대신 누구에게 물으면 확인되는지를 문장 옆에 적어 두세요. 「○○팀 확인 필요」가 「~로 알려져 있다」보다 훨씬 유용합니다.

제조사 규칙에 기대 볼 수도 있습니다. OpenAI Model Spec(2025-04-11판)에는 「Do not lie」라는 규칙이 사용자 지시 수준으로 들어 있어 거짓 진술 자체는 금지됩니다. 사실·추론·형식 오류를 피하라는 항목도 같은 수준이고, 불확실성을 표현하라는 항목은 그보다 낮은 가이드라인 수준입니다. 다만 이 문서는 「인용을 못 찾으면 그 주장을 빼라」 같은 처리 절차까지는 주지 않습니다.

같은 Anthropic 문서도 이 기법들이 환각을 크게 줄이지만 완전히 없애지는 못한다고 적고, Google은 Gemini 앱이 부정확한 정보를 사실처럼 제시할 수 있다고 공식 고지합니다. 세 문서는 성격이 다릅니다 — Anthropic 쪽은 개발자용 실무 안내서, Model Spec은 모델 행동 규범, Google 쪽은 앱 이용자용 도움말입니다. 절차를 정하는 일은 결국 문서를 내는 사람에게 남습니다.

AI 탐지기를 돌려 보면 되지 않나 — 축이 다릅니다

탐지기 쪽 용어는 provenance, 즉 누가 썼는가입니다. 앞에서 본 지표들의 이름은 factual accuracy, link validity, citation accuracy입니다. 문서를 누가 썼는지 100% 맞혀도 그 안의 사건번호가 실재하는지는 알 수 없습니다.

정확도를 따지기 전에 이미 그렇습니다. Weixin Liang 외 연구는 여러 GPT 탐지기를 시험해, 이들이 비원어민 영어 글을 일관되게 AI 생성물로 오분류한다고 보고합니다(arXiv:2304.02819, 이것도 arXiv 공개본입니다). OpenAI는 2023년 자사 AI 텍스트 판별기를 정확도가 낮다는 이유로 중단했습니다(TechCrunch 2023-07-25 보도 기준).

탐지기는 이 글이 다루는 문제를 풀지 못합니다. 앞의 확인 순서 2번과 3번에 쓸 시간을 여기에 쓰지 마세요.

회사에는 아직 「문서 검증」 공통 규칙이 없습니다. 공공·법조에는 생겼습니다

2026년 8월 기준으로 확인되는 것들입니다.

  • 「데이터기반행정 활성화에 관한 법률」이 개정되면서 법 이름에 ’인공지능’이 들어가고 2026년 8월 28일 시행됩니다. 개정이유는 적용 범위를 “공공부문에”로 명시합니다(국가법령정보센터 제정·개정이유). 사기업 직원에게 이 법상 문서 검증 의무가 생기는 것이 아닙니다.
  • 행정안전부가 2026년 6월 배포한 「공공부문 AI 도입·활용 가이드」는 “인공지능(AI)이 그럴듯한 거짓말을 하는 ’환각 현상(Hallucination)’을 막고”를 목적의 하나로 적습니다(행정안전부 보도자료 2026-06-10). 대상은 공공기관입니다.
  • 법원행정처가 2026년 3월 전국 법관에게 「법관을 위한 AI 가이드북」을 배포했습니다. 법률신문 보도에 따르면 이 가이드북에는 “AI의 오류가능성을 전제하고 별도 검증 절차를 거쳤는가” 같은 점검 항목이 담겼습니다. 대상은 법관입니다.

국내 사례도 보도됐습니다. 한국경제 2026-04-08 보도에 따르면 2025년 8월 서울북부지법 민사 사건에서 원고 측 서면에 존재하지 않는 사건번호의 대법원 판례가 들어 있었고, 재판부가 판결문에 그 점을 적었습니다. 원고는 패소했지만 그 판례 때문에 졌다는 인과관계는 기사에 없고, 과태료나 징계가 확정된 국내 사례는 확인하지 못했습니다.

회사가 어떤 조치를 할 수 있는지는 이 글이 답할 수 없습니다. 근로기준법 제23조 제1항이 정당한 이유 없는 해고·정직·감봉 등을 금지하고 있어, 판단은 취업규칙과 그 ’정당한 이유’로 갈립니다. 대신 오늘 확인할 수 있는 것은 셋입니다 — 사내에 생성형 AI 사용 지침이 따로 있는지, 취업규칙에 문서·보고 관련 의무가 어떻게 적혀 있는지, 결재 라인에서 사실 확인 책임이 어느 단계에 있는지. 셋 다 없으면 검토 범위를 상급자와 미리 맞춰 두세요. 이 글은 확인 순서를 정리한 것이지 개별 사안에 대한 법률 자문이 아닙니다.

규칙이 먼저 생긴 쪽은 문서 한 장이 판단을 바꾸는 자리입니다. 사기업에 의무가 없다는 것이 확인이 덜 필요하다는 뜻은 아닙니다.

포기해도 되는 쪽, 포기하면 안 되는 쪽

이 순서는 확인을 줄이려고 만든 것이 아니라, 시간이 모자랄 때 어디를 포기할지 정하려고 만든 것입니다. 포기해도 되는 쪽은 문체와 구조이고, 포기하면 안 되는 쪽은 실재 여부와 원문 대조입니다. 위 수치들은 2026년 8월에 확인한 자료 기준이라 도구가 바뀌면 값도 바뀝니다. 순서 쪽은 잘 바뀌지 않습니다.

더 읽을거리: 반대편 축인 입력 쪽 — 회사 자료를 AI에 넣어도 되는지는 AI에 회사 자료 넣기 전 계정부터 확인하기에서 따로 다뤘습니다.

이 글은 AI 도구의 도움을 받아 초안을 작성하고 사람이 검토·수정해 발행했습니다. 사실관계에 오류가 있다면 문의 페이지로 알려주세요. 본문에는 광고가 포함될 수 있습니다.