AI 검증이 바로잡은 75년 묵은 화학 데이터
핵심 요약
AI가 75년간 반복 인용된 분자 끓는점 데이터의 오류를 찾아냈다. 논문 재현과 수식·계산 검증, 제출 전 사전 점검에도 AI 활용이 확대되고 있다. 탐지 정확도와 오판 가능성 때문에 전문가의 최종 검증은 여전히 필요하다.
세바스티안 피오스 중국 저장랩 연구원은 인공지능으로 여러 분자의 끓는점을 예측하던 중 계산값이 화학자들이 75년 동안 참고해 온 데이터베이스와 일치하지 않는 현상을 발견했다. 처음에는 AI의 오류를 의심했지만 원래 논문까지 거슬러 올라가 확인한 결과, 잘못된 값은 데이터베이스에 있었다. 오래전 부정확하게 기록된 수치가 별도의 검증 없이 반복 인용된 사실을 AI가 포착한 것이다.
AI는 기존 지식을 점검하는 작업뿐 아니라 최신 논문의 재현 가능성을 대규모로 선별하는 데도 활용되고 있다. 미국 연구 검토 기업 SAI랩스는 AI 에이전트로 올해 국제머신러닝학회 구두 발표 논문 168편의 핵심 주장을 추출한 뒤 공개 코드와 데이터로 실험을 재현했다. 5개 이상 주장을 평가할 수 있었던 92편 가운데 40% 넘게 재현된 논문은 34편, 80% 이상 재현된 논문은 8편이었다. 재현 실패 자체가 논문 오류를 뜻하지는 않지만 추가 검토가 필요한 지점을 추리는 결과로 이어졌다.
미국 스탠퍼드대 제임스 저우 교수팀은 AI를 이용해 신경정보처리시스템학회 논문의 수식과 계산, 그래프를 검사했다. AI가 찾아낸 논문당 오류는 2021년 평균 3.8건에서 2025년 5.9건으로 55% 증가했다. 연구 규모와 복잡성이 커지는 가운데 논문 제출 전 AI로 사전 점검을 하는 연구자도 늘었다. 올해 국제머신러닝학회 제출자 733명 중 35%는 구글의 페이퍼 어시스턴트 툴로 오류를 발견했고, 31%는 AI의 지적을 반영해 새로운 실험을 진행했다.
다만 AI 검증의 정확도는 아직 사람의 심사를 대체할 수준에 이르지 못했다. 최근 연구에서는 AI가 인간 심사자가 확인한 논문 오류의 최대 20% 정도만 찾아냈으며, 올바른 내용을 잘못됐다고 판정하는 사례도 나타났다. 과학계는 오류가 이미 확인된 논문을 AI에 제시해 탐지 성능을 시험하고, 분야별 전문가가 그 판정을 다시 확인하는 프로젝트를 진행하고 있다. 현재 AI의 역할은 연구의 옳고 그름을 최종 결정하는 심판보다 사람이 놓칠 수 있는 문제를 광범위하게 찾아내는 탐지기에 가깝다.