실패를 학습 자원으로 바꾸는 아마존 AI 평가법
핵심 요약
아마존이 AI 에이전트의 실패 과정을 재학습에 활용하는 평가 주도형 플라이휠을 개발했다. 진단 단계에서 오류 원인을 분류하고 생성 단계에서 약점에 맞춘 합성 학습 과제를 자동으로 만든다. 이 구조는 아마존 노바의 사후학습과 브라우저 자동화 서비스 노바 액트 등에 적용됐다.
아마존이 AI 에이전트의 오류 과정을 분석해 성능 개선에 다시 활용하는 ‘평가 주도형 플라이휠’을 개발했다. 애니카 휴스턴 아마존 연구원은 지난달 서울에서 열린 국제머신러닝학회(ICML) 2026에서 이 구조를 발표했다. 핵심은 평가를 최종 점수 산출에 그치지 않고, 에이전트가 어디에서 어떤 이유로 실패했는지를 다음 학습에 반영하는 데 있다.
플라이휠은 진단과 생성이라는 두 엔진으로 작동한다. 진단 단계에서는 실패 영역과 원인을 태그로 분류한다. 아마존이 200개 과제로 실시한 평가에서 ‘생각만 하고 행동하지 않음’이 전체 실패의 33%를 차지했다. ‘중도 포기·거부’는 27%, ‘접근 방식 자체가 틀림’은 26%였다. 생성 단계에서는 확인된 약점에 맞춰 새로운 학습 환경과 과제를 자동으로 합성하고, 이를 기존 평가에 다시 투입한다.
기존 학습 방식은 데이터 생성과 모델 학습을 거쳐 마지막 평가에서 하나의 성능 점수를 남기는 흐름이었다. 이 과정에서는 에이전트가 실패에 이른 경로가 충분히 활용되지 못했다. 휴스턴 연구원이 제안한 방식은 실패 궤적을 보존하고, 특정 취약점을 겨냥한 합성 학습 데이터를 만드는 데 초점을 맞췄다. 대부분의 과정은 사람의 개입 없이 자율적으로 순환하며, 단순히 데이터 양을 늘리는 방식보다 자원을 효율적으로 활용할 수 있도록 설계됐다.
이 평가 루프는 아마존 노바 모델의 사후학습 단계에 반영됐으며, 지난해 말 공개된 브라우저 자동화 서비스 ‘노바 액트’ 등에도 적용됐다. 휴스턴 연구원은 외부 벤치마크 성적만으로 실제 업무 환경의 성능을 보장할 수 없다며, 기업별 활용 방식을 반영한 내부 평가와 도입 전 검증의 필요성을 강조했다. 지난해 아마존에 합류한 그는 약 100명 규모의 아마존 AGI 랩에서 연구해 왔고, 지난달 조직 정리 이후에도 테크니컬 스태프로 AI 모델 연구를 이어가고 있다.