경험 저장한 AI, 재학습 없이 합격률 84.9%
핵심 요약
외부 저장소에 경험 200개를 축적한 매님에이전트의 첫 시도 합격률이 62.0%에서 84.9%로 높아졌다. 성공 기억은 초기 결과의 완성도를 높였고 실패 기억은 수정 횟수를 줄였다. 재학습 없는 성능 향상을 확인했지만 작업 시간 증가와 기억 관리 문제는 과제로 남았다.
과제를 마칠 때마다 성공과 실패 경험을 외부 저장소에 축적하는 자기진화 AI 에이전트 ‘매님에이전트’가 모델 재학습 없이 성능을 높였다. 국제 공동 연구진이 2026년 6월 공개한 실험에서 기억이 없을 때 62.0%였던 사람 평가단 기준 첫 시도 합격률은 기억 200개가 쌓인 뒤 84.9%로 상승했다. 5점 만점 품질 점수도 3.26점에서 3.88점으로 올랐고, 평균 수정 횟수는 12.2회에서 6.5회로 줄었다.
매님에이전트는 과학 논문의 한 단락을 읽고 파이썬 애니메이션 도구 ‘매님’으로 수학 교육 영상을 제작한다. 에피소드 기억 은행은 높은 평가를 받은 장면의 성공 요인과 실제 수정으로 해결된 오류를 각각 저장한 뒤, 새 과제와 유사한 기록을 작업 전에 불러온다. 공식 문서와 모범 코드를 검색하는 RAG 방식은 합격률 83.3%를 기록했으나 평균 수정 횟수는 11.4회였다.
기억의 역할도 구분됐다. 성공 기억을 제거하면 합격률이 84.9%에서 70.0%로 떨어졌고, 실패 기억을 없애면 합격률은 80.9%였지만 수정 횟수가 11.6회로 늘었다. 실패 기록은 오류 수정 뒤 렌더링에 성공했거나 평가 점수가 5점 이상 오른 경우에만 저장됐다. 검증 없이 모든 실패를 남긴 조건에서는 합격률이 81.8%로 낮아져, 경험의 양뿐 아니라 선별 과정도 성능에 영향을 미쳤다.
작업 중 평가를 맡은 비전 언어 모델과 사람 평가단 점수의 상관계수는 -0.17이었다. 연구진은 조건을 알지 못하는 평가자 54명이 영상 175개를 나눠 심사한 결과를 최종 성적에 사용하고, AI 평가는 내부 개선 신호로만 활용했다. 다만 사람 평가자 사이에도 편차가 있었으며, 검증된 기억은 약 200개 규모에 머물렀다. 기억 증가에 따라 과제당 작업 시간이 19분에서 31분으로 늘었고, 모델 변경 시 기존 기록이 낡은 조언이 될 위험도 남았다.