[연구]AI 에이전트의 '말' 대신 DB 결과를 채점하는 MS 싱킹박스
마이크로소프트와 허깅페이스가 AI 에이전트의 텍스트 답변 대신 백엔드 데이터베이스의 최종 상태를 평가하는 벤치마크 '싱킹박스'를 공개했습니다. 507개 비즈니스 워크플로를 각 20회 반복 측정한 결과, 에이전트가 오류 없이 작업을 끝냈다고 보고한 시도 중 67% 이상이 실제로는 잘못된 DB 값을 남긴 것으로 드러났습니다.
전문 읽기접기
무슨 일이야
AI 에이전트가 툴을 오류 없이 호출하고 "요청을 해결했다"고 응답하더라도, 실제 데이터베이스의 최종 상태는 엉망일 수 있습니다. 마이크로소프트와 허깅페이스 연구진은 이를 검증하기 위해 실제 비즈니스 워크플로 507개를 기반으로 최종 백엔드 상태와 사이드 이펙트를 채점하는 벤치마크 '싱킹박스(ThinkingBox)'를 공개했습니다.
연구진이 12개 LLM을 대상으로 12만 1,680회 테스트를 진행한 결과, 실패한 7만 9,853건 중 67.24%는 툴 호출 에러 없이 정상 종료된 상태였습니다. 하지만 실제 DB 실행 검증에서는 77.61%가 잘못된 필드 값을 남겼고, 43.30%는 불필요한 변경을 일으켰으며, 25.36%는 필수 업데이트를 빠뜨린 것으로 확인되었습니다.
또한 단 한 번 성공하는 것과 반복 수행 시의 일관성 사이에 큰 격차가 있었습니다. Kimi-K3는 전체 작업의 93.89%를 적어도 한 번은 성공하며 높은 커버리지를 보였지만, 20회 모두 성공한 작업은 13.41%에 불과했습니다. 반면 Claude Opus 5는 1회 이상 성공률은 79.09%로 낮았으나 20회 연속 성공률은 47.53%를 유지해 대조를 이뤘습니다.
왜 중요해
기존 LLM 리더보드의 pass@1 점수나 에이전트의 텍스트 답변만으로는 실제 상용 환경에서의 동작을 신뢰할 수 없다는 점이 수치로 입증되었습니다. 특히 Claude Opus 5.5가 Opus 5보다 평균 pass@1 점수는 높았음에도 20회 전승 과제 수(241개)는 동일했던 것처럼, 모델의 단일 추론 능력이 올라도 엔터프라이즈 환경에 필수적인 '일관된 신뢰성'은 자동으로 해결되지 않는다는 점을 시사합니다.
짚고 넘어갈 점
연구진이 공개한 벤치마크 결과에는 Claude Opus 5.5, GPT-6 Astra, DeepSeek-V4-Pro 등 아직 대중에게 정식 공개되지 않은 미래 시점의 모델 테스트 데이터가 다수 포함되어 있어, 실제 사용자가 현재 이용 중인 환경과의 격차나 구체적인 테스트 모델들의 정체는 추가 확인이 필요해 보입니다.
참고: Hugging Face
댓글 0
첫 댓글을 남겨보세요.