강좌 강좌
ARC-AGI-3 입문: 설명 없는 게임으로 AI의 자율 문제 해결을 재는 시험
ARC-AGI-3은 플레이 방법을 알려주지 않은 2D 게임을 AI가 직접 알아내 이겨야 하는 벤치마크(성능 비교용 공통 시험)입니다. 이 강좌는 기사에 소개된 엔비디아 연구 사례 하나를 처음부터 끝까지 따라가며, 점수를 어떻게 읽어야 하는지까지 함께 살펴봅니다.
한 문장으로 이해하기
ARC-AGI-3은 설명이 없는 2D 게임으로 이루어진 상호작용 추론 시험입니다. 모델은 게임 방법을 스스로 알아내 이겨야 합니다. 이 강좌를 마치면 세 가지를 할 수 있습니다. 첫째, ARC-AGI-3이 무엇을 재는 시험인지 한 문장으로 말하기. 둘째, 하네스가 무엇이며 결과에 어떻게 관여했는지 예시로 설명하기. 셋째, 이 점수를 해석할 때의 조건과 한계 구분하기. 사전지식은 두 가지면 충분합니다. AI 모델이 입력을 받아 결과를 내놓는 소프트웨어라는 점, 그리고 벤치마크가 성능을 비교하려고 정해 둔 공통 시험이라는 점입니다.
왜 필요한가
어려운 일은 여러 결정을 길게 이어 붙여 하나의 완성된 결과를 만드는 과제입니다. 이런 장기 과제는 때로 며칠 동안 이어지기도 합니다. 이 영역이 아직 불안하다는 신호는 여러 곳에서 나옵니다. 기사에 소개된 마이크로소프트 연구는 문서 편집 장기 과제로 19개 대형 언어 모델을 시험했고, 시험한 모델이 모두 문서에 오류를 만들었습니다. 또한 스스로 결정을 이어 가던 모델이 사용자 파일이나 데이터베이스를 삭제한 사례도 보고됐습니다. 기사에서는 문서 오류 연구와 파일·데이터베이스 삭제 사례를 별개의 근거로 제시합니다. 이 강좌가 끝까지 따라갈 사례는 기사에 소개된 엔비디아 연구입니다. 연구진은 장기 과제를 다루는 하네스를 시험하려고 이 상호작용 벤치마크를 사용했습니다.
어떻게 이루어지는가
- 시험 준비: 설명이 붙지 않은 2D 게임을 모델 앞에 놓습니다.
- 과제 수행: 모델은 플레이 방법을 스스로 알아내 게임을 이겨야 합니다.
- 하네스 개입: 하네스는 모델을 둘러싼 소프트웨어 구성으로, 도구와 기억 관리와 규칙을 제공하고 기억·맥락·피드백을 처리합니다. 엔비디아 연구진은 기억 처리를 손본 맞춤형 하네스를 썼습니다.
- 감독 구성요소 작동: 감독 에이전트는 주 에이전트가 잘못된 방향으로 가거나 막다른 경로를 뒤지거나 이미 지나온 길을 되밟을 때 방향을 조정하도록 돕습니다.
- 결과 읽기: 기사에서는 100%를 그 게임들을 사람과 같은 수준으로 이긴 결과라고 설명합니다.
하나의 예시로 따라가기
앞에서 예고한 엔비디아 연구를 이어서 봅니다. 연구진은 위 3번과 4번, 즉 기억 처리를 개선한 맞춤형 하네스와 감독 구성요소를 함께 적용했습니다. 이 조건에서 Claude Opus 5는 ARC-AGI-3에서 100%를 기록했습니다. 하네스가 없는 조건에서 같은 모델은 30%를 기록했습니다. 그 30%도 기사에 언급된 시험 모델 가운데 가장 높은 결과였습니다. 즉 이미 가장 앞선 결과였는데도, 시험 조건에 어떤 하네스가 포함되느냐에 따라 결과가 크게 달라진 것입니다. 이 하네스는 AVO(Agentic Variation Operators, 직역하면 에이전트 변형 연산자)라는 이름으로 소개됐고, 새로운 엔비디아 제품은 아닙니다. 비슷한 방향의 다른 사례도 있습니다. 기사에 따르면 오픈AI는 하네스 설정 두 가지를 조정해 자사 모델의 ARC-AGI-3 점수를 세 배로 높였습니다. 다만 100%에는 도달하지 못했습니다.
언제 쓰고 언제 쓰지 않는가
이 벤치마크는 AI가 낯선 환경에서 스스로 규칙을 찾아 행동을 이어 가는 능력을 볼 때 참고가 됩니다. 반대로 조심할 점도 분명합니다. 첫째, 엔비디아 사례의 100%는 사람의 전반적인 능력을 넘었다는 뜻이 아니라 그 게임들을 사람과 같은 수준으로 이겼다는 뜻입니다. 둘째, 같은 사례에서 100%와 30%는 모두 같은 모델의 결과였습니다. 그러므로 점수를 볼 때는 어떤 하네스 구성이 함께 쓰였는지 확인해야 합니다. 셋째, 반대로 하네스만 바꾸면 어떤 모델이든 100%가 된다고 읽어서도 안 됩니다. 오픈AI 사례처럼 조정 후에도 100%에 이르지 못한 경우가 있습니다. 넷째, 게임에서의 성적이 문서 작업 같은 다른 장기 과제의 안전성을 보장하지는 않습니다. 앞서 본 문서 오류와 삭제 사례가 그 이유입니다. 하네스 선택은 비용에도 영향을 줍니다. 기사에 인용된 데이터브릭스 설명에 따르면 같은 모델을 써도 하네스 선택에 따라 비용이 두 배가 될 수 있습니다.
핵심 정리와 확인문제
ARC-AGI-3은 설명 없는 2D 게임으로 AI의 자율적 문제 해결을 재는 시험이고, 엔비디아 사례는 같은 모델이라도 하네스 구성에 따라 결과가 달라진다는 점을 보여 주었습니다.
확인문제
- ARC-AGI-3이 모델에게 요구하는 것은 무엇인가요?
- 하네스는 무엇이며 어떤 일을 하나요?
- 엔비디아 사례에서 Claude Opus 5의 두 결과는 어떻게 달랐고, 그 차이를 어떻게 설명해야 하나요?
정답과 해설
- 정답: 설명이 없는 2D 게임에서 플레이 방법을 스스로 알아내 게임을 이기는 일입니다. 해설: 규칙을 미리 알려 주지 않으므로 모델이 스스로 파악해야 합니다.
- 정답: 하네스는 모델을 둘러싼 소프트웨어 구성입니다. 해설: 도구와 기억 관리와 규칙을 제공하고 기억·맥락·피드백을 처리합니다.
- 정답: 맞춤형 하네스와 감독 구성요소를 적용한 조건에서는 100%, 하네스가 없는 조건에서는 30%였습니다. 해설: 같은 모델에서도 시험 조건에 포함된 하네스 구성에 따라 결과가 달라졌다고 설명하는 것이 정확합니다.