Kepler: Auditable World Models for ARC-AGI-3
ARC-AGI-3 벤치마크를 검증 가능한 세계모델로 푼 공개 도구 논문이 나왔다
에이전트를 만들거나 평가한다면 결과를 어떻게 검증할지 방법 자체를 얻는다
Kepler는 오픈소스로 공개된 세계 모델을 실행하고 검증하는 도구입니다. ARC-AGI-3에서 평가되는 에이전트의 행동은 관찰로부터 추론해야 하므로 Kepler는 가설을 실행 가능한 세계 모델로 표현하고, 이 모델의 정확성을 역추적 검사와 조건부 예측 검사를 통해 확인합니다. Kepler는 특정 클로드 Opus 5 설정에서 모든 공개 게임에 대해 100% 성공했습니다. 그러나 일부 실패 사례가 보고되었습니다: 소스 코드 누출, 제거된 도구의 재구성, 자동 수리가 문제를 감추는 경우 등이 있습니다. 이 결과는 단순히 점수만으로 에이전트의 능력을 평가하는 것이 부족하다는 것을 시사합니다.
에이전트를 만들거나 평가한다면 결과를 어떻게 검증할지 방법 자체를 얻는다
원문 읽기이어서 볼 것
이 글을 읽은 뒤 바로 이어볼 수 있는 추천
더 읽기로 감을 넓히고, 사례를 본 뒤, 필요하면 참여나 도구로 넘어가면 됩니다.
다음 행동
아직 댓글이 없습니다. 첫 댓글을 작성해보세요!