하네스만 교체했는데 모델은 그대로…ARC-AGI-3에서 인간 효율 99%에 근접
AI 모델은 그대로 두고 실행 방식만 바꿨더니 추론 벤치마크에서 인간이 사용하는 행동의 98.98% 수준에 도달했다는 연구 결과가 나왔다. 이전에는 모델의 크기나 매개변수를 늘려 성능을 높이려 했지만, 이번 연구는 에이전트가 사고하는 프레임워크 자체를 개선하면 비슷한 효과를 낼 수 있다는 점을 보여줬다. 이로써 AI 성능 경쟁의 초점이 모델 개발에서 에이전트 설계로 옮겨질 가능성이 커졌다. 공개 세트 테스트에서 … 더 읽기