Opus 5.5, 외부 자기개선 평가 RSI 인덱스 1위
무슨 일
어제오늘 실제로 일어난 일을 사실만 정리했어요
- 벤치마크 평가기관 Vals AIVals AI AI 회사와 독립적으로 모델을 시험해 순위를 내는 평가 업체다.(제3자)가 Claude Opus 5.5 를 자사 RSI 인덱스RSI 인덱스 Vals AI 가 만든 평가로, 모델에게 AI 연구·개발 과제를 맡겨 사람의 기존 기록과 비교한다. 1위(37.13%)로 발표했다. 2위는 Claude Fable 5.1(35.03%)이다.
- Vals AI 측정: 5개 연구 과제 중 압축·LM 훈련·Parameter Golf·사후 훈련 4개에서 Opus 5.5 가 1위였고, 하네스하네스 모델에 도구·작업 절차를 붙여 실제 일을 하게 만드는 바깥 틀이다. 엔지니어링은 Fable 5.1 이 1위였다.
- Vals AI 측정: 24시간 안에 작은 언어모델을 직접 훈련하는 「LM Training」 과제에서, 이 평가 방식 기준 처음으로 공개된 인간 참조 기록을 넘었다.
- 시험은 Claude CodeClaude Code Anthropic 의 코딩 에이전트 도구다. 모델이 파일을 읽고 명령을 실행하며 작업한다. 환경에서 최대 추론 노력(max effort)으로 돌렸다고 Vals AI 는 밝혔다.
왜 중요한가
누구에게 어떤 영향이 있는지 담았어요
- AI 안전 논의: AI 가 AI 연구를 사람 수준으로 해내는지는 안전 연구자들이 가장 주시하는 지표다. 인간 기록을 넘은 과제가 처음 나왔다는 점이 논쟁거리가 된다.
- 해석의 한계: 1위 점수가 37% 수준이어서 대부분의 과제는 아직 사람 기록에 못 미친다. 또 이 결과는 Vals AI 한 곳의 평가 방식 기준이다.
- 경쟁사: Vals AI 는 GPT-6 Sol 결과를 곧 발표한다고 했다. 순위는 바뀔 수 있다.
- 커뮤니티 반응: 특이점이온다 갤러리에도 같은 결과를 옮긴 글이 올라왔다.
흐름
여기까지 온 경위와 앞으로 볼 일정을 날짜순으로 짚었어요
- 2026-09-25 Anthropic 이 Claude Fable 5.1 로 이론물리 난제 「9루프 산란 진폭」 계산에 성공했다고 밝혔다
- 2026-09-28 Vals AIVals AI AI 회사와 독립적으로 모델을 시험해 순위를 내는 평가 업체다. 의 RSI 인덱스RSI 인덱스 Vals AI 가 만든 평가로, 모델에게 AI 연구·개발 과제를 맡겨 사람의 기존 기록과 비교한다. 결과를 AI타임스가 보도했다
배경
이해하는 데 필요한 모델·용어·회사를 풀었어요
- 재귀적 자기개선(RSI) — AI 가 AI 연구를 스스로 해서 더 나은 AI 를 만들고, 그 AI 가 다시 연구하는 순환을 말한다. AI 발전 속도가 급격히 빨라질 수 있는 조건으로 거론된다.
- RSI 인덱스 — Vals AI 가 만든 평가로, 모델에게 AI 연구·개발 과제를 맡겨 사람의 기존 기록과 비교한다.
- Vals AI — AI 회사와 독립적으로 모델을 시험해 순위를 내는 평가 업체다.
- Claude Code — Anthropic 의 코딩 에이전트 도구다. 모델이 파일을 읽고 명령을 실행하며 작업한다.
- 하네스(harness) — 모델에 도구·작업 절차를 붙여 실제 일을 하게 만드는 바깥 틀이다.
출처
이 요약에 쓴 원문이에요