핵심 요약
- AI 모델이 출시 후 몰래 너프된다는 의혹을 과학적으로 검증하기 위해 클로드 오푸스 5.5를 추적하는 오픈소스 벤치마크 'livenerf'가 가동을 시작했습니다.
- 출시 직후 10일간의 기준 데이터를 확보한 뒤 고정된 프롬프트와 CLI 환경에서 30일간 매일 테스트해 정확도와 출력 토큰 수 변화를 통계적으로 측정합니다.
- 변별력 있는 78개 문항 패널을 기반으로 첫 10일간의 베이스라인을 수집 중이며, 첫 비교 분석 결과는 2026년 10월 하순에 나올 예정입니다.
요약 인공지능 모델이 출시된 직후 몰래 성능이 저하(너프)된다는 의혹은 AI 커뮤니티에서 꾸준히 제기되어 온 떡밥입니다. 이용자들 사이에서는 비용 절감을 위해 양자화를 거치거나, 같은 이름 뒤에 더 작은 모델을 붙이거나, 연산량(Effort) 및 라우팅을 조정한 것 아니냐는 불만이 쏟아지지만, 출시 첫날(Day 0)의 명확한 기준 데이터가 없어 매번 단순한 체감과 심증 싸움으로 끝나곤 했습니다.
이 논란을 과학적으로 검증하기 위해 오픈소스 프로젝트 'livenerf'가 등장했습니다. 2026년 9월 22일 출시된 클로드 오푸스 5.5(Claude Opus 5.5)를 대상으로 삼아, 출시 직후 시점부터 성능 변화를 추적하는 벤치마크를 가동하기 시작한 것입니다. 현재 AI 모델들은 샘플링 파라미터 제어가 사라지고 내부 추론(Thinking)을 임의로 끌 수 없어 완벽한 결정론적 제어가 불가능합니다. 이에 따라 개발자는 고정된 프롬프트, 고정된 CLI 버전(2.1.280), 정확한 자동 채점기, 원본 로그 영구 보존 환경을 구축하고 수천 개의 샘플을 통해 통계적 드리프트를 측정하는 방식을 택했습니다. 영국 AI 안전 연구소의 평가 프레임워크인 Inspect를 기반으로 하며 앤트로픽의 공식 에러바 통계 가이드라인을 따랐습니다.
검증 방식도 철저하게 설계되었습니다. GPQA Diamond, MMLU-Pro, 경시대회 수학 등 2,336개 문항 중 오푸스 5.5가 '맞히기도 하고 틀리기도 하는' 변별력 있는 78개 문항을 추려 패널을 구성했습니다. 프로젝트는 총 30일간 매일 한 번씩 패널 전체를 테스트하며, 출시 약 2.5일 후인 9월 24일부터 10일간 기준선(베이스라인)을 수집한 뒤 이후 10일 단위 구간 2개와 비교하게 됩니다. 첫 분석 결과는 10월 24일 전후로 나올 예정입니다.
특히 개발자는 정확도 변동뿐 아니라 '샘플당 출력 토큰 수'를 핵심 보조 지표로 꼽았습니다. 모델이 은근슬쩍 생각을 덜 하기 시작하면 정확도가 꺾이기 전에 출력 토큰 수에서 가장 먼저 티가 나기 때문입니다. 과연 AI 모델 너프설이 유저들의 기분 탓인지, 실제로 일어나는 일인지 밝혀낼 수 있을지 커뮤니티의 관심이 쏠리고 있습니다.
Sponsored · 광고