기타 Hacker News · 2026-09-21

"AI 모델 갑자기 멍청해진 거 기분 탓 아님" 6주간 분석한 개발자 폭로

핵심 요약
  • 앤트로픽의 Fable 5 모델을 분석한 결과, 8월에 지급된 생각 토큰의 양이 7월 대비 급격하게 줄어든 것으로 나타났습니다.
  • 최고 성능 옵션을 켜두어도 실제 호출 대부분에서 생각 토큰이 거의 부여되지 않거나 일정에 따라 성능이 요동쳤습니다.
  • 작성자는 모델 자체의 너프보다는 서비스 측에서 배분하는 추론 인프라 환경의 문제라고 지적했습니다.
요약 구독형 플랜에 정식 탑재된 최신 AI 모델이 유독 멍청해졌다는 이용자들의 체감이 단순한 기분 탓이 아니라는 분석이 제기되었습니다. 개발자 론 런드그런(Lon Lundgren)은 앤트로픽(Anthropic)이 'Fable 5' 모델을 유료 구독 플랜에 영구 제공하기 시작한 이후 성능이 크게 떨어지는 현상을 겪었다고 밝혔습니다. 모델이 갑자기 바보처럼 느껴져 원인을 파악하고자 5가지 방식으로 측정해 본 결과, 8월에 제공된 '생각 토큰(thinking tokens)'의 양이 7월에 비해 극적으로 줄어든 것을 확인했습니다. 이러한 성능 저하는 일회성에 그치지 않고 전체 기간에 걸쳐 추론 능력이 지속적으로 하락했으며, 며칠 주기로 큰 폭의 등락을 반복했습니다. 특히 일부 변동은 특정 제품 발표나 출시 일정과 맞물려 나타났으며, 이로 인해 어떤 날은 모델 성능이 훌륭하다가도 다음 날에는 끔찍하게 느껴지는 이유가 설명되었습니다. 분석 결과, 최고 노력 수준(xhigh 또는 max effort)으로 일관되게 설정했음에도 불구하고 실제 모델 호출의 대다수는 생각 토큰을 거의 혹은 아예 할당받지 못하고 있었습니다. 간혹 긴 생각 과정이 수행되더라도 공식 발표된 벤치마크 수준에는 거의 도달하지 못했습니다. 6주간에 걸친 데이터 수집과 분석 끝에 그는 "다음번에 AI 모델이 멍청해졌다고 느껴진다면 모델 자체가 '너프(하향 조정)'되었는지 묻지 말고, 본인이 제공받은 추론 환경(inference regime)을 의심하라"고 지적했습니다. 최전선 모델에 접근할 수 있다고 해서 그 성능을 안정적으로 재현해 내는 추론 환경까지 보장받는 것은 아니라는 설명입니다.
해외 반응 번역
이유는 진짜 간단함. 한 사람이 쓰면 쩔어주지만 수백만 명이 나눠 쓰면 구려지기 시작하는 거임. 데이터센터 새로 짓기 전까진 사용량 늘수록 멍청해지는 게 무한 반복됨.
Sponsored · 광고