핵심 요약
- 인공지능 주행 평가 벤치마크인 'DrivingBench'에서 GPT-6 아스트라가 2차 시도 만에 134.7m 코스를 5분 22초로 완주했습니다.
- 클로드, 그록 등 다른 경쟁 모델들은 모두 50%도 채 가지 못하고 실패(DNF)한 반면 유일하게 100% 완주 기록을 냈습니다.
- 이전 주행 결과를 반영하는 연속 세션에서 1차 시도 실패(49%) 후 2차 시도에서 제어 명령을 수정해 완주에 성공한 점이 주목받고 있습니다.
요약 인공지능 모델들에게 실제 주행 제어를 맡겨 테스트하는 벤치마크 사이트 '드라이빙벤치(DrivingBench)'의 리더보드가 공개되어 해외 커뮤니티에서 이목을 끌고 있습니다. 이번 평가는 동일한 연속 대화 세션 내에서 모델당 최대 3번의 시도 기회를 부여하고, 트랙 중앙선 경로를 기준으로 4m 이내를 유지하며 완주하는지 측정하는 방식으로 진행되었습니다.
테스트 결과, 'GPT-6 아스트라(GPT-6 Astra)'가 단 2번의 시도 만에 코스를 100% 완주하며 1위를 차지했습니다. 첫 번째 시도에서는 49%(67.3m) 지점에서 실패(DNF)했으나, 이전 주행 내용을 피드백한 두 번째 시도에서 총 24회의 제어 명령(set_motion 등)과 660만 토큰(비용 약 7.74달러)을 소모하며 5분 22초의 기록으로 134.7m 전체 코스를 완주하는 데 성공했습니다.
반면 경쟁 모델들은 완주에 실패했습니다. '클로드 페이블 5.1(Claude Fable 5.1)'은 3차 시도에서 최대 45%(73.7m)까지 진행했으나 끝내 완주하지 못했고, '그록 4.6(Grok 4.6)'은 최고 11%(22.6m), 'GPT-5.6 솔(GPT-5.6 Sol)'은 최고 6%(17.1m) 지점에서 멈춰 서며 큰 격차를 보였습니다. 대형 언어 모델(LLM)이 대화형 피드백을 통해 직접 차량 주행 제어 명령을 내려 코스를 완주했다는 점에서 기술적 진보와 함께 신기하다는 반응이 나오고 있습니다.
Sponsored · 광고