핵심 요약
- 카네기멜론·MIT 등 연합 연구진의 AI '아타락소스'가 역대 최고 스트라테고 선수 핌 니메이어를 15승 4무 1패로 꺾었습니다.
- 말의 정체가 숨겨져 있고 경우의 수와 심리전이 극심해 딥마인드도 정복하지 못했던 게임을 단 16대 GPU와 저예산으로 훈련해 정복했습니다.
- 승률 2%의 열세에서도 동요 없이 블러핑을 구사해 역전하는 냉정함을 보여주며 기존 인간 챔피언들의 메타까지 바꿔놓았습니다.
요약 체스의 딥블루, 바둑의 알파고에 이어 포커 인공지능까지 인간 최고수를 꺾었지만, 고전 보드게임 '스트라테고(Stratego)'만은 유독 AI가 정복하지 못한 난공불락의 영역으로 남아 있었습니다. 막대한 예산을 쏟아부은 딥마인드조차 인간 챔피언을 안정적으로 이기는 AI를 만들지 못했을 정도였는데요. 최근 카네기멜론, MIT, 뉴욕대, 스탠퍼드대 연합 연구진이 개발한 AI '아타락소스(Ataraxos)'가 역대 최고 선수로 꼽히는 핌 니메이어를 상대로 15승 4무 1패라는 압도적인 성적을 거두며 벽을 무너뜨렸습니다. 더욱 놀라운 점은 대규모 슈퍼컴퓨터가 아니라 단 16대의 GPU와 수천 달러 수준의 저예산으로 훈련을 마쳤다는 사실입니다.
스트라테고는 각자 40개의 말을 배치하고 상대방의 깃발을 먼저 빼앗으면 이기는 게임입니다. 하지만 상대 말의 정체(원수부터 스파이, 폭탄, 깃발 등)는 부딪쳐 싸우기 전까지 철저히 가려져 있는 '불완전 정보 게임'입니다. 텍사스 홀덤 포커는 숨겨진 카드가 2장에 불과해 가능한 패의 수가 1,326가지뿐이지만, 스트라테고는 40개 말의 배치 조합만 해도 1데실리온(10의 33제곱)이 넘습니다. 게다가 보통 40수 안팎에서 끝나는 체스와 달리 한 게임에 2,000수 이상 이어지기도 하며, 약한 말로 센 척을 하는 고도의 블러핑(허풍)과 심리전이 필수적이라 기존 AI 알고리즘으로는 탐색이 거의 불가능했습니다.
연구진은 아타락소스에 1억 6,300만 번의 자가 대국 훈련을 시키는 동시에, 상대 말의 이동 패턴을 보고 정체를 추정하는 보조 신경망(신념 모델)을 도입했습니다. 모든 경우의 수를 무식하게 계산하는 대신, 가장 그럴듯한 상황들을 샘플링해 수를 읽는 방식을 택한 것입니다. 고대 그리스어로 '평온과 동요 없음'을 뜻하는 이름처럼, 아타락소스는 승률이 2%까지 떨어지는 극한의 불리한 상황에서도 인간처럼 무모한 도박수를 두지 않고 태연하게 블러핑을 이어가며 기적 같은 역전승을 일궈냈습니다. 통산 4회 세계 챔피언이자 600주 넘게 세계 1위를 지킨 전설적인 플레이어 니메이어는 승리당 100달러를 받는 조건으로 3주간 20판을 치렀으나 단 1승을 거두는 데 그쳤고, 이후 2025 세계 선수권 대회 참가자들과의 대결에서도 아타락소스는 40전 38승을 거두며 기존 인간 플레이어들의 메타(전략)마저 뒤흔들고 있습니다.
Sponsored · 광고