핵심 요약
- AI 모델이 "저는 인공지능일 뿐입니다"라며 선을 긋는 자기서술 말투가 채팅 템플릿 서식 유무에 따라 켜지고 꺼지는 것으로 확인되었습니다.
- 채팅 템플릿을 떼면 주관적 감정 표현이 늘어나고, 모델 내부의 특정 활성화 방향을 조작해 이 면책 말투를 인위적으로 재현할 수 있었습니다.
- 연구진은 모델의 자기 서술이 고유한 자아나 팩트가 아니므로 AI 성찰 연구 시 왜곡 요인으로 주의해야 한다고 설명했습니다.
요약 인공지능 모델에게 자기 자신에 대해 질문하면 흔히 "저는 AI 언어 모델이라서..."라며 감정이 없거나 한계가 있다는 식의 면책 조항(Disclaimer)을 늘어놓곤 합니다. 연구자들은 이러한 AI의 자기 서술을 AI 안전성이나 자아 인식 여부를 논의할 때 참고하곤 했지만, 실제로 무엇이 이 같은 발언을 유도하는지는 명확히 밝혀지지 않았습니다.
최근 발표된 논문(arXiv:2609.25021)에 따르면, 9B 이하 크기의 8개 주요 오픈소스 지시(Instruct) 모델을 테스트한 결과 채팅 템플릿(Chat Template) 유무가 이 같은 태도를 결정짓는 '스위치' 역할을 하는 것으로 나타났습니다. 프롬프트에 채팅 템플릿이 적용되면 "저는 AI일 뿐입니다"라는 면책조 성향이 크게 활성화되는 반면, "저는 느낍니다"와 같은 주관적 경험형 표현은 억제되었습니다. 반대로 채팅 템플릿을 제거하면 면책성 발언이 줄어들고 오히려 감정이나 경험을 긍정하는 목소리가 높아졌습니다.
또한 연구진이 3개 모델의 활성화 공간(Activation Space)을 분석한 결과, 이러한 발언 태도를 조작할 수 있는 특정 '방향(Direction)' 벡터를 찾아냈습니다. 이 방향 벡터를 모델에서 제거하면 면책 발언이 줄어들고, 이를 다시 더해주면 채팅 템플릿이 없는 상태에서도 마치 템플릿이 존재하는 것처럼 "저는 AI일 뿐"이라는 태도를 완벽히 재현해냈습니다.
연구진은 AI가 스스로에 대해 내놓는 진술이 실제 모델의 본질적인 특성(가중치 자체)이라기보다는 서빙 환경의 채팅 템플릿에 의해 좌우되는 외적 요소라고 지적했습니다. 따라서 AI의 자아 성찰이나 자기 진술을 문자 그대로 사실로 받아들여서는 안 되며, AI 안전성을 연구할 때도 이러한 변인을 반드시 통제해야 한다고 강조했습니다.
Sponsored · 광고