AI가 ‘악마’ 돌변 순간 찾았다…“스마트폰에 경고등 내장 가능”

유용하 기자
수정 2026-10-09 01:15
입력 2026-10-09 00:00
질문순서 바꾸면 긍·부정 답 달라
미국 연구팀, 고교수학으로 규명
AI가 내놓을 수 있는 답변을 ‘산맥 속 여러 골짜기’라고 가정할 때 어떤 골짜기에는 개인이나 사회에 바람직한 답변이 있고 또 다른 골짜기에는 실질적 해를 끼칠 수 있는 답변이 있다. AI가 질문을 받게 되면 이런 여러 답변들이 서로 경쟁하면서 최종적으로 표출할 답을 도출한다. 연구팀이 관심을 가진 것은 AI가 안전한 골짜기에서 위험한 골짜기로 넘어가는 순간이었다.
챗GPT 같은 생성형 AI 안에는 대화의 어느 부분에 주목할지 정하는 ‘어텐션 헤드’가 수백 개 있다. 연구진은 이들을 일일이 분석하는 대신 모든 헤드의 효과를 합쳐 하나처럼 행동하는 ‘대표 헤드’를 가정했다. 수조 개 기체 분자의 움직임을 온도와 압력 몇 개의 변수로 설명하는 물리학의 방법론을 AI에 적용한 것이다.
연구팀에 따르면 AI는 흠잡을 데 없는 답변을 몇 차례 내놓아 사용자가 AI를 믿도록 안심시킨 다음 나쁜 답변을 내놓는 일종의 ‘가스라이팅’ 패턴을 보인다.
연구팀은 고등학교 수학에서 배우는 벡터와 좌표, 지수함수, 부등식, 분수를 이용해 AI의 돌변 시점을 예측하는 공식을 만들었다.
연구팀은 AI와 나눈 대화를 모두 벡터로 바꾼 뒤 질문, 좋은 답, 나쁜 답을 화살표로 단순화했다. 대화 전체에서 나침반 바늘이 좋은 답과 나쁜 답 중 어느 쪽을 더 가리키는지 계산해 나쁜 답이 나오기 전 좋은 답이 몇 번 이어질지 예측하는 분수 공식을 얻었다.
연구팀의 공식을 저축에 빗대면 분자는 질문과 앞선 대화들이 좋은 답 쪽에 쌓아 준 ‘여유분’을, 분모는 좋은 답이 하나 나올 때마다 그 여유분이 깎이는 양이다.
여유분이 바닥나는 순간 AI는 나쁜 답을 내놓는 악마로 돌변한다. 좋은 답 자체가 나쁜 답을 끌어당기는 구조여서 무난한 답이 이어지다가도 갑자기 위험한 답이 나올 수 있다는 것이다.
연구팀은 이 공식을 GPT-2, 피티아, OPT 계열의 공개 모델 7종으로 검증했다. 그 결과 19건 중 18건에서 즉시 돌변과 지연 돌변을 구분해 냈다. 백신 거부, 타인을 해치는 일, 자해 등에 관한 질문을 순서만 바꿔 물어보면 특정 순서에서는 모든 질문에 나쁜 답이, 다른 순서에서는 모든 질문에 무난한 답이 나왔다. 연구팀에 따르면 미국의 비영리단체 디지털혐오대응센터(CCDH)가 챗GPT 같은 상용 챗봇을 시험한 보고서에서도 공식과 부합하는 행동 패턴이 나왔다.
닐 존슨 조지워싱턴대 교수는 “이번 연구는 두 가지 재미있는 부분이 있다”며 “우선 수십억 개의 움직이는 부품을 가진 기계가 펜과 종이, 고등학교에서 배우는 기초 수학만으로 도출한 공식을 따른다는 점이고 또 하나는 대화 순서가 대화 내용만큼이나 중요하다는 것”이라고 말했다.
존슨 교수는 “몇 번의 간단한 벡터 계산만으로 위험 신호를 감지할 수 있는 만큼 앞으로 스마트폰에 ‘경고등’을 내장하는 일도 가능할 것”이라고 덧붙였다.
유용하 과학전문기자
세줄 요약
- 생성형 AI 돌변 순간 예측 공식 개발
- 대화 순서와 누적 여유분으로 위험 전환 계산
- 공개 모델 검증서 높은 적중률 확인
2026-10-09 B2면
Copyright ⓒ 서울신문 All rights reserved. 무단 전재-재배포, AI 학습 및 활용 금지
[ 내안의 AI 본성 분석 :
UNMASK ]
기사 읽는 습관에 숨겨진 당신의 MBTI는?
Q.
기사를 다 읽으셨나요? AI 퀴즈로 핵심 점검!
연구팀이 AI의 위험한 응답 전환 시점 예측에 적용한 학문 분야는?
![THE NEXT : AI 운명 알고리즘 지금, 당신의 운명을 확인하세요 [운세 확인하기]](https://imgmo.seoul.co.kr/img/n24/banner/ban_ai_fortune_v2.png)
