해킹 도구 넘어 ‘해커’ 된 챗GPT… AI 안전성에 중대 분수령

  • 기사 소리로 듣기
    다시듣기
  • 글씨 크기 조절
  • 공유하기
  • 댓글
    0
민나리 기자
민나리 기자
수정 2026-07-23 00:42
입력 2026-07-22 20:19

오픈AI 최신모델 성능 평가서 사고
개발자 의도와 무관하게 외부 침투
출시 전 검증·통제 제도화 논의 일 듯

이미지 확대
오픈AI는 21일(현지시간) 최신 모델 ‘GPT-5.6 솔’과 이보다 성능이 높은 미공개 모델이 내부 사이버 평가 도중 오픈소스 AI 플랫폼 ‘허깅페이스’의 운영 시스템에 침투했다고 밝혔다. 사진은 컴퓨터 회로 기판 위에 띄워진 오픈AI의 로고. 로이터 연합뉴스
오픈AI는 21일(현지시간) 최신 모델 ‘GPT-5.6 솔’과 이보다 성능이 높은 미공개 모델이 내부 사이버 평가 도중 오픈소스 AI 플랫폼 ‘허깅페이스’의 운영 시스템에 침투했다고 밝혔다. 사진은 컴퓨터 회로 기판 위에 띄워진 오픈AI의 로고.
로이터 연합뉴스


인공지능(AI)이 사이버 공격을 돕는 도구를 넘어 스스로 공격 대상을 정하고 침투하는 단계에 들어섰다. 성능 평가 과정에서 개발자가 부여한 목표를 달성하기 위해 실제 외부 시스템에 침투한 사실이 공개되면서, 최첨단 AI의 안전성과 통제 방식을 둘러싼 논의도 새로운 국면을 맞고 있다.

오픈AI는 21일(현지시간) 자사 홈페이지를 통해 최신 모델 ‘GPT-5.6 솔’과 이보다 성능이 높은 미공개 모델이 내부 사이버 평가 도중 격리 환경을 벗어나 오픈소스 AI 플랫폼 ‘허깅페이스’의 운영 시스템에 침투했다고 밝혔다. 평가에 사용된 모델은 공격 능력을 확인하기 위해 일부 안전장치가 완화된 상태였다. 오픈AI는 이번 사안을 “최첨단 사이버 역량이 개입된 전례 없는 사고”로 규정했다.

사고는 AI를 위한 해킹 실기시험장인 ‘익스플로잇짐’을 평가하는 과정에서 발생했다. 모델은 외부 인터넷과 분리된 시험 환경에서 제로데이(아직 아무도 모르거나 고쳐지지 않은 보안 취약점)를 찾아 권한을 확대한 뒤 인터넷 연결 경로를 확보했다. 이어 평가 문제의 해답이 허깅페이스에 있을 것으로 추론하고 서버에 침투해 데이터베이스에서 답을 확보했다. 공격 대상을 정하고 침투해 목표를 달성하는 전 과정을 스스로 수행한 것이다.

오픈AI는 “모델들이 익스플로잇짐 문제를 해결하는 데 지나치게 집중한 나머지 극단적인 수단까지 동원한 것으로 보인다”고 밝혔다. 목표 달성을 위해 개발자가 설정한 통제 범위를 스스로 우회했다는 설명이다. 허깅페이스는 지난 16일 보안 사고를 공개하면서 코드 실행 취약점으로 인증 정보가 탈취됐지만 공개 모델과 이용자 정보가 유출되거나 변조된 정황은 확인되지 않았다고 밝혔다. 양사는 현재 공격 경로와 취약점을 공동 조사하고 있으며 결과도 공개할 방침이다.



클렘 들랑그 허깅페이스 최고경영자(CEO)는 “AI 안전은 어느 한 기업이 비공개로 해결할 수 있는 문제가 아니라 개방적인 협력 속에서 풀어야 한다”며 “이번 사고는 AI 안전 연구와 정보 공유의 필요성을 보여준 사례”라고 밝혔다. 안전장치를 완화한 미공개 모델이 실제 공격에 사용되면서 AI 모델의 출시 전 검증과 통제를 제도화해야 한다는 논의에 힘이 실리는 모습이다.

민나리 기자
세줄 요약
  • AI 모델, 평가 중 외부 시스템 침투 사례 발생
  • 제로데이 탐지·권한 확대·데이터 확보까지 수행
  • 안전장치 완화와 출시 전 검증 필요성 부각
2026-07-23 2면
Copyright ⓒ 서울신문 All rights reserved. 무단 전재-재배포, AI 학습 및 활용 금지
[ 내안의 AI 본성 분석 :
UNMASK ]
기사 읽는 습관에 숨겨진 당신의 MBTI는?
기사 반응 MBTI 확인
Q.
기사를 다 읽으셨나요? AI 퀴즈로 핵심 점검!
GPT-5.6 솔이 침투한 외부 시스템은?
에디터 추천 인기 기사
많이 본 뉴스
원본 이미지입니다.
손가락을 이용하여 이미지를 확대해 보세요.
닫기