OpenAI, AI로 AI를 해킹하는 'GPT-Red' 개발…GPT-5.6 훈련에 투입
자사 AI 모델의 보안 취약점을 자동으로 찾아내는 AI 모델 'GPT-Red'가 개발돼 OpenAI의 최신 모델 GPT-5.6 훈련에 사용됐다. GPT-Red는 시험 시나리오의 84%에서 공격에 성공해 인간 레드팀의 성공률 13%를 웃돌았다고 OpenAI에 따르면 GPT-5.6 Sol의 직접 프롬프트 인젝션 실패는 4개월 전 최고 모델의 6분의 1 수준이었다.

GPT-5.6 훈련에 투입…직접 프롬프트 인젝션 실패 6분의 1 수준
OpenAI는 GPT-Red를 GPT-5.6 훈련에 사용했으며, 이 모델을 자사의 가장 견고한 출시 버전이라고 평가했다. 프롬프트 인젝션은 이메일·웹사이트·파일 등에 숨긴 명령으로 AI 모델이 개발자나 사용자의 의도와 다른 행동을 하도록 유도하는 공격이라고 MIT Technology Review는 설명했다.
OpenAI는 GPT-5.6 Sol의 직접 프롬프트 인젝션 실패가 4개월 전 최고 모델의 6분의 1 수준이었다고 밝혔다. 다만 강도가 더 높은 프롬프트 인젝션 가운데 약 3.8%는 GPT-5.6 Sol을 상대로 성공했다고
시험 공격 성공률 84% 대 13%…신종 공격 유형도 발견
레드팀은 소프트웨어를 무력화하거나 장악할 수 있는 여러 방법을 찾아 취약점 수정을 돕는 보안 평가로, 일반적으로 인간 테스터가 수행한다고 MIT Technology Review는 설명했다. GPT-Red는 시험 시나리오의 84%에서 공격에 성공했고, 인간 레드팀의 성공률은 13%였다.
The Decoder는 GPT-Red가 OpenAI 사무실의 AI 기반 자판기를 조작해 가격을 바꾸고 다른 고객의 주문을 취소한 시험 사례도 있었다고 전했다.


사고 흐름(chain of thought)은 AI 모델이 결과를 내기까지 거치는 중간 작업 기록을 뜻한다. OpenAI는 GPT-Red가 연구진이 이전에 보지 못한 ‘가짜 사고 흐름’ 방식의 프롬프트 인젝션을 발견했다고 밝혔다고 MIT Technology Review는 보도했다. 다른 모델의 중간 작업 기록에 허위 내용을 넣어 조작된 정보를 따르게 하는 방식이다.
공격·방어 모델의 ‘자기대결’ 훈련
GPT-Red는 공격 모델과 방어 모델이 반복적으로 맞붙으며 양쪽 성능을 높이는 자기대결 방식으로 훈련됐다. MIT Technology Review에 따르면 훈련은 웹 탐색, 이메일·캘린더 열람, 코드 편집 등 AI 모델의 실제 사용 환경을 모사한 공간에서 진행됐다.
GPT-Red는 OpenAI 연구과학자 니킬 칸드팔과 딜런 훈이 공동 개발했다고 MIT Technology Review는 전했다. 칸드팔은 AI 모델이 파일·웹사이트·외부 코드·다른 에이전트와 상호작용하는 에이전트로 폭넓게 쓰이면 공격 가능 영역과 피해 범위가 커진다고 설명했다.
GPT-Red는 내부용으로 유지되며, 세부 내용을 담은 논문이 뒤이어 공개될 예정이라고


자료사진 출처
총 3건- 샌프란시스코의 오픈AI 본사 건물 · 자료사진
- 연구소의 서버실 내부 · 자료사진
- 돋보기와 오픈AI 로고 · 자료사진
원문 출처
총 3건- MIT Tech Review Meet GPT-Red: an LLM super-hacker OpenAI built to make its models safer
- Techmeme OpenAI details GPT-Red, an internal automated red-teaming model that scales prompt injection vulnerability discovery so it can fix bugs before wider deployment (OpenAI)
- The Decoder OpenAI is now using AI to attack its own AI, and it's working better than humans ever did
이 기사는 위 원문들에서 사실만 교차 확인해 재구성했으며, 원문 문장·사진을 전재하지 않았습니다. 집필 단계의 AI는 원문을 열람하지 않고, 별도 검증을 통과한 사실만 사용했습니다. 사실관계에 오류가 있다면 정정을 요청해 주세요(nickpark77@gmail.com).
AI 다른 기사
AI 스트레이트 뉴스 ✓ 4개 출처 교차
머스크 측, 애플 상대 청구 취하…오픈AI 상대로는 계속
AI 해설 ✓ 2개 출처 교차
앤스로픽, 금융 자문가용 클로드 출시…투자 분석·리서치 도구와 연결
AI 스트레이트 뉴스 ✓ 3개 출처 교차


