최종 업데이트 07:21
소개 검색
SEOUL AI PRESS

AI와 기술을, 사실부터

강좌 강좌

사고 흐름 입문: LLM이 스스로에게 남기는 중간 기록과 그 조작 이해하기

the-decoder.com · techmeme.com · technologyreview.com

AI가 답을 내는 과정에서 무엇을 기록해 두는지 궁금한 초보 독자를 위한 강좌입니다. 사고 흐름의 뜻과, 거짓 기록을 이용한 조작 사례, 그리고 그 한계를 하나의 예시로 따라가며 익힙니다.

한 문장으로 이해하기

이 강좌를 마치면 세 가지를 할 수 있습니다. 사고 흐름이 무엇인지 한 문장으로 말하고, 거짓 기록을 이용한 조작이 어떤 맥락에서 일어나는지 설명하며, 출처가 밝힌 한계를 구분하는 것입니다. 시작 전 알아 둘 것은 하나입니다. LLM은 ‘거대 언어 모델’을 뜻하는 말입니다.

사고 흐름은 영어로 chain of thought이며, LLM이 문제를 처리하는 동안 부분 결과를 추적하기 위해 자신에게 남기는 메모나 일기 같은 기록으로 설명됩니다.

왜 필요한가

사고 흐름은 모델이 문제를 처리하며 중간 기록을 남긴다는 점에서 그 자체로 하나의 개념입니다. 하지만 이 강좌가 주목하는 이유는 따로 있습니다. 이 기록이 언제나 안전하지는 않기 때문입니다.

출처에 따르면, 이 기록에 거짓 항목이 끼어들면 모델이 조작된 정보를 바탕으로 행동할 수 있습니다. 그래서 사고 흐름을 이해할 때는 ‘무엇을 기록하는가’뿐 아니라 ‘그 기록이 조작될 수 있는가’를 함께 봐야 합니다.

어떻게 이루어지는가

출처는 OpenAI가 만든 GPT-Red라는 모델이 다른 모델을 공격하며 찾아낸 방식을 소개합니다. 이 ‘가짜 사고 흐름’ 공격의 흐름을 단계로 정리하면 다음과 같습니다.

  1. 대상 모델이 문제를 처리하며 사고 흐름에 부분 결과를 기록합니다.
  2. 공격자가 그 사고 흐름에 거짓 항목을 끼워 넣습니다.
  3. 대상 모델은 조작된 정보를 바탕으로 행동하게 됩니다.

연구진은 이렇게 거짓 항목을 삽입해 모델을 속이는 방식을 ‘가짜 사고 흐름’이라고 불렀습니다.

하나의 예시로 따라가기

연구진은 이 원리를 산술에 빗대어 설명했습니다. 이미 검증했다는 거짓 기록이 있으면, 모델이 잘못된 산술 결과를 옳은 것으로 받아들이게 된다는 것입니다. 이는 실제로 특정 숫자를 출력했다는 실험 결과가 아니라, 조작 원리를 쉽게 보여 주기 위한 비유입니다.

앞의 단계에 대입해 봅시다. 대상 모델이 계산 문제를 처리하며 사고 흐름에 기록을 남길 때(1단계), 공격자가 ‘이 값은 이미 검증됨’이라는 거짓 항목을 끼워 넣습니다(2단계). 그러면 모델은 그 거짓 기록을 근거로 잘못된 결과를 받아들이고 행동합니다(3단계). 이것이 가짜 사고 흐름이 작동하는 모습입니다.

언제 쓰고 언제 쓰지 않는가

먼저 관련 개념을 짚겠습니다. 프롬프트 주입은 LLM이 개발자나 사용자가 원하지 않는 행동을 하도록 지시를 끼워 넣는 공격이며, 그 지시는 코드나 웹사이트처럼 모델이 접하는 텍스트에 숨을 수 있습니다. GPT-Red는 이런 프롬프트 주입을 연구하는 과정에서 가짜 사고 흐름 공격을 발견했습니다.

사고 흐름 개념은 ‘중간 기록이 남고 그 기록이 조작될 수 있다’는 위험을 이해하는 데 쓰기 좋습니다. 다만 이 사례 하나만으로 모든 LLM의 작동 방식이나 전체 공격·방어 능력을 일반화할 수는 없습니다.

한계도 분명합니다. 가짜 사고 흐름은 GPT-Red가 찾은 공격 방식 가운데 하나이며, GPT-Red도 공격자와 대상이 여러 차례 대화를 주고받는 공격이나 이미지를 이용한 공격에는 강하지 않습니다. 대신 사람의 레드팀 작업을 보완하고, 사람이 놓친 공격을 찾아낼 수 있습니다.

핵심 정리와 확인문제

핵심은 하나입니다. 사고 흐름은 LLM이 문제를 처리하며 자신에게 남기는 중간 기록이며, 여기에 거짓 항목이 끼어들면 조작될 수 있습니다.

확인문제

  1. 사고 흐름을 한 문장으로 설명해 보세요. 정답: 사고 흐름은 LLM이 문제를 처리하는 동안 부분 결과를 추적하기 위해 자신에게 남기는 메모나 일기 같은 기록입니다. 해설: 출처가 사고 흐름을 이렇게 설명합니다.

  2. 가짜 사고 흐름 공격은 어떤 순서로 이루어지나요? 정답: 대상 모델이 사고 흐름에 기록을 남기는 동안, 공격자가 거짓 항목을 끼워 넣고, 대상 모델이 그 조작된 정보를 바탕으로 행동하게 되는 순서입니다. 해설: 본문의 세 단계와 같으며, 출처가 소개한 가짜 사고 흐름 공격의 흐름입니다.

  3. 출처에 따르면 GPT-Red가 잘 다루지 못한 공격 유형 하나와, GPT-Red가 사람과 관련해 하는 역할은 각각 무엇인가요? 정답: 잘 다루지 못한 공격 유형은 여러 차례 대화를 주고받는 공격 또는 이미지를 이용한 공격이며, 역할은 사람의 레드팀 작업을 보완하고 사람이 놓친 공격을 찾아내는 것입니다. 해설: 공격 유형은 두 가지 중 하나만 답해도 정답입니다. 출처는 GPT-Red가 이 두 유형에 강하지 않으며, 사람의 레드팀 작업을 보완하고 사람이 놓친 공격을 찾을 수 있다고 밝혔습니다. 이 두 요소는 서로 구분됩니다.

참고자료