강좌 강좌
장기 지평 소프트웨어 엔지니어링 입문: 여러 단계를 이어가는 개발 작업이란
인공지능(AI)에게 코드를 맡길 때 자주 등장하는 말이 '장기 지평'입니다. 이 강좌는 이 표현이 입력 자료에서 어떤 뜻으로 쓰였는지, 그리고 어떤 한계가 따르는지를 처음 배우는 독자를 위해 정리합니다.
한 문장으로 이해하기
장기 지평(long-horizon)은 ‘오래 이어지는 시간 범위’라는 뜻입니다. 그래서 장기 지평 소프트웨어 엔지니어링은 여러 단계의 추론과 반복적인 도구 호출이 필요한 복잡한 개발 작업을 가리키는 표현으로 쓰입니다. 보편적으로 확정된 개발 방법론의 이름이 아니라, 모델 소개 자료에서 이런 종류의 작업을 묶어 부르는 말에 가깝습니다.
이 강좌를 마치면 세 가지를 할 수 있습니다. 첫째, 이 표현이 어떤 작업을 가리키는지 자기 말로 설명할 수 있습니다. 둘째, 출처가 확인하는 동작과 강좌가 설명을 위해 덧붙인 부분을 구분할 수 있습니다. 셋째, 계산 효율이 중요할 때 어떤 선택지가 제안됐는지 말할 수 있습니다. 사전지식은 많지 않습니다. AI 모델에게 글로 지시를 내린다는 것, 그리고 소프트웨어에 버그가 생기고 이를 고치는 작업이 있다는 정도면 충분합니다.
왜 필요한가
입력 자료는 장기 지평 작업을 복잡한 작업에서의 추가 추론 단계 및 반복적 도구 호출과 연결해 설명합니다.
구글은 Gemini 3.8에서 장기 지평 추론 작업에 초점을 맞췄다고 밝혔습니다. AI Business는 Gemini 3.8 Flash가 장기 지평 소프트웨어 엔지니어링, 자율 에이전트, 복잡한 기업 업무 흐름을 위해 만들어졌다고 전했습니다. 자율 에이전트가 무엇인지에 대한 설명은 입력 자료에 없고, 적용 대상으로 함께 언급됐다는 사실만 확인됩니다.
측정 지표도 언급됩니다. DeepSWE v1.1은 출처에서 장기 지평 소프트웨어 엔지니어링 과제로 표시된 벤치마크(성능 비교 시험)입니다. The Decoder가 인용한 구글 수치에서 Gemini 3.8 Flash는 73.7%, Gemini 3.7 Flash는 65.3%였습니다. 다만 이 점수는 특정 시험의 결과일 뿐, 실제 개발 환경의 성공률이나 신뢰성을 그대로 말해주지는 않습니다.
어떻게 이루어지는가
출처가 직접 확인해 주는 동작은 두 가지입니다.
- 복잡한 작업에서 추가 추론 단계를 수행한다. 구글은 Gemini 3.8 Flash가 그렇게 동작한다고 설명했습니다.
- 도구를 반복적으로 호출한다. 필요한 도구를 한 번이 아니라 반복적으로 호출하는 방식입니다.
그 밖에 목표를 잘게 나누거나, 결과를 보고 다시 다듬거나, 최종 결과물을 내놓는 흐름은 출처가 확정한 일반 작동 원리가 아닙니다. 아래 가상 예시에서 이해를 돕기 위해 가정한 진행 방식으로만 읽어 주세요. 또한 반복이 가능하다는 사실과 반복하면 결과가 정확해진다는 주장은 다릅니다. 여러 번 시도해도 옳은 답에 이르지 못할 수 있습니다.
하나의 예시로 따라가기
가상 예시입니다. 실제 시스템이나 검증된 성공 사례가 아니라, 위 두 가지 동작을 상상해 보기 위한 설정입니다. 어떤 회사의 결제 화면에서 특정 조건일 때 오류가 난다고 해봅시다.
사람은 ‘결제 오류의 원인을 찾아 고쳐라’라고 지시합니다. 모델은 곧장 답하지 않고 추가 추론 단계를 거칩니다. 이어서 이 가상 예시에서는 관련 파일을 여는 도구와 시험을 실행하는 도구를 반복해서 호출한다고 가정합니다. 한 번 실패하면 다시 시도합니다.
여기서 중요한 점은 결말이 보장되지 않는다는 것입니다. 모델이 원인을 못 찾을 수도 있고, 통과한 것처럼 보이는 수정안이 실제로는 틀릴 수도 있습니다. 이 가상 예시에서는 사람이 결과를 검토한다고 가정합니다. 같은 일을 단발성으로 물으면, 이 가상 예시에서는 모델이 한 번의 답에서 멈춘다고 가정합니다. 이 차이가 장기 지평이라는 말이 가리키는 지점입니다.
언제 쓰고 언제 쓰지 않는가
흔한 오해부터 정리합니다. 장기 지평은 ‘더 똑똑하다’는 뜻이 아니라 ‘여러 단계를 거치고 도구를 여러 번 부른다’는 쪽에 가깝습니다. 그리고 그 반복에는 살펴볼 대가가 있습니다.
구글은 Gemini 3.8 Flash가 높은 노력 수준에서 성능을 높이기 위해 더 많은 토큰을 사용할 수 있다고 밝혔습니다. 입력 자료는 노력 수준의 구체적인 의미와 조절 방식을 설명하지 않습니다. 토큰은 모델이 입력과 출력을 처리할 때 세는 단위이며, 여기서 언급되는 Gemini의 가격은 이 입력·출력 토큰 수를 기준으로 매겨집니다. The Decoder는 Artificial Analysis 자료를 근거로 과제당 비용이 Gemini 3.7 Flash의 0.40달러에서 Gemini 3.8 Flash의 0.58달러로 늘었고, 두 모델의 토큰당 가격은 같았다고 전했습니다.
출처가 뒷받침하는 판단 기준은 세 가지입니다. 작업이 복잡한가, 도구를 반복해서 불러야 하는가, 계산 효율이 주된 제약인가입니다. 구글은 계산 효율이 주된 제약인 작업이라면 낮은 노력 수준을 쓰거나 Gemini 3.7 Flash를 계속 사용할 수 있다고 안내했습니다. 이 밖의 세부적인 적합·부적합 판단은 출처에 없으며, 각자의 상황에서 직접 확인할 몫입니다.
핵심 정리와 확인문제
장기 지평 소프트웨어 엔지니어링은 여러 단계의 추론과 반복적인 도구 호출이 필요한 복잡한 개발 작업을 가리키는 표현입니다. 반복이 가능하다는 점이 특징이고, Gemini 3.8 Flash는 높은 노력 수준에서 더 많은 토큰을 사용할 수 있으며 결과가 보장되지도 않습니다.
확인문제
- 장기 지평 소프트웨어 엔지니어링이 가리키는 작업의 특징을 한 문장으로 쓰세요.
- 출처가 확인해 주는 모델의 동작 두 가지는 무엇인가요?
- 계산 효율이 주된 제약일 때 구글이 제안한 선택지는 무엇이며 그 이유는 무엇인가요?
정답과 해설
- 정답은 ‘여러 단계의 추론과 반복적인 도구 호출이 필요한 복잡한 개발 작업’입니다. 해설: 입력 자료는 복잡한 작업에서 추가 추론 단계와 반복적 도구 호출이 이루어진다고 설명합니다.
- 정답은 복잡한 작업에서 추가 추론 단계를 수행하는 것과 도구를 반복적으로 호출하는 것입니다. 해설: 이 두 가지는 구글이 Gemini 3.8 Flash에 대해 직접 설명한 내용이고, 목표 분해나 자체 검증 같은 흐름은 가상 예시의 가정입니다.
- 정답은 낮은 노력 수준을 쓰거나 Gemini 3.7 Flash를 계속 사용하는 것입니다. 해설: 구글은 복잡한 작업에서 추가 추론 단계와 반복적 도구 호출을 수행하며, 높은 노력 수준에서는 토큰을 더 사용할 수 있다고 설명했습니다. 그래서 계산 효율이 주된 제약인 경우 이 선택지를 안내했습니다.