Search

[AI 활용팁] GPT-5.6 제대로 쓰기…추론 강도 기본값만 알아도 요금 줄어든다

[AI 활용팁] GPT-5.6 제대로 쓰기…추론 강도 기본값만 알아도 요금 줄어든다
[AI 활용팁] GPT-5.6 제대로 쓰기…추론 강도 기본값만 알아도 요금 줄어든다

GPT-5.6에서 같은 프롬프트를 넣어도 응답 품질과 요금이 함께 달라지는 설정이 있다. 추론 강도(reasoning effort)다. 오픈AI는 공식 문서에 여섯 단계를 두고 각 단계가 어떤 작업에 맞는지 정리해 뒀는데, 기본값이 무엇인지 모른 채 모델만 바꾸면 응답이 느려지고 요금이 오르는 일이 생긴다. 7월 30일 가격 인하로 모델별 단가가 달라진 것도 함께 봐야 한다.

1. 여섯 단계, 어디에 쓰나

GPT-5.6이 지원하는 값은 none, low, medium, high, xhigh, max 여섯 개다. 오픈AI 추론 가이드에 각 단계의 용도가 적혀 있다.

단계오픈AI가 밝힌 용도대표 작업
none추론이나 연쇄 도구 호출로 얻는 이득이 없고 지연이 결정적일 때음성, 빠른 정보 검색, 분류
low지연 증가가 크지 않은 효율적 추론. 도구 사용·계획·검색·다단계 판단이 필요할 때데이터 분석, 초안 작성, 실행 중심 코딩, 고객지원
medium품질과 신뢰성이 중요하고 계획·복합 추론·판단이 들어갈 때. 기본값에이전틱 코딩, 리서치, 스프레드시트·슬라이드 작업
high어려운 추론, 복잡한 디버깅, 깊은 계획. 지연보다 품질이 중요할 때에이전틱 코딩, 장기 리서치, 지식 작업
xhigh심층 리서치, 비동기 워크플로, 장시간 실행이 필요한 에이전트 작업보안·코드 리뷰, 기업 생산성, 난도 높은 코딩
max가장 복잡한 과제. xhigh와 비교해 이득이 확인될 때만최난도 품질 우선 작업

지연에 민감하더라도 곧바로 none으로 내리지 말고 low부터 시험하라는 것이 공식 권고다. high와 xhigh는 평가에서 유의미한 이득이 나올 때만 쓰고, max는 전역으로 권장하지 말라고 문서에 분명히 적혀 있다.

2. 기본값이 medium이라는 점부터 확인한다

reasoning.effort를 생략하면 GPT-5.6은 medium으로 동작한다. 여기서 사고가 자주 난다. 기존에 쓰던 모델의 실효 강도가 none이었는데 설정을 적지 않은 채 GPT-5.6으로 바꾸면 medium이 상속되기 때문이다. 업그레이드 가이드는 이 조합을 두고 응답이 느려지고 비용이 오르며 Chat Completions의 함수 도구와 호환되지 않게 된다고 설명한다.

다만 Chat Completions 호환성은 공식 문서끼리 서술이 어긋난다. 업그레이드 가이드는 GPT-5.6에서 함수 도구가 실효 추론 none일 때만 호환된다고 적었고, Responses API 마이그레이션 문서는 GPT-5.4부터 reasoning none에서는 도구 호출이 지원되지 않는다고 적었다. 두 문서가 공통으로 권하는 것은 하나다. 추론과 도구를 함께 쓸 계획이면 Responses API로 옮기라는 것이다.

업그레이드 가이드가 제시한 형태: { “model”: “gpt-5.6-luna”, “reasoning_effort”: “none”,
  “tools”: [{ “type”: “function”, “function”: { … } }] }

3. 추론 토큰은 출력 요금으로 나간다

추론 토큰은 API 응답에 보이지 않지만 컨텍스트 창을 차지하고 출력 토큰으로 과금된다. 강도를 올린다는 것은 출력 단가로 청구되는 토큰이 늘어난다는 뜻이다. 강도를 어떻게 잡느냐가 곧 비용을 정한다.

7월 30일 가격 인하로 루나는 80%, 테라는 20% 내렸고 솔은 그대로다. 100만 토큰 기준 공식 단가는 아래와 같다. 원화는 8월 7일 종가 1달러 1,408원을 적용했다.

모델입력캐시된 입력출력
gpt-5.6-sol5달러(약 7,040원)0.5달러(약 704원)30달러(약 4만 2,240원)
gpt-5.6-terra2달러(약 2,816원)0.2달러(약 282원)12달러(약 1만 6,896원)
gpt-5.6-luna0.2달러(약 282원)0.02달러(약 28원)1.2달러(약 1,690원)

출력 단가는 솔이 루나의 25배다. 강도를 한 단계 올릴 때 늘어나는 추론 토큰이 어느 모델에서 청구되는지에 따라 체감 비용이 크게 달라진다. 여기에 붙는 조건이 두 가지 더 있다. 입력이 27만 2,000토큰을 넘으면 그 요청 전체에 입력 2배·출력 1.5배가 적용되고, 캐시 쓰기는 캐시되지 않은 입력의 1.25배로 계산된다.

컨텍스트도 함께 봐야 한다. 오픈AI는 이들 모델을 처음 시험할 때 추론과 출력용으로 최소 2만 5,000토큰을 남겨 두라고 권한다. 컨텍스트나 max_output_tokens에 걸리면 보이는 출력 없이 입력과 추론 토큰 비용만 나갈 수 있다.

4. 모델과 강도는 따로 고른다

공식 문서에는 모델 등급별로 어떤 강도를 쓰라는 지침이 없다. 모델은 역할로, 강도는 과제 난도로 각각 정하라는 것이 문서의 일관된 입장이다. 별칭 gpt-5.6은 솔로 연결되고, 테라는 더 낮은 가격에 강한 성능이 필요할 때, 루나는 효율과 대량 처리가 필요할 때 쓰도록 안내한다.

모델을 바꿀 때는 현재 모델이 맡던 역할과 실효 강도를 첫 비교에서 그대로 보존하라고 권한다. 모델 교체만으로 추론 관련 필드를 새로 추가하거나 요청 스키마를 바꾸거나 테스트를 다시 쓰는 것은 허용된 범위가 아니라는 서술도 있다.

5. Pro 모드는 별도 모델이 아니다

Pro는 gpt-5.6-pro 같은 별도 모델명이 아니라 Responses API의 reasoning.mode 설정이다. 기본값은 standard이고, 더 많은 모델 작업이 필요하면서 지연과 토큰 증가를 감수할 수 있는 과제에 pro를 쓴다. 오픈AI는 별도 Pro 슬러그를 찾거나 만들어 내지 말라고 명시했다.

Pro 모드 설정: reasoning: { mode: “pro”, effort: “high” }

쓸 자리는 좁게 잡는다. 한계적인 품질 개선이 결과를 실질적으로 바꾸고 과제가 그 이득을 볼 만큼 어려울 때, 예를 들어 복잡한 최적화나 고가치 코딩·리뷰, 평가 기준이 분명한 심층 분석이 해당한다. 일상적이거나 지연에 민감하거나 대량 처리인 작업, 그리고 평가에서 의미 있는 이득이 나오지 않는 경우에는 표준 모드를 쓰라고 권한다.

과금은 최종 답변을 만들기까지 수행한 작업을 합산해 해당 모델의 표준 요율로 청구한다. 별도 프리미엄 요율이 아니라 작업량이 늘어 비용이 오르는 구조다. 지원되는 강도 범위는 문서마다 다르게 적혀 있다. 업그레이드 가이드는 Pro가 지원하는 강도가 medium부터라고 했고, 모델 가이드는 해당 모델이 지원하는 강도 전부에서 동작한다고 적었다.

6. 이전 턴 추론을 이어갈지 끊을지

GPT-5.6은 reasoning.context 기본값이 all_turns다. 이전 모델은 current_turn이 기본이었으므로 동작이 바뀌었다. 목표와 가정, 우선순위가 여러 턴에 걸쳐 그대로 유지되면 all_turns가 맞는다.

반대로 이전 추론이 더는 관련이 없거나 낡은 접근에 모델을 묶어 둘 위험이 있으면 current_turn으로 끊는다. 오픈AI는 지속 추론을 항상 켜 두는 최적화로 보지 말라고 적었다. 낡은 추론은 토큰과 지연을 늘린다.

all_turns는 이전 응답 항목에 접근할 수 있을 때만 효과가 있다. previous_response_id를 쓰거나 대화에 응답을 연결하거나 전체 이력을 다시 보내야 한다. 첫 요청에서는 이전 추론이 없으므로 두 설정의 동작이 같다. 실제로 어떤 모드가 적용됐는지는 응답의 reasoning.context 필드에서 확인할 수 있다.

7. 강도를 올리기 전에 점검할 것

결과가 나쁘다고 곧바로 강도를 올리지 말라는 것이 프롬프트 가이드의 요구다. 성공 기준이 빠졌는지, 의존 규칙이나 도구 라우팅 규칙이 없는지, 상태 재생 버그나 검증 루프 누락이 아닌지 먼저 확인하라고 적혀 있다.

프롬프트를 줄이는 쪽이 먼저다. 오픈AI는 내부 코딩 에이전트 평가 표본에서 프롬프트를 간결하게 만들었더니 평가 점수가 약 10~15% 오르면서 총 토큰은 41~66%, 비용은 33~67% 줄었다고 밝혔다.

8. 튜닝은 기준선부터 만든다

바꾸기 전에 현재 강도로 기준선을 만들고, 같은 설정과 한 단계 낮은 설정을 대표 과제에서 비교한다. GPT-5.6은 더 적은 추론 토큰으로 품질을 유지하거나 개선하는 경우가 많아 한 단계 낮추면 지연과 비용이 함께 줄어들 수 있다.

업그레이드 가이드는 비교 조합을 다섯 가지로 제시한다. 기존 모델과 기존 프롬프트, 기존 설정의 조합이 첫 번째다. 두 번째는 GPT-5.6에 같은 프롬프트와 보존한 강도, 세 번째는 같은 조건에 한 단계 낮은 강도, 네 번째는 측정된 실패를 고치는 최소한의 수정, 다섯 번째는 선택 기능을 기준선과 분리해 따로 시험하는 것이다.

측정 항목은 과제 성공률과 지연, 입력·출력·추론·캐시 쓰기 토큰, 성공한 과제당 비용이다. 작동하던 프롬프트 전체를 한 번에 다시 쓰지 말라는 경고도 붙어 있다. 그렇게 하면 동작 변화가 모델에서 온 것인지 추론 설정인지 프롬프트인지 도구 구성인지 구분할 수 없기 때문이다.

정리하면

강도는 답하기 전 사고량을 정하는 값이고, 출력 상세도는 text.verbosity로 따로 잡는다. 두 값을 짝지어 쓰라는 조합표는 공식 문서에 없다. 각각 정하고 나머지 요구사항은 프롬프트에 적으라는 것이 문서가 제시하는 유일한 원칙이다.

참고로 minimal은 추론 가이드의 값 목록에만 등장하고 GPT-5.6 지원 목록에는 없다. GPT-5.6에서 쓸 수 있는 값은 앞서 정리한 여섯 개다.

🔗 오픈AI 추론 가이드: https://developers.openai.com/api/docs/guides/reasoning

🔗 GPT-5.6 모델 가이드: https://developers.openai.com/api/docs/guides/latest-model

🔗 GPT-5.6 솔 프롬프트 가이드: https://developers.openai.com/api/docs/guides/prompt-guidance-gpt-5p6

▶︎ 관련기사: 같은 작업에 토큰 절반만 쓴다…오픈AI가 공개한 GPT-5.6·코덱스 비용 절감 실전 가이드

▶︎ 관련기사: [AI 활용팁] 클로드 오퍼스 5, 프롬프트는 더 쓰지 말고 지워라

▶︎ 관련기사: 오픈AI, GPT-5.6 가격 80% 인하…키미·Qwen 등 중국 모델 압박

자세한 내용은 오픈AI 개발자 문서에서 확인할 수 있다.

이미지 출처: 이디오그램 생성