OpenAI가 GPT-6 세대의 Sol과 Luna를 내놓으면서, GPT-5.6 Sol·Luna와 비교해 API 단가와 실제 작업 결과가 얼마나 달라졌는지 공식 가격표와 공개된 사례로 확인한 영상입니다. 모델 교체를 검토하는 개발자나, 새 모델의 비용 주장을 어떻게 읽어야 할지 궁금한 분께 도움이 됩니다. 아래 가격은 영상 게시 시점(2026-09-23)에 확인한 API Standard, short context 기준입니다.
공식 가격표로 본 단가 변화
영상은 OpenAI 개발자 문서의 API 가격표(https://developers.openai.com/api/docs/pricing)부터 확인합니다. 단위는 텍스트 100만 토큰당 달러입니다. GPT-5.6 Sol은 정가가 아니라 당시 프로모션 단가와 비교했다는 점을 먼저 짚고 넘어갑니다.
Sol은 모든 항목이 절반으로 내려갔습니다.
- 입력: 4달러 → 2달러
- 캐시 입력: 40센트 → 20센트
- 캐시 쓰기: 5달러 → 2.5달러
- 출력: 20달러 → 10달러
Luna도 입력이 20센트에서 10센트로, 캐시 입력이 2센트에서 1센트로, 캐시 쓰기가 25센트에서 12.5센트로 내려갔습니다. 출력은 1.2달러에서 50센트로, 영상에서는 약 58.3% 인하라고 계산했습니다.
같은 토큰 수로 단순 계산도 해 봤습니다. 캐시 없는 입력 100만 토큰과 출력 10만 토큰을 가정하면 Sol은 6달러에서 3달러로, Luna는 32센트에서 15센트로 줄어듭니다. 단테는 이 계산이 어디까지나 단가 예시라는 점을 강조했습니다. 실제 작업에서는 토큰 수와 도구 호출 횟수가 다르고, 재시도나 재작업 비용도 포함되지 않습니다.
공개된 작업 사례 세 가지
단가가 내려가도 작업을 끝내는 데 토큰을 더 쓰면 소용이 없으니, 영상은 실제 작업 결과를 보여 주는 공개 자료를 차례로 살핍니다.
첫 번째는 Peter Gostev가 X에 올린 개인 테스트입니다. GPT-5.6 Sol과 GPT-6 Sol에 같은 3D 풍선 웹사이트 과제를 주었고, GPT-6 쪽이 토큰을 절반만 썼다고 주장했습니다. 단테는 이것이 한 사람의 테스트 결과라는 점을 분명히 했습니다.
두 번째는 Cognition이 공개한 Devin 코딩 에이전트 평가입니다. 자체 벤치마크인 Frontier Code 1.1 기준으로 GPT-6 Sol은 GPT-5.6 Sol과 점수가 같았고 과제 비용은 61% 낮았다고 합니다. Luna는 GPT-5.6 Luna보다 점수가 높았고 비용은 약 4분의 1이었다고 밝혔습니다. 이 시험은 오픈소스 저장소의 실제 풀 리퀘스트로 과제를 만들고 리뷰 기준에 맞춰 결과를 판정하지만, 시험을 만든 곳도 Cognition이라는 점은 감안해야 합니다.
세 번째는 독립 평가사 Artificial Analysis의 비용 분석입니다. Intelligence Index를 돌리는 데 드는 비용이 Sol은 1.99달러에서 1.06달러로 내려갔고, Luna도 줄었습니다. 반면 Coding Agent Index에서 Sol 점수는 55에서 57로 올랐지만 Luna는 43에서 41로 내려갔습니다. 다른 일부 평가에서도 후퇴한 항목이 있어, 모든 과제가 나아진 것은 아니라는 것이 영상의 결론입니다.
OpenAI가 고른 Bento 사례를 읽는 법
OpenAI 발표 글(https://openai.com/index/introducing-gpt-6-sol-and-luna/)에는 Bento 웹사이트 요청에 대한 두 모델의 응답이 실려 있습니다. 같은 요청에 GPT-5.6 Sol은 구현 방향을 설명하고 네 페이지를 다시 만들겠다고 답했고, GPT-6 Sol은 여기에 데스크톱, 모바일, 브라우저 뒤로 가기처럼 무엇을 확인할지 범위를 덧붙였습니다.
다만 이것은 OpenAI가 골라 공개한 응답입니다. 같은 코드에서 두 모델을 재실행한 블라인드 실험이 아니고, 단테가 직접 두 모델을 독립적으로 돌려 본 결과도 아닙니다. 영상은 이런 출처별 성격 차이를 화면마다 구분해서 표시했습니다.
내 작업에서 비교하는 방법
영상의 마지막 부분은 공개 자료 대신 각자 자기 작업으로 확인하는 방법을 제안합니다.
- 같은 저장소, 같은 프롬프트, 같은 도구 설정, 같은 테스트로 조건을 맞춥니다.
- 조건을 맞춘 상태에서 각 모델을 세 번 이상 실행합니다.
- 사용한 토큰, 완성된 기능, 테스트 통과 여부, 실패, 재작업에 든 시간을 기록합니다.
- 토큰 단가가 아니라, 끝낸 작업 하나에 들어간 총비용으로 비교합니다.
단가표의 절반 인하는 분명한 변화지만, 실제 비용은 모델이 그 작업에 토큰을 얼마나 쓰는지와 몇 번 다시 시켜야 하는지에 따라 달라집니다. 벤치마크 수치도 누가 만든 시험인지, 공개 사례는 누가 골랐는지를 함께 봐야 합니다.
정리
- 영상 게시 시점 기준으로 GPT-6 Sol의 API 단가는 GPT-5.6 Sol 프로모션 단가의 절반이며, Luna도 전 항목이 내려갔습니다.
- 입력 100만·출력 10만 토큰 예시에서 Sol은 6달러에서 3달러, Luna는 32센트에서 15센트입니다. 도구 호출과 재작업 비용은 빠진 계산입니다.
- Cognition 평가에서 Sol은 같은 점수에 비용 61% 절감, Luna는 더 높은 점수에 약 4분의 1 비용이라고 했지만 자체 벤치마크입니다.
- Artificial Analysis 기준으로 Luna의 코딩 에이전트 점수는 오히려 내려가는 등 모든 항목이 개선된 것은 아닙니다.
- 모델 교체 판단은 같은 조건에서 여러 번 실행해 완료된 작업당 총비용으로 하는 것이 정확합니다.

