이 영상에서 단테는 Astra를 쓸 때 추론 수준을 무조건 가장 높게 두는 습관을 점검하고, 추론 수준, 캐시, 모델 분업이 비용에 각각 어떻게 영향을 주는지 나눠 설명합니다. 그리고 Astra가 계획과 리뷰를, Luna가 구현을 맡는 분업 도구 astra-orchestrator를 직접 만들어 Astra 단독 실행과 비교했습니다. Codex에서 Astra를 쓰며 비용을 줄이고 싶은 분께 맞는 내용입니다.
추론 수준은 모델 간 공통 등급이 아니다
출발점은 티보(Tibo)가 직접 남긴 게시물입니다. Sol에서 높은 추론 수준으로 만족했다면 Astra에서는 low나 medium으로 낮춰 보라는 권고였습니다. 여기서 비교 대상은 Astra low와 Sol high이며, Astra low가 Astra high보다 항상 똑똑하다는 뜻은 아닙니다. 게시물에는 모든 작업에 적용할 성능 수치나 절약률도 나오지 않습니다.
추론 수준은 시험 점수처럼 모델을 가로질러 비교하는 등급이 아니라, 그 모델이 문제를 생각하는 데 자원을 얼마나 쓰게 할지 조정하는 설정에 가깝습니다. 그래서 이전 모델의 high를 새 모델에서도 high로 옮길 필요는 없습니다. 함수 하나를 고치거나 조건이 명확한 화면을 만들 때는 낮은 설정부터 확인해 볼 만하고, 요구 사항이 충돌하거나 설계의 실패 가능성을 따져야 할 때는 깊은 추론이 도움이 될 수 있습니다. 판단 기준은 답변 길이가 아니라 테스트 통과 여부, 사람이 고친 양, 다시 시킨 비용까지 합친 결과입니다.
캐시는 따로 봐야 한다
추론 수준을 낮추는 것은 생각하는 양을 조절하는 일이고, 캐시는 이미 읽은 앞부분을 다시 처리하는 일을 줄이는 것입니다. 모델의 입력에는 방금 친 질문뿐 아니라 작업 지침, 도구 설명, 앞선 대화와 도구 결과가 모두 들어갑니다. 캐시는 이렇게 조립된 입력의 앞부분이 일치해야 재사용되므로, 앞쪽 지침이나 도구 구성을 바꾸면 그 뒤의 일치가 깨질 수 있습니다.
영상 게시 시점(2026-09-07) 기준 Astra의 일반 API 단가는 100만 토큰당 입력 10달러, 캐시 읽기 1달러, 처음 캐시에 쓰는 입력 12.5달러, 출력 50달러입니다. 단테가 만든 계산기로 입력 10만 토큰, 출력 2,000토큰을 가정하면 다음과 같습니다.
- 캐시 없이 일반 처리: 1.1달러
- 입력 중 8만 토큰을 캐시에서 읽음: 0.38달러
- 입력 10만 토큰을 처음 전부 캐시에 씀: 1.35달러
캐시 적중률이 높다는 말만 보고 무조건 싸다고 판단하면 안 되고, 처음 저장 비용, 실제 재사용 횟수, 출력 비용을 함께 봐야 합니다.
같은 대화에서 추론 수준을 바꾸자 캐시가 사라졌다는 커뮤니티 제보와 GitHub 이슈도 있습니다. 다만 특정 버전과 경로에서 나온 제보라 모든 사용자에게 똑같이 생긴다고 단정할 수는 없습니다. 공식 문서는 요청 맨 앞의 추론 설정은 유지하고 대화 중간에 설정 변경 항목(configuration update)을 추가하는 방식을 안내하지만, 앱의 설정 버튼이 이 경로를 쓰는지는 따로 확인해야 합니다. 단테는 작업을 시작할 때 적절한 설정을 고르고, 중간에 바꿨다면 실제 캐시 입력 기록을 확인하라고 권합니다.
Luna와 역할 분담
Luna의 80% 가격 인하는 실제 공식 발표에 나오지만 발표일은 7월 30일이었고, Astra와 함께 쓴다고 추가 할인되는 것도 아닙니다. 9월 7일 기준 단가는 입력이 Astra 10달러, Luna 0.2달러, 출력이 Astra 50달러, Luna 1.2달러입니다. 총 토큰을 줄이는 것만이 비용 절약 방법은 아니고, 어떤 모델이 어떤 일을 맡는지도 중요하다는 뜻입니다.
여기서 오케스트레이터가 등장합니다. 일 순서를 정하고, 맡길 일을 나누고, 결과를 확인하는 담당자입니다. Astra는 무엇을 만들지와 파일 간 약속을 정하고, Luna는 범위가 명확해진 구현을 맡고, 마지막에 테스트를 돌린 뒤 새 시각의 Astra가 결과를 검토합니다.
astra-orchestrator로 기능 추가하기
단테가 공개한 astra-orchestrator(https://github.com/dante01yoon/astra-orchestrator)는 Luna에게 맡기라고 지시만 하는 데서 끝나지 않고, 어떤 파일을 맡겼는지 코드로 검사합니다. 결과는 후보 폴더에 모으고, 테스트와 리뷰를 통과한 뒤에 적용합니다. 원본 저장소를 바로 덮어쓰지 않습니다.
Codex 대화 안에서 쓰는 스킬도 같은 저장소에 있습니다. 저장소를 받아 설치 명령의 프로젝트 경로만 바꾸면 스킬과 역할 설정이 들어가고, 기존 Codex 설정은 덮어쓰지 않습니다. 단테는 Astra low로 시작해 계산기에 CSV 저장 기능을 추가해 달라고 요청하면서, Luna 한 명에게 구현을 맡기고 테스트 후 별도 Astra 리뷰까지 진행하라고 적었습니다.
Astra는 Luna에게 버튼이 들어갈 화면, 저장할 내용을 만드는 함수, 그 함수의 테스트 세 파일만 맡겼고 기존 계산 코드와 테스트는 보존했습니다. 중요한 것은 작업자를 많이 띄우는 것이 아니라 무엇을 바꿔도 되는지 좁혀 주는 것입니다. 중간에 일반 입력, 캐시 읽기, 캐시 쓰기 비용도 각각 저장하도록 보강했고, 약 6분이 걸렸습니다. Astra가 테스트 14개를 직접 실행하고 기존 파일이 바뀌지 않았는지 확인한 뒤, 새 Astra 리뷰어가 승인했습니다. 브라우저에서는 내려받은 CSV 내용까지 확인했고, 캐시 입력을 전체 입력보다 크게 넣으면 오류가 나고 파일이 생기지 않는 것도 확인했습니다.
분업과 단독 실행 비교
명령줄 실행기로는 계산 모듈과 웹 화면을 나눈 예제를 돌렸습니다. Codex exec를 호출하면서 모델과 추론 수준을 명시하고, 모델이 돌려준 구조화된 결과가 허용된 경로인지 실행기가 확인한 뒤 저장합니다. Astra low가 계획을 만들고 Luna medium 두 개가 각각 계산 모듈과 화면을 작성했으며, 테스트 11개를 모두 통과한 뒤 Astra low 리뷰가 승인했습니다.
같은 계약과 테스트를 Astra 단독 구현에도 적용했습니다. 두 방식 모두 테스트와 브라우저 핵심 동작을 통과했습니다. 총 처리 토큰은 분업 약 84,700개, 단독 약 48,200개로 분업이 약 76% 많았지만, API 요금으로 환산하면 분업 약 0.52달러, 단독 약 0.67달러로 분업이 약 22.5% 낮았습니다. 토큰 단가가 다르기 때문이며, 분업 쪽 비용의 대부분은 Astra의 계획과 리뷰가 차지했습니다. 이번 기록은 캐시 최적화를 증명하지 않습니다.
이 수치를 모든 프로젝트의 절약률로 가져가면 안 됩니다. 작은 계산기를 한 번씩 실행한 결과이고, 캐시 상태와 실행 순서도 통제하지 않았습니다. 앞선 두 번의 시험은 계획 형식과 출력 스키마 문제로 중단됐고 그 비용이 약 0.45달러였습니다. 실패까지 더하면 분업 쪽은 약 0.97달러입니다.
정리
- 이전 모델에서 high를 썼다는 이유만으로 Astra도 high로 시작할 필요는 없습니다. 테스트 통과와 재작업 비용으로 판단해야 합니다.
- 캐시는 입력 앞부분이 일치해야 재사용되며, 처음 쓰는 비용과 실제 재사용 횟수를 함께 봐야 합니다.
- 범위가 명확한 구현을 저렴한 Luna에게 맡기면 토큰은 늘어도 비용은 줄 수 있습니다. 이번 사례에서는 토큰 76% 증가, 비용 22.5% 감소였습니다.
- 분업의 핵심은 작업자 수가 아니라 맡길 파일 범위를 좁히고 테스트와 리뷰로 확인하는 구조입니다.
- 실패 비용까지 기록해야 실제 비용을 판단할 수 있습니다.

