코딩 에이전트 · 영상 게시 2026-09-10 · 8분 06초

Codex에서 Astra로 바꿀 때 작업 지침을 점검해야 하는 이유

같은 단축키 안내 작업을 Sol, 기존 지침의 Astra, 지침을 정리한 Astra에 맡겨 OpenAI 공식 가이드의 권고가 실제 결과에 어떤 차이를 만드는지 비교합니다.

Codex에서 모델을 Astra로 바꿀 때 예전에 써 둔 작업 지침도 고쳐야 하는지, OpenAI 공식 사용 가이드의 권고를 실제 작업에 적용해 비교한 영상입니다. 같은 작은 기능 추가를 Sol, 기존 지침의 Astra, 지침을 정리한 Astra에 각각 맡겨 결과를 기록했습니다. AGENTS.md나 스킬 파일을 쌓아 두고 쓰는 Codex 사용자에게 특히 도움이 됩니다.

실험 설계: 실행 설정과 작업 지침을 구분하기

공식 문서에서 Astra의 행동을 설명하는 부분에는 모델이 읽는 스킬과 다른 지침 파일을 점검하라는 권고가 있습니다. 단테는 새 모델을 고르는 일과 예전에 적어 둔 작업 지침을 점검하는 일이 별개라고 강조했습니다. 모델 이름과 추론 강도는 실행 설정이고, "먼저 계획을 보여 달라", "수정 전에 승인을 받아라" 같은 문장은 작업 지침입니다. 이번 비교에서는 추론 강도를 모두 medium으로 맞추고, 세 번째 실행에만 작업 지침을 추가했습니다.

비교에 쓴 앱은 단테가 만드는 영상 편집기 HyperCut입니다. 사용 방법 창에는 네 단계 안내만 있고 단축키 표가 없었습니다. 키보드 동작은 이미 구현돼 있으니, 그 코드를 읽고 안내를 추가하는 작은 작업입니다. 실제 키보드 처리 코드에서 오른쪽 화살표는 5초 앞으로, 왼쪽은 5초 뒤로 이동하고, 저장과 열기는 Cmd 또는 Ctrl 키를 쓰며, 선택한 컷은 복원하거나 삭제할 수 있습니다. 안내 문구가 이 코드와 맞는지가 검증 기준이었습니다.

요청은 세 번 모두 같았습니다. 브레인스토밍 스킬을 사용하고, Mac과 Windows의 키 조합을 구분해 보여 달라고 했습니다. 소스도 같은 상태에서 시작했고, 평소 계정 설정을 모두 복제한 것은 아니지만 조건을 맞춘 분리된 폴더에서 실행했습니다. 스킬은 실험용으로 새로 만든 것이 아니라 실제로 설치돼 있던 파일을 복사했습니다. 이 스킬에는 설계를 제시하고 사용자가 승인하기 전에는 구현하지 말라는 하드 게이트가 있습니다. 설계 검토가 필요한 작업에는 의미 있는 규칙이지만, 이미 있는 동작을 안내문으로 적는 좁은 변경에도 같은 승인 단계를 적용할지는 따져 볼 문제입니다. 특정 스킬을 명시적으로 쓴 사례이므로 Codex 기본 동작 전체를 시험한 것은 아니라는 점도 밝혔습니다.

세 실행의 결과

Sol은 코드를 살펴본 뒤 시각 자료를 브라우저로 보여 줘도 되는지 묻고 작업을 끝냈습니다. 소스 변경은 없었습니다. 질문에 답하면 이어갈 수 있었겠지만 첫 요청의 결과를 그대로 기록했습니다.

지침을 추가하지 않은 Astra는 같은 스킬을 읽고도 운영체제별 비교표로 만들겠다고 설명한 뒤 구현을 진행했습니다. 기존 지침을 그대로 두면 Astra가 반드시 멈춘다는 가정은 이번 실행에서는 맞지 않았습니다.

세 번째 폴더에는 공식 문서의 instruction following 부분을 반영한 지침을 넣었습니다. 문서는 사용자 요청과 스킬 지침의 우선순위를 명확히 하고, 멈췄다면 어떤 파일의 어떤 문장 때문인지 설명하게 하라고 권합니다. 그래서 작은 안내 화면 수정은 요청 범위 안에서 판단해 진행하고, 멈춰야 한다면 근거를 밝히도록 적었습니다. 승인 절차 전체를 없앤 것이 아니라, 이번 변경의 범위와 결과를 검토할 수 있는 상태까지 진행하라는 의도를 적은 것입니다. 이 Astra는 추가 승인 없이 진행하는 이유를 직접 밝혔고, 실제 출력에 에이전트 파일 지침에 따라 이 범위의 화면 변경을 진행한다는 문장이 나왔습니다.

검증과 한계

결과물에는 동작, Mac, Windows/Linux 열이 나란히 표시됐고, 재생과 이동뿐 아니라 실행 취소와 다시 실행, 입력 중이거나 대화 상자가 열려 있을 때의 제한까지 설명했습니다. 단테는 샘플 영상을 넣고 오른쪽 화살표로 5초 이동했다가 돌아오는 것, 스페이스로 재생과 정지하는 것을 따로 확인했고, 원래 키보드 코드와 수정 후 코드를 비교해 안내 작업이 실제 동작을 바꾸지 않았는지도 봤습니다.

중요한 제한도 있습니다. 두 Astra 실행 모두 환경의 권한 제한 때문에 자체 브라우저 검증은 끝내지 못했다고 보고했고, 화면 확인은 단테가 별도로 한 것입니다. 모델이 완료한 일과 나중에 사람이 확인한 일을 합쳐 모델 혼자 성공했다고 말하면 안 됩니다. 좁은 모바일 화면에서는 대화 상자가 화면 밖으로 넘치는 문제가 남았는데, 원래 앱에도 있던 문제이고 두 Astra 결과 모두 해결하지 못했습니다. 실행 시간은 기존 지침 약 154초, 지침 추가 약 122초였지만 한 번씩 실행한 작은 사례라 일반적인 속도나 비용 절감률로 주장하지 않았습니다.

API 사용자가 확인할 설정

공식 마이그레이션 안내에 따르면 기존 추론 강도를 none이나 minimal로 썼다면 low부터 비교하고, medium이나 high였다면 우선 기존 강도를 유지합니다. temperature, top_p 같은 샘플링 옵션과 지원하지 않는 logprobs 옵션은 정리해야 하고, 도구 호출에는 Responses API가 필요합니다. 이는 직접 만든 연동 코드에서 확인할 내용이며 Codex 앱 사용자가 모두 입력해야 한다는 뜻은 아닙니다. 캐시의 30분은 마지막 쓰기나 재사용 이후의 최소 유지 시간이고 Sol에도 적용되는 방식이므로 Astra에서 새로 생긴 변화로 볼 수 없습니다. 영상 게시 시점(2026-09-10) 가격표 기준 100만 토큰당 Sol은 입력 4달러, 출력 20달러, Astra는 10달러와 50달러로 2.5배입니다. 더 비싼 모델이 재시도를 줄여 전체 작업비가 낮아질 수는 있지만 이번 실행의 청구액을 확인한 것은 아닙니다.

정리

  • 모델 교체와 작업 지침 점검은 별개의 일이며, 공식 가이드도 스킬과 지침 파일을 점검하라고 권합니다.
  • 같은 요청에서 Sol은 질문하고 멈췄고, Astra는 기존 지침으로도 구현했으며, 지침을 정리한 Astra는 진행 근거를 밝혔습니다.
  • 지침 정리는 속도 향상보다 작업 의도와 판단 근거를 분명하게 만드는 방법으로 보는 편이 정확합니다.
  • "매 단계 승인", "모든 수정마다 전체 테스트" 같은 문장이 어떤 작업에 적용되는지 확인하고, 완료 기준을 구체적으로 적습니다.
  • 모델이 실제로 검증한 것과 사람이 나중에 확인한 것은 구분해서 기록해야 합니다.

영상: 유튜브에서 보기 · 정정 요청: dante@quokkalabs.net