GPT 6 Astra가 실제로 어디까지 일을 끝낼 수 있는지, 공식 시연과 공개 사례, 평가 원자료를 나눠서 살펴본 영상입니다. 영상 자체도 Codex에서 Astra를 High 추론 설정으로 써서 조사부터 대본, 편집, 검수까지 진행했고, 그때 든 토큰과 비용도 공개했습니다. 새 모델의 발표 자료를 어떻게 읽어야 할지, 내 업무에 맞는지 어떻게 시험할지 궁금한 분께 맞는 내용입니다. 자료 확인 기준일은 2026년 9월 6일입니다.
Astra가 하는 일과 공식 시연
Astra의 핵심은 추론, 코딩, 컴퓨터 조작을 긴 작업 안에서 연결한다는 점입니다. 다만 공식 API 문서상 모델의 출력은 텍스트입니다. 영상을 만들거나 파일을 편집하는 일은 모델이 연결된 도구를 사용해서 수행하는 작업이라는 점을 구분해야 합니다.
영상에서 소개한 사례는 다음과 같습니다.
- 웹사이트 품질 검사: OpenAI 공식 시연에서 사이트 이동, 검색, 주요 상호작용을 체크리스트에 따라 확인합니다. 코드 생성에서 끝나지 않고 사용자가 실제로 만나는 화면까지 확인하는 흐름입니다.
- 주택 모델링: Blender에서 집을 모델링하고 Unreal Engine에서 걸어 다닐 수 있는 장면으로 연결한 공식 시연입니다. 건축 설계의 정확성을 검증한 사례는 아닙니다.
- 게임 프로토타입: 한 제작팀은 회색 블록으로 만든 기본 게임을 테마가 다른 세 가지 프로토타입으로 발전시켰고, 이미지 생성 도구도 함께 썼습니다. 사람의 기획과 도구 연결이 포함된 사례입니다.
- 카트 레이싱 게임: 공식 발표문에 연결된 게임으로, 단테는 공개 사이트를 열고 시작 버튼을 눌러 경주 화면이 뜨는 것까지 확인했습니다.
제품 소개와 평가는 따로 읽어야 한다
멋진 시연을 보면 "내 업무에서도 될까"라는 질문이 생깁니다. 영상은 먼저 자료의 성격을 나눴습니다. 제품 소개는 무엇을 지향하는지 보여 주고, 평가는 정해진 조건에서 어느 정도 수행했는지 보여 줍니다. 둘을 섞으면 기대치가 과장됩니다.
OpenAI가 공개한 Terminal-Bench 4.0에서는 GPT 5.6 Sol이 37.3%, Astra가 57.9%였습니다. 차이는 분명하지만, 이 숫자를 회사 업무의 자동화율로 읽을 수는 없습니다. 시험 과제와 실제 업무는 다릅니다.
더 흥미로운 자료는 ARC Prize의 ARC-AGI-3입니다. 처음 보는 환경에서 규칙을 파악하고 목표를 달성하는 평가인데, 재단은 Astra를 두 가지 실행 환경으로 시험하고 결과를 분리해 공개했습니다. 둘 다 최대 추론 수준에서 표준 환경은 62.71%, 프로바이더 어댑터 환경은 98.5%였습니다. 표준 환경은 공통 작업대로, 앞서 풀면서 적은 메모를 다음 단계로 가져갑니다. 프로바이더 어댑터는 회사가 맞춤으로 마련한 작업대로, 메모에 더해 추론 상태를 이어 주고 긴 대화의 맥락을 관리하는 장치를 씁니다. 모델이 바뀐 것이 아니라 작업을 이어 가는 환경이 달라진 것이므로, 점수와 함께 환경을 확인해야 합니다. ARC Prize도 이 결과가 범용 인공지능의 완성을 증명한다고 주장하지 않습니다.
OpenAI가 공개한 연구 현장 보고서에는 지난 여섯 달 동안 성공한 4~8시간짜리 작업 중 절반 넘게 사람이 한 번 이상 개입했다는 내용도 있습니다. 이 자료는 코딩 에이전트 전반의 내부 분석이며 Astra만의 결과는 아닙니다. 안전성 자료에서 OpenAI는 Astra의 사이버 능력을 자사 기준 Critical 단계로 분류했고, 보호 장치를 강화했다는 설명과 함께 모델의 추론을 감시하기 어려워진 측면도 공개했습니다.
내 업무로 시험하는 방법
단테는 범위가 분명한 과제 하나로 시작하라고 권합니다. 예를 들어 작은 웹사이트의 검색 기능 점검입니다. 정상 검색, 결과가 없는 검색, 모바일 화면이라는 세 가지 상황을 정하고 재현 절차와 화면 증거를 함께 남기게 합니다.
요청에는 네 가지를 넣습니다.
- 만들 결과물
- 참고할 자료
- 허용한 작업 범위
- 완료를 판단할 기준
"검색을 확인해 달라"보다 "이 세 상황을 확인하고 실패한 경우 재현 방법을 남겨 달라"가 훨씬 구체적입니다. 성능을 보장하는 문구가 아니라 결과를 확인할 수 있게 만드는 방법입니다. 모델 비교도 자기 과제로 하는 편이 좋습니다. 같은 입력과 같은 완료 기준을 주고 몇 개를 제대로 끝냈는지, 사람이 고치는 데 걸린 시간과 비용은 얼마인지 기록합니다. 답이 빨리 나왔는지보다 쓸 수 있는 결과까지 얼마나 걸렸는지가 더 중요한 기준입니다.
이 영상을 만드는 데 든 비용
이 영상(5분 56초 완성본)은 Codex에서 Astra High 설정으로 조사, 대본, 편집, 검수를 진행했습니다. 내레이션은 단테의 목소리를 복제한 ElevenLabs 음성입니다. 처리한 양은 약 2,360만 토큰으로, 대본만이 아니라 여러 차례 읽은 작업 기록과 도구 결과까지 포함한 누적 사용량입니다. 공식 API 일반 처리 요금으로 환산하면 모델 토큰 비용은 약 36달러이고, 재사용된 캐시 입력에는 더 낮은 단가를 적용했습니다. 실제 결제액이나 전체 제작비가 아니며, 음성·이미지 생성과 별도 도구 비용은 제외했습니다.
정리
- Astra의 출력은 텍스트이고, 화면 조작이나 파일 편집은 연결된 도구로 수행합니다.
- 제품 시연은 지향점을, 평가는 조건부 성능을 보여 주므로 따로 읽어야 합니다.
- ARC-AGI-3 점수는 실행 환경에 따라 62.71%와 98.5%로 크게 달랐습니다. 점수와 환경을 함께 봐야 합니다.
- 내 업무에서는 결과물, 참고 자료, 작업 범위, 완료 기준을 명시한 작은 과제로 시험하고 수정 시간과 비용까지 기록합니다.

