코딩 에이전트 · 영상 게시 2026-09-15 · 13분 47초

OpenAI Agents API로 클라우드 에이전트 100개 돌려 보기

OpenAI Agents API와 Cloudflare 컨테이너로 에이전트 세션 100개를 처리한 실험과, VPS·쿠버네티스·서버리스 확장 설계, 실행 비용 계산법을 정리했습니다.

이 영상에서 단테는 OpenAI가 공개 베타로 내놓은 Agents API로 클라우드에서 에이전트 세션 100개를 처리해 보고, 같은 구조를 VPS나 쿠버네티스로 키울 때 무엇을 정해야 하는지, 비용은 어떻게 계산하는지 정리했습니다. 에이전트를 로컬이 아닌 서버에서 돌리고 싶은 개발자나, 여러 작업을 동시에 맡기는 구조를 고민하는 사람에게 맞는 내용입니다.

Agents API는 무엇이 다른가

영상 게시 시점(2026-09-15) 기준으로, OpenAI는 2026년 9월 10일 Agents API를 공개 베타로 출시했습니다. 발표의 핵심은 Codex의 하네스로 클라우드 에이전트를 만들고 실행한다는 것입니다. 모델에 질문 한 번을 보내고 끝나는 것이 아니라, 도구를 쓰고 작업을 이어 가는 실행 과정을 OpenAI가 운영해 줍니다.

단테는 기존 방식과의 차이를 정확히 구분합니다. 함수 호출로 직접 연동하면 모델이 요청한 도구를 우리 앱이 실행하고 결과를 돌려보내는 과정을 반복해야 합니다. Responses API에도 내장 도구와 대화 상태 기능이 있었고, Agents SDK도 도구 실행 루프와 세션 기능을 제공했습니다. 다만 SDK를 실행하는 프로세스와 배포 환경은 우리가 운영해야 했습니다. 새 API에서는 세션을 만들 때 모델과 도구 실행 환경을 지정하면, 하네스의 실행과 맥락 관리를 서비스가 맡습니다. 업무 도구와 권한, 결과를 판단할 기준을 준비하는 일은 여전히 우리 몫입니다. 즉 차이는 에이전트가 처음 가능해졌다는 것이 아니라, 실행 기반을 어디까지 직접 운영하느냐에 있습니다.

실행 컴퓨터는 OpenAI가 관리하는 샌드박스를 쓰거나, 자체 인프라나 외부 제공사의 환경을 연결할 수 있습니다. 여기서 클라우드로 옮기는 것은 모델이 아니라 코드를 읽고 명령을 실행하고 테스트를 돌리는 작업 환경입니다.

실험 구성: Cloudflare 위의 대기열과 컨테이너

단테는 Cloudflare 실행 환경을 연결했습니다. Worker가 웹 화면과 요청을 받고, Durable Object가 대기열과 상태를 관리합니다. 작업마다 Agents API 세션을 만들고, 실제 명령은 Node.js, Git, 셸 도구를 넣은 컨테이너 안에서 실행했습니다. 브라우저 요청을 먼저 대기열에 저장하므로 바로 실행할 자리가 없어도 작업이 기록으로 남습니다.

연결 확인은 작은 작업으로 했습니다. 1부터 100까지 제곱해 더한 결과를 파일로 만들게 하되, 답을 그대로 적지 말고 명령어로 직접 계산하게 했습니다. 결과 파일을 내려받아 값을 따로 검증했고, 같은 대화에 후속 요청을 보내는 것까지 확인했습니다.

그다음 서로 다른 세션 100개에 작업을 맡기고, 결과 파일 100개의 계산값과 파일 해시를 확인했습니다. 조건이 중요합니다. 100개를 한꺼번에 실행한 것이 아니라 동시 실행 자리는 세 개로 제한했고, 나머지는 대기열에서 차례를 기다렸으며, 두 작업은 재시도했습니다. 확인한 것은 여러 세션을 만들고 처리하고 결과를 모으는 흐름이지, 무거운 개발 프로젝트 100개의 동시 성능은 아닙니다. 또한 컨테이너를 정리해도 결과가 남도록 작업 기록과 산출물을 실행 환경 밖에 보관했습니다.

확장 설계: VPS, 쿠버네티스, 서버리스

영상은 실제 배포와 별개로 확장 설계안도 설명합니다.

  • VPS: 서버 한 대 안의 대기열이 작업을 컨테이너에 나눠 주고, 기록은 데이터베이스에, 결과는 영구 저장소에 둡니다. 시작은 쉽지만 컨테이너들이 서버의 CPU와 메모리를 나눠 씁니다.
  • 쿠버네티스: 대기열이 쌓이면 작업용 파드를 늘리고, 노드에 자리가 없으면 별도로 설정한 노드 자동 확장이 서버를 추가합니다. 파드를 늘리는 것과 컴퓨터를 늘리는 것은 두 단계이며, 중복 실행 방지, 재시작 지점, 최대 실행 수, 예산 한도는 앱이 설계해야 합니다.
  • 서버리스: 필요할 때 실행 환경을 만들고 일이 없으면 쉬게 합니다. 예를 들어 작업 후 5분간 요청이 없으면 스레드의 실행 환경을 휴면시키는 식인데, 에이전트가 일하는 중에는 마지막 메시지 시각만 보고 끄면 안 됩니다. 컨테이너가 잠들어도 기본 요금과 저장소 비용은 남고, 다시 깨어나는 대기 시간도 고려해야 합니다.

단테는 이와 별도로 로컬에서 작업장 UI도 시험하고 있습니다. 저장소 등록, 독립 작업 폴더, 대화·파일 수정·변경 확인 화면에 실행 규칙(하네스)을 붙였습니다. 조사와 리뷰는 읽기 전용, 구현은 파일 수정이 가능하며, 에이전트가 끝났다고 답하면 앱이 지정된 검사 명령을 별도로 실행합니다. 다만 이것으로 코드 품질이 얼마나 좋아졌는지는 아직 비교하지 않았다고 밝혔습니다.

비용은 두 갈래로 계산한다

비용은 모델 사용료와 실행 환경 비용을 나눠 봐야 합니다. 이번 클라우드 실험에 쓴 API 키의 최근 7일 사용액은 3.27달러였고, Cloudflare 비용은 빠져 있습니다.

실행 환경 쪽은 작업당 4 vCPU 구성 기준으로, 같은 크기를 100개 동시에 띄우면 400 vCPU와 약 1.2TiB 메모리가 필요합니다. 단테의 추정으로는 컨테이너 한 개를 한 시간 켜 두면 CPU 사용률에 따라 약 0.190.40달러이고, 100개를 하루 8시간씩 22일 켜 두면 월 약 3,3007,100달러까지 커집니다. 반면 하루 100건을 20분씩 실행하고 바로 정리하면 월 수백 달러 수준으로 줄어듭니다. 모두 컨테이너 비용만 계산한 추정치이며, 기본 요금, 저장소, 네트워크, 모델 비용과 세금은 따로 더해야 합니다.

결론적으로 스레드 100개를 보관하는 것과 컴퓨터 100개를 동시에 켜는 것은 비용이 전혀 다릅니다. 단테는 스레드는 많이 보관하되 동시 실행 자리는 적게 두고 사용량을 측정하는 편을 권합니다. 짧게 쓰고 쉬는 패턴에는 서버리스가, 하루 종일 꾸준히 돌린다면 고정 VPS나 예약 자원이 맞을 수 있습니다. Cursor가 공개한 사례에서도 클라우드 결과가 나빠진 원인이 모델이 아니라 빠진 개발 환경인 경우가 있었고, 끊긴 실행을 이어 가는 복구 구조를 따로 만들었다고 합니다.

정리

  • Agents API의 차이는 에이전트 실행 기반(하네스, 맥락 관리)을 OpenAI가 운영해 준다는 점입니다.
  • 클라우드로 옮기는 것은 모델이 아니라 명령을 실행하는 작업 환경이며, 기록과 결과는 그 밖에 따로 보관해야 합니다.
  • 이번 실험은 세션 100개를 동시 실행 3개로 처리한 흐름 검증이며, 대규모 동시 성능 시험은 아닙니다.
  • 확장할 때는 동시 실행 수, 시간 제한, 재시도 횟수, 예산 한도를 앱이 먼저 정해야 합니다.
  • 비용은 모델 사용료와 실행 환경 비용으로 나누고, 실제로 켜 둔 시간을 기준으로 계산합니다.

영상: 유튜브에서 보기 · 정정 요청: dante@quokkalabs.net