모델 비교 · 영상 게시 2026-03-08 · 12분 35초

GPT 5.4 핵심 변화와 Codex Playwright 스킬로 3D 체스 앱 만들기

GPT 5.4의 추론 계획 공개, 100만 토큰 컨텍스트, GDPval 평가를 짚고, Codex 앱에서 Playwright 스킬로 3D 체스 앱을 만들며 AGENTS.md 작성법을 정리합니다.

이 영상에서 단테는 GPT 5.4가 이전 모델과 비교해 무엇이 달라졌는지 짚고, Codex 앱에서 GPT 5.4와 Playwright 스킬로 3D 체스 Electron 앱을 만들게 하는 과정을 보여 줍니다. 아울러 OpenAI의 프롬프트 가이드를 바탕으로 AGENTS.md와 사용자 프롬프트에 각각 무엇을 써야 하는지도 정리합니다. 내용은 영상 게시 시점(2026-03-08) 기준입니다.

GPT 5.4에서 달라진 점

단테는 코딩 능력만 보면 GPT 5.4가 GPT 5.3 Codex와 크게 다르지 않다고 봅니다. GPT 5.4는 코딩 역량을 갖춘 GPT 5.3 Codex를 기반으로 조금 나아진 모델이라, 코드 작성 능력이 비약적으로 발전한 것은 아니라는 평가입니다. 대신 눈에 띄는 변화로 다음을 꼽았습니다.

  • 응답 전에 추론 계획을 먼저 보여 줍니다. 사용자는 이 과정을 보면서 추가 프롬프트로 방향을 조정할 수 있고, 모델은 최종 답을 내기 전에 그 지시를 반영합니다.
  • 100만 토큰 컨텍스트를 지원합니다. 에이전트가 한 세션 안에서 더 많은 내용을 붙잡고 일할 수 있습니다.
  • OpenAI 모델 가운데 처음으로 컴퓨터 사용 기능을 기본 제공한다고 소개됐습니다. Playwright 같은 라이브러리로 코드 작성 중간에 스스로 테스트를 돌리고, 스크린샷을 보며 마우스·키보드 명령을 수행하는 능력이 강조됐습니다.
  • MCP나 스킬을 쓸 때 작업 완료까지의 지연 시간이 줄었다고 설명했습니다.

또 Codex 앱이 macOS뿐 아니라 Windows에서도 쓸 수 있게 공개돼, CLI가 익숙하지 않아도 GUI로 Codex를 쓸 수 있게 됐다는 점도 언급했습니다.

GDPval이 측정하는 것

성능 이야기에서 단테는 GDPval이라는 평가 방식을 소개했습니다. 일반 추론과 전문 지식 기반 업무에서 모델의 진전을 측정하는 평가로, 영상에 따르면 2025년 9월 25일에 나왔습니다. 미국 GDP에 5% 이상 기여하는 아홉 개 산업에서 44개 직업을 골라, 숙련 전문가의 실제 업무 결과물과 모델 결과물을 비교합니다. 대상 직업에는 소프트웨어 개발자뿐 아니라 변호사, 회계사와 감사관, 약사, 프로듀서와 감독, 오디오·비디오 기술자 등이 포함되고, 데이터셋 구축에는 평균 14년 경력의 전문가가 참여했다고 설명했습니다.

기존에는 GPT 5.2가 Opus 4.5나 Gemini 3 Pro와 비교해 이 평가에서 가장 높은 점수를 받았는데, GPT 5.4와 GPT 5.4 Pro가 그보다 높은 점수를 얻었다는 것이 영상의 요지입니다. 단테는 이를 근거로 GPT 5.4가 코딩뿐 아니라 스프레드시트, 프레젠테이션, 문서 생성·편집 같은 범용 업무 능력을 많이 개선한 모델이라고 정리했습니다.

Codex 앱에서 3D 체스 앱 만들기

실습은 Codex 앱에서 GPT 5.4, 추론 수준 Extra High로 진행했습니다. 컴퓨터 사용 기능을 활용하려면 먼저 스킬을 설치해야 합니다. 좌측 상단의 Skills 메뉴에 들어가면 Codex가 기본 제공하는 스킬을 검색할 수 있고, Playwright로 검색하면 브라우저와 Electron 앱 QA에 쓰는 playwright-interactive 스킬이 나옵니다. 플러스 버튼으로 설치합니다. Codex 기본 스킬은 OpenAI의 skills 저장소에서도 확인할 수 있으며, 단테는 이 스킬이 GPT 5.4 출시 시기에 맞춰 공개된 것으로 소개했습니다.

스레드에서 playwright-interactive 스킬을 선택한 뒤 보낸 요청의 요지는 다음과 같습니다.

  • 클릭으로 말을 움직이는 3D 체스 게임을 Electron 앱으로 만들고 테스트할 것
  • 대리석과 유리로 체스판을 아름답게 디자인하고 현실적인 조명 효과를 넣을 것
  • 게임의 기본 규칙과 프로젝트를 생성할 경로를 명시

실행하자 Codex는 playwright-interactive 스킬을 읽어 들였고, 단테가 미리 설치해 둔 frontend-design 스킬도 함께 사용했습니다. 추론 수준을 높게 잡았기 때문에 오래 걸리더라도 알림이 올 때까지 기다리면 된다고 했습니다.

작업 중에 Codex는 자동 테스트를 돌리고, 테스트가 정상적으로 끝나지 않으면 Electron을 디버그 모드로 띄워 어느 부분이 동작하지 않는지 확인했습니다. Playwright로 화면을 보기 때문에 레이아웃이 과하게 확대됐다거나 디자인이 어색한 부분을 짚었고, 카메라 시점까지 고려하며 실제로 체스를 두어 보는 모습도 나왔습니다. 완성된 앱은 한국어 UI가 적용돼 있었고, 대리석 질감과 그림자, 조명 효과가 요청대로 들어가 있었습니다.

프롬프트 가이드: AGENTS.md와 사용자 프롬프트 나누기

작업을 기다리는 동안 단테는 OpenAI의 GPT 5.4 프롬프트 가이드에서 필요한 부분을 짚었습니다. 기존 GPT를 Codex에서 쓸 때와 크게 다르지 않지만, 역할 구분이 분명합니다.

AGENTS.md에는 반복해서 참조할 저장소 규칙을 넣습니다. 공식 예시도 사용할 패키지 관리자(npm 또는 pnpm), 새 의존성을 추가하기 전에 확인할 사항, 문서 업데이트 규칙 같은 것을 넣도록 안내합니다. 예를 들어 "패키지 관리자는 pnpm을 쓴다", "코드가 바뀌면 lint를 돌린다", "docs 디렉터리의 문서를 갱신한다"처럼 작업 종류와 관계없이 항상 지켜야 할 것들입니다. 반대로 오늘의 버그 설명, 이번에만 필요한 출력 형식, 특정 티켓의 완료 조건 같은 일회성 내용은 넣지 않는 것이 좋습니다.

읽는 순서도 설명했습니다. 홈 디렉터리의 .codex 아래 AGENTS.md가 전역 범위이고, 같은 위치에 AGENTS.override.md가 있으면 AGENTS.md 대신 그것을 읽습니다. 이후 저장소 루트에서 하위 디렉터리로 내려가며 AGENTS.md를 찾아 하나로 합칩니다.

사용자 프롬프트에는 이번 작업만의 목표와 완료 조건을 함께 씁니다. 체스 예제에서는 "Electron 앱을 만들고 테스트하라"가 목표였고, "체크메이트로 게임을 끝낼 수 있는지 테스트하라"가 완료 조건이었습니다. 결과물이 무엇인지 분명히 말해 줄수록 성능이 좋아진다는 것이 가이드의 설명입니다. 구현 대신 계획만 원한다면 "이번 턴에는 계획만 세우고 구현하지 말라"처럼 범위를 그 턴으로 좁혀 주는 것이 도움이 됩니다.

정리

  • 영상 게시 시점 기준, GPT 5.4의 코딩 능력은 GPT 5.3 Codex와 큰 차이가 없지만 추론 계획 공개와 중간 방향 조정, 100만 토큰 컨텍스트가 두드러진 변화입니다.
  • GDPval은 아홉 개 산업 44개 직업의 전문가 결과물과 비교하는 평가이며, GPT 5.4는 범용 업무 능력이 개선된 모델로 소개됐습니다.
  • Codex 앱에서 playwright-interactive 스킬을 설치하면 GPT 5.4가 Electron 앱을 직접 실행하고 테스트하며 고칩니다.
  • AGENTS.md에는 매번 지켜야 할 저장소 규칙만, 사용자 프롬프트에는 이번 작업의 목표와 완료 조건을 씁니다.
  • 계획만 필요하면 범위를 이번 턴으로 좁혀 명시하는 것이 좋습니다.

영상: 유튜브에서 보기 · 정정 요청: dante@quokkalabs.net