이 영상에서 단테는 Codex의 컴퓨터 유즈 기능으로 Blender에서 입체 글자를 만드는 시연을 하고, 공개된 사례와 성능 수치를 짚은 뒤 AI의 조작 과정을 보면서 사람이 프로그램을 배울 수 있는지라는 질문을 던집니다. 컴퓨터 유즈를 업무 대행이 아니라 학습 도구로도 써 보고 싶은 사람에게 맞는 내용입니다.
컴퓨터 유즈의 기본 구조
컴퓨터 유즈는 화면 정보를 읽고 다음 행동을 정한 뒤, 연결된 도구로 클릭이나 키보드 입력을 수행하는 방식입니다. 행동이 끝나면 바뀐 화면을 다시 확인합니다. 파일 메뉴를 열었다면 다음 판단은 처음 화면이 아니라 펼쳐진 메뉴를 보고 해야 합니다. 이 확인과 실행의 반복이 기본 구조입니다.
단테는 결과물만 보고 과정을 단정하지 말라고 강조합니다. AI가 입체 모델을 만들었다고 반드시 마우스로 만든 것은 아닙니다. 코드를 실행해 파일을 만들 수도, API나 MCP를 쓸 수도, 화면을 직접 조작할 수도 있습니다. 같은 작업을 많이 반복한다면 API나 MCP가 편하지만, 메뉴 위치와 조작 순서를 배우려면 화면에서 과정을 볼 수 있어야 합니다. 결과 파일만 받아서는 어느 설정이 무엇을 바꿨는지 알기 어렵기 때문입니다.
공개 사례와 그 한계
영상은 몇 가지 공개 사례를 소개합니다.
- 그림 그리기: 사진을 옆에 두고 편집 화면에서 윤곽을 따라 작업하는 시연입니다. 다만 이 영상 하나로 어떤 그림이든 잘 그린다고 말할 수는 없습니다.
- 마인크래프트: Astra에게 다이아몬드를 캐 달라고 맡기고 잠들었는데 나중에 인벤토리에서 다이아몬드를 확인했다는 사례입니다. 자원 수집, 도구 제작, 이동이 하나의 목표로 이어져야 한다는 점이 흥미롭습니다. 공개된 실행 도구는 Windows 기반이라 Mac에서 그대로 된다고 소개하면 안 됩니다.
- 음악 프로그램: Reddit에 올라온 후기로, 작성자는 가능성은 느꼈지만 음악 결과는 아쉬웠다고 평가했습니다. 프로그램을 조작하는 능력과 좋은 작품을 만드는 판단은 따로 봐야 한다는 사례입니다.
Astra에서 무엇이 좋아졌나
OpenAI가 공개한 ScreenSpot Pro 결과에서 Astra는 92.7%, Sol은 76.9%였습니다. 이 평가는 화면에서 지정한 대상을 찾는 능력을 보는 것이므로 전체 작업 성공률로 읽으면 안 됩니다. 파일을 열고 편집하고 저장하는 전체 작업에는 현재 단계 파악, 입력 반영 여부 확인, 잘못된 메뉴에서 돌아오는 판단이 더 필요합니다.
OpenAI는 모델과 함께 Codex의 실행 시스템도 개선했다고 밝혔고, 발표된 속도 개선 수치도 이 조합의 결과이므로 모델만의 효과로 해석하면 안 됩니다. 공식 문서에는 화면을 확인한 뒤 이미 위치와 순서를 아는 짧은 입력을 묶어서 처리하는 방식도 나옵니다. 모든 클릭마다 모델에 묻는 것보다 왕복을 줄일 수 있지만, 중간에 화면이 예상과 다르게 바뀌면 다시 확인해야 합니다. 반면 내부 구조나 학습 데이터에 대한 추측은 공개 자료만으로 확정할 수 없다고 선을 긋습니다.
여전히 느리게 느껴지는 이유는 글자 생성 속도만이 아니라 화면 전달, 판단, 입력 실행, 프로그램 반응을 기다리는 시간과 잘못된 조작을 되돌리는 시간이 더해지기 때문입니다. 학습 목적이라면 오히려 너무 빠른 시범은 따라가기 어렵습니다.
Blender 입체 글자 시연
시작 파일에는 카메라 한 대와 조명 세 개만 넣었고, 이 준비는 코드로 한 것이라 컴퓨터 유즈 성과로 세지 않았습니다. 글자 작업은 모두 화면 조작으로 진행했습니다.
- F3로 검색창을 열고 텍스트를 추가합니다.
- Tab으로 편집 모드에 들어가 기본 글자를 "단테"로 바꾸고, 화면에서 실제로 바뀌었는지 확인합니다.
- 글자를 메시로 변환하고, 편집 모드에서 전체 선택 후 돌출로 0.25만큼 두께를 줍니다. 메시로 바꾸면 타이핑으로 고칠 수 없으니 변환 전에 복사본을 남기는 편이 좋습니다.
- 모서리에 베벨을 추가하고 F12로 렌더링합니다.
과정이 매끄럽지만은 않았습니다. 마우스 좌표 입력에서 오류가 났고, 한글 입력 상태 때문에 원하는 글자가 들어가지 않기도 했습니다. 입력 상태를 확인하고 키보드 검색 명령으로 진행해 마무리했습니다. 단테는 명령을 보냈다는 사실과 화면이 원하는 대로 바뀌었다는 사실은 다르다고 강조합니다. 저장한 파일을 다시 열어 두께와 베벨이 남아 있는지 검사하고, 같은 저장본으로 렌더 이미지도 출력했습니다.
학습용 첫 요청은 다음과 같이 할 수 있다고 제안합니다.
현재 열린 블렌더 화면에서 입체 글자를 만들어 줘. 각 단계 전에 무엇을 왜 바꾸는지 두 문장으로 설명하고, 바뀐 화면을 확인한 뒤 다음으로 넘어가 줘.
배웠는지 확인하는 방법
AI가 한 일을 다시 보는 것만으로는 부족합니다. 시범이 "단테"였다면 직접 할 때는 "HELLO" 같은 다른 글자와 다른 색을 써 봅니다. 그래야 순서를 외운 것인지 기능의 목적을 이해한 것인지 구분할 수 있습니다. 막히면 힌트를 요청하되 막힌 위치를 적어 두고, 힌트를 받아 내가 누른 경우와 AI가 대신 해결한 경우를 따로 기록합니다. 단테는 이 학습 방식이 실제로 효과가 있는지까지 실험한 것은 아니라고 밝힙니다.
설정은 공식 안내를 기준으로, 지원되는 데스크톱 앱에서 컴퓨터 유즈 플러그인을 설치하고 대상 앱의 접근 설정을 확인합니다. Mac에서는 화면 기록과 손쉬운 사용 권한이 관련됩니다. 처음에는 메뉴 열고 닫기, 글자 입력 같은 작은 동작부터 확인하는 것이 좋습니다.
정리
- 컴퓨터 유즈는 화면 확인과 입력 실행을 반복하는 구조이며, 완성품만으로는 어떤 경로로 만들었는지 알 수 없습니다.
- ScreenSpot Pro 점수는 대상 찾기 능력이지 전체 작업 성공률이 아닙니다.
- 명령을 보낸 것과 화면이 실제로 바뀐 것은 다르므로 중간 확인과 결과 파일 검사가 필요합니다.
- 학습용으로 쓸 때는 단계별 설명을 요청하고, 다른 값으로 직접 따라 해 보며 힌트와 대행을 구분해 기록합니다.
- 창작 작업은 파일이 생겼는지가 아니라 최종 결과물을 직접 보고 들어서 평가해야 합니다.

