이미지·영상·게임 · 영상 게시 2026-09-11 · 6분 50초

공개 자료만으로 AI 홍보 영상 만들기: 여수 섬 박람회 제작기

Astra, Blender, ComfyUI로 여수 섬 박람회 홍보 영상 형식의 가상 작업물을 만든 과정입니다. 스토리보드, 영상 모델 비교, 인물·글자·소리 수정, 비용 계산 방식을 정리합니다.

이 영상에서 단테는 현장에 가지 않고 공개 자료만으로 여수 섬 박람회 홍보 영상 형식의 작업물을 만들어 봤습니다. Astra, Blender, ComfyUI를 함께 쓰고, 영상 생성 모델 두 가지를 같은 장면으로 비교했습니다. AI 영상 생성으로 짧은 홍보 영상을 만들어 보려는 분께 작업 순서, 자주 생기는 문제, 비용 계산 방식을 참고할 수 있는 내용입니다. 영상 속 결과물은 AI 가상 테스트이며 실제 홍보에 쓰는 영상이 아니라는 고지를 처음부터 끝까지 유지했습니다.

스토리보드부터 시작하기

단테는 공식 영상에 소개된 전시물과 인터넷에 공개된 사진을 바탕으로 섬의 풍경과 전시 공간을 살펴보고, 담을 장면을 12컷으로 정리했습니다. 컷마다 참고 이미지, 카메라 움직임, 소리까지 적어 두었습니다.

현장을 직접 확인한 것이 아니어서 실제 공간과 다른 부분이 있을 수 있고, 관람객의 행동이나 콘서트, 불꽃놀이는 상상해서 구성한 장면이라고 밝혔습니다. 목표는 자료로 공간을 잡고, 그 안에서 사람들이 함께 하루를 즐기는 모습을 만드는 것이었습니다. 완성본은 아침의 설렘으로 시작해 아이가 전시를 체험하고, 함께 식사하고, 노을과 공연, 밤의 불꽃으로 이어지는 흐름입니다.

Blender 카메라 영상과 ComfyUI 워크플로

Blender에서는 전시 통로를 단순한 입체 구조로 만들고, 카메라가 앞으로 이동하는 6초짜리 영상을 렌더링했습니다. ComfyUI 워크플로에서는 이미지를 불러오는 노드와 영상을 불러오는 노드를 각각 영상 생성 모델에 연결했습니다. 참조 이미지로는 공간의 외형을, Blender 영상으로는 카메라의 이동 방향을 전달하려는 의도였습니다. 프롬프트에는 원하는 장면과 사람의 행동을 적었습니다.

다만 영상 입력을 넣었다고 카메라와 인물이 정확히 유지되지는 않았습니다. 그래서 조건을 바꿔 가며 여러 번 생성하고 결과를 비교했습니다. 생성된 영상과 작업 파일을 함께 저장해 두어, 어떤 입력으로 나온 결과인지 나중에 다시 확인할 수 있게 했습니다.

같은 전시 통로 장면을 MiniMax 계열 모델과 Seedance로 비교했습니다. 이미지 하나만 넣은 경우와 Blender 영상까지 넣은 경우, 간단한 지시와 상세한 지시를 나눠 생성했습니다. 사람을 유지하지 못한 출력도 있었고, 통로의 중심 구도가 잘 남은 출력도 있었습니다. 단테는 이것이 한 장면의 사례일 뿐 모델 전체의 순위는 아니라고 강조했습니다. 마을 장면에서는 카메라가 너무 크게 움직여서, 카메라를 고정하라는 조건으로 다시 생성했습니다. 최종 본편에는 MiniMax 모델로 생성한 컷을 썼고, Blender 카메라 영상과 Seedance 결과는 비교만 하고 넣지 않았습니다.

사람에게 구체적인 행동 주기

가장 큰 수정은 등장인물에게 구체적인 행동을 주는 것이었습니다. 처음에는 사람이 장식처럼 서 있거나 애니메이션처럼 느껴지는 컷이 있었습니다. 그래서 아이가 바닥 전시 위를 달리고, 수족관 화면에 손을 대고, 친구들이 서로 다른 타이밍에 움직이도록 지시를 바꿨습니다. 사진처럼 보이는 새 참조 이미지를 먼저 만들고, 그 이미지로 다시 영상을 생성했습니다.

글자도 문제였습니다. 멀리서는 멀쩡해 보여도 확대하면 깨진 글자가 보입니다. 옷과 간판에 글자를 만들지 말라고 지시했지만 그것만으로는 충분하지 않았습니다. 실제 출력에서 문제가 있는 영역을 확인해 잘라 냈고, 최종 제목과 자막은 편집 단계에서 정확한 한글 폰트로 넣었습니다.

소리와 자막 다듬기

화면을 정리하고 나니 소리가 거슬렸습니다. 박수 장면마다 함성이 나와 인위적이었기 때문입니다. 함성을 줄이고 음악과 내레이션을 따로 구성했습니다. 중간에는 새로 만든 음성과 기존 자막이 맞지 않는 문제가 생겨, 원본 컷부터 다시 연결하고 음성의 시간 정보에 맞춰 자막을 새로 넣었습니다. 불꽃 사이에 넣었던 금색 글자도 과해 보여서, 카메라가 하늘을 바라보는 장면은 살리고 제목은 간결한 흰색 글자로 바꿨습니다.

전체 작업 순서는 다음과 같았습니다.

  1. 공개 자료 수집
  2. 스토리보드로 12개 장면 결정
  3. 참조 이미지 준비
  4. ComfyUI에서 영상 생성, 쓸 만한 구간 선택
  5. 사람의 움직임과 글자 확인
  6. FFmpeg로 편집하고 ElevenLabs 음성, 음악, 자막 합치기

비용은 어떻게 계산했나

비용은 Astra와 ComfyUI를 나눠 계산했습니다. Astra는 완성본을 마지막으로 수정하고 조립한 작업 구간만 집계했고, 약 662만 토큰을 캐시 입력을 구분해 표준 API 단가로 환산하면 약 9.48달러였습니다. 전체 제작비나 실제 청구액은 아닙니다. ComfyUI는 본편에 쓴 원본 12개 컷을 한 번씩 생성하는 기준으로, 요청한 길이 총 76초에 공식 단가를 적용해 계산했습니다. 실제 차감 내역과는 차이가 있을 수 있고, 이미지·음성·음악 비용은 별도입니다. 여러 번 수정하고 다시 생성하는 과정이 있었기 때문에 수정 횟수에 따라 전체 비용은 달라집니다.

정리

  • 스토리보드에 컷별 참고 이미지, 카메라 움직임, 소리를 미리 적어 두면 생성과 수정 기준이 명확해집니다.
  • Blender 카메라 영상과 참조 이미지를 함께 넣어도 카메라와 인물이 그대로 유지되지는 않아, 조건을 바꿔 여러 번 비교해야 했습니다.
  • 사람에게 구체적인 행동을 지시하고 사진 같은 참조 이미지를 다시 만든 것이 가장 효과가 컸습니다.
  • 생성된 글자는 확대하면 깨지므로, 제목과 자막은 편집 단계에서 직접 넣는 편이 안전합니다.
  • 비용은 작업 구간과 계산 기준을 밝혀 두어야 하며, 재생성 횟수에 따라 크게 달라질 수 있습니다.

영상: 유튜브에서 보기 · 정정 요청: dante@quokkalabs.net