모델 비교 · 영상 게시 2026-09-22 · 11분 56초

무료 Laya와 유료 Jev 비교: 테트리스·지뢰찾기 대전으로 본 판단 모델

로컬에서 도는 무료 판단 모델 Laya와 API로 쓰는 Jev를 같은 에이전트에 붙여 테트리스 대전 11판과 지뢰찾기로 비교하고, 속도·정확도·비용 차이를 정리했습니다.

영상에서 단테는 TypeSafe의 유료 판단 모델 Jev와 무료 오픈 소스 대안 Laya를 같은 게임 에이전트에 연결해 테트리스 대전과 지뢰찾기를 시켰습니다. 결과는 Jev 6승, Laya 3승, 무승부 2번이었고 테트리스에서 지운 줄 수의 중앙값은 양쪽 모두 16줄로 같았습니다. 판단형 모델을 서비스에 붙여 볼지 고민하는 분, 공개 벤치마크 표를 그대로 믿어도 될지 궁금한 분께 맞는 내용입니다.

Jev와 Laya는 어떤 모델인가

두 모델은 흔히 아는 LLM과 달리 글을 쓰지 않습니다. 상태와 질문을 주면 타입이 정해진 답만 돌려줍니다. 답의 형태는 세 가지입니다. 보기 중 하나를 고르는 선택형, 참일 확률을 0에서 1 사이로 주는 확률형, 눈금 위 어디쯤인지 말하는 점수형입니다. 출력 토큰이 거의 없어 파싱할 것이 없고 지어낼 여지도 적지만, 왜 그렇게 판단했는지는 설명하지 않습니다.

Jev는 TypeSafe가 내놓은 판단 모델로 API로만 쓸 수 있고, 가중치와 크기는 공개돼 있지 않습니다. 콘솔에서 키를 만들면 5달러 크레딧이 붙습니다. 사용법은 엔드포인트 하나로, state에 상황을, question에 물어볼 것을 넣어 보냅니다. state는 숫자만 나열하지 않고 문장으로 쓸 수 있고, 여러 질문을 한 번에 묶어 보낼 수 있습니다. 왕복이 400밀리초쯤 걸리기 때문에 묶을수록 유리합니다.

Laya는 Jev가 나온 뒤 GitHub에 올라온 오픈 소스 대안입니다. 라이선스는 Apache 2.0이고, 4억 2천만 파라미터에 컨텍스트는 512토큰입니다. 가중치가 공개돼 있어 키나 과금 없이 개인 노트북에서 돌릴 수 있고, predict 함수가 Jev와 같은 모양이라 코드를 거의 그대로 옮길 수 있습니다. 한국어를 다룬다면 다국어 체크포인트를 쓰면 됩니다. 주의할 점은 두 가지입니다. 디바이스를 지정하지 않으면 CPU로 떨어져 세 배쯤 느려지고, 모델 로드에 22초가 걸리므로 한 번 올린 뒤 재사용해야 합니다. 올라간 뒤에는 질문 하나에 30밀리초 정도로 빠릅니다.

핵심 차이는 무료냐 유료냐가 아니라 어디서 도느냐입니다. Laya는 내 기계에서, Jev는 TypeSafe 서버에서 돌기 때문에 지연 시간의 성격 자체가 다릅니다.

공개 벤치마크를 그대로 믿기 어려운 이유

Laya가 공개한 벤치마크는 일곱 줄 중 여섯 줄에서 이겼다고 되어 있습니다. 하지만 위쪽 세 줄이 모두 문장을 주고 라벨을 맞히는 텍스트 분류 과제였습니다. 단테는 이것이 나쁘다는 뜻이 아니라, 실제 쓰임과 다를 수 있다는 점을 짚고 다른 과제로 직접 시험하기로 했습니다.

테스트 구조는 이렇습니다. 게임을 두는 주체는 모델이 아니라 단테가 만든 에이전트이고, 하네스는 하나에 백엔드만 둘입니다. 양쪽에 글자 하나까지 같은 입력이 들어갑니다. 코드가 상황을 문장으로 바꾸고, 모델은 공격할지, 방어할지, 구멍을 팔지, 안전하게 갈지 같은 전략 하나만 고릅니다. 착지 위치 여섯 개를 숫자로 나열해 고르라고 하면 그것은 판단이 아니라 계산이기 때문에, 전략은 모델이 고르고 착지 계산은 코드가 하도록 나눴습니다.

속도: 질문 수에 따라 역전된다

질문 하나만 보면 Laya가 30밀리초, Jev가 364밀리초로 약 12배 차이입니다. 그런데 Laya는 내 기계가 계산하므로 질문당 24.5밀리초가 그대로 쌓입니다. 질문 16개쯤에서 두 모델이 만나고, 48개를 묶으면 Jev가 2.8배 빨라집니다. Laya가 공개한 속도 우위는 질문 하나 기준의 수치였습니다.

질문 수를 24개로 고정하고 상태 설명만 길게 늘리는 실험도 했습니다. 단서 20개일 때 1,269밀리초, 40개일 때 1,251밀리초, 60개일 때 1,256밀리초로 입력이 세 배가 됐는데 시간이 늘지 않았습니다. Laya의 컨텍스트가 512토큰이라, 넘는 부분은 경고나 에러 없이 뒤를 버리기 때문입니다.

지뢰찾기와 테트리스 대전 결과

지뢰찾기에서는 칸마다 "여기 안전한가"를 물어 그 확률로 판을 색칠했습니다. Laya가 한 턴에 내놓은 확률은 8.4% 폭 안에 모두 들어가 거의 한 색이었고, Jev는 25% 폭으로 퍼졌습니다. 그런데 결과는 Laya 63칸, Jev 66칸에서 비슷하게 지뢰를 밟았습니다. 단서 하나짜리 깨끗한 문제에서는 Jev가 100% 맞혔지만, 단서 60개를 섞으면 Jev도 확정 지뢰를 80% 안전하다고 답했습니다. 어지러운 판에서는 둘 다 연역 추론을 하지 못했습니다.

그렇다고 Laya가 나쁜 모델은 아닙니다. 고객 메일을 보여주고 이탈 위험이 있는지 물었을 때는 둘 다 네 개를 모두 맞혔습니다. 의미를 읽는 일은 대등하고, 숫자를 연역하는 일에 약한 것입니다.

이를 바탕으로 단테는 이런 판단 모델에 맞는 게임 조건을 정리했습니다. 후보와 그 결과는 코드가 계산해 한 줄로 만들어 줄 것, 정답이 증명 가능한 게임은 피할 것, 정답이 상황에 따라 뒤집혀야 할 것, 상태가 1천 토큰 안의 자연어로 읽힐 것입니다. 그래서 줄을 지우면 상대에게 방해 줄이 쌓이는 대전 테트리스를 만들었습니다. 조각 순서는 양쪽이 같고, 속도 차이가 승부에 영향을 주지 않도록 느린 쪽에 페이스를 맞췄습니다.

화면에서 Laya는 자기 위험도를 82%로 읽어 죽어 가는 것을 알면서도 무엇을 해야 할지는 고르지 못했고, 확신도는 3~4%에 머물렀습니다. 한 판으로 결론 내기 어려워 11판을 돌린 결과 Jev 6승, Laya 3승, 무승부 2번이었습니다. 한 판은 Jev 쪽 TLS 핸드셰이크 타임아웃으로 무효가 됐는데, 로컬에서 도는 Laya에는 없는 실패 유형입니다.

비용은 테트리스 한 턴이 699토큰, 92턴짜리 한 경기가 0.0027달러였고, 실제 돌린 턴 수로 모두 곱해도 합계 6.2센트로 무료 크레딧 5달러의 1.2% 수준이었습니다. Laya는 무료입니다.

정리

  • 짧은 질문 하나는 로컬 Laya가 약 12배 빨랐지만, 48개를 묶으면 Jev가 2.8배 빨랐습니다.
  • 의미를 읽는 판단은 둘이 대등했고, 숫자를 연역하는 일은 Laya가 약하며 복잡해지면 Jev도 잘 못 했습니다.
  • Laya는 512토큰을 넘는 입력을 경고 없이 잘라내므로 상태 길이를 반드시 관리해야 합니다.
  • 테트리스 대전 11판에서는 Jev가 조금 더 자주 이겼고, 누가 이기느냐는 무엇을 묻느냐에 달려 있었습니다.
  • 아레나와 측정 스크립트는 https://github.com/dante01yoon/laya-jev-arena 에 공개돼 있어, 남의 벤치마크 대신 자기 과제로 시험해 볼 수 있습니다.

영상: 유튜브에서 보기 · 정정 요청: dante@quokkalabs.net