TypeSafe가 2026년 9월 15일에 공개한 Jev는 문장을 만들지 않는 모델입니다. 이 영상에서는 Jev가 LLM과 무엇이 다른지, 왜 빠른지, 어디에 맞고 어디에 맞지 않는지를 공개 자료와 출시 후 일주일간의 사례로 정리했습니다. 에이전트끼리 주고받는 판단을 자연어 대신 구조화된 값으로 처리하고 싶은 개발자에게 도움이 됩니다.
질문을 넣으면 확률이 돌아온다
Jev에 고객 이메일 한 통을 넣고 네 가지를 물으면 이런 값이 돌아옵니다. 담당 부서는 billing 0.91, 긴급도는 high 0.83, 환불 문제 여부는 0.92대, 이탈 위험은 0.74입니다. 설명하는 문장은 한 줄도 없습니다.
단테가 이 모델을 보고 처음 떠올린 질문은 이것이었습니다. 지금의 AI 에이전트는 기계에서 영어로, 다시 기계로 오갑니다. 리서치 봇이 "조사해 본 결과 A가 적합합니다"라고 쓰면 매니저 봇이 그 문장을 읽습니다. 그런데 그 중간 단계를 사람이 읽지는 않습니다. 영상은 이 질문을 끝까지 따라갑니다.
입력은 정리하지 않아도 됩니다. 이메일 본문, 게임 상태, 대화 로그를 그대로 넣으면 Jev가 미리 정의한 여러 질문을 한 번에 판단하고 선택지별 확률 분포와 확신도를 돌려줍니다. 질문 형식은 세 가지입니다.
- 선택: 정해진 보기 중 하나를 고르고 보기끼리 확률을 나눕니다.
- 예/아니오: 조건이 성립할 확률 하나를 돌려줍니다. 0.5는 "중간 강도"가 아니라 예와 아니오가 비슷하다는 뜻입니다.
- 척도: 설명된 축 위에서 어느 정도인지를 순서 있는 단계에 확률로 나눠 표시합니다.
질문 ID는 코드에서만 쓰이고 모델에 전달되지 않으므로 의미는 모두 질문 문장에 담아야 합니다. TypeSafe는 없는 선택지를 만들어 낼 수 없으니 환각과 타입 에러가 없다고 설명합니다.
왜 빠른가: 순차 샘플링을 버렸다
LLM은 두 번째 토큰을 계산하려면 첫 번째 토큰을 알아야 합니다. 출력이 길수록 지연이 쌓이는 순차 병목입니다. LLM에게 JSON을 달라고 해도 모델은 중괄호, 따옴표, 키 이름, 콜론 순으로 토큰을 하나씩 만듭니다. 결과는 구조화돼 있어도 생성 과정은 텍스트 생성입니다.
Jev는 같은 상태에 대한 독립 질문들을 한 번의 호출에서 동시에 평가합니다. 질문끼리 서로의 답을 보지 않으므로 순서가 없고, TypeSafe 문서는 질문 수를 늘려도 응답 시간이 크게 늘지 않는다고 설명합니다.
공개 자료 기준 수치는 다음과 같습니다. 응답 시간은 70500ms, 같은 수준 프런티어 LLM 대비 40200배 빠르다고 하고, 출력 토큰은 무료이며 구조 출력의 타입 에러는 0이라고 합니다. 워크플로 평가에서는 GPT 6 Astra, Fable 5.1 대비 193.6배 빠르고 444.6배 저렴하다고 발표했습니다. 모두 TypeSafe 자체 평가입니다. 내부 레이어 구조나 샘플러 알고리즘은 논문 수준으로 공개되지 않았습니다.
맞는 일과 맞지 않는 일
광고 카피 쓰기, 새 코드 작성, 보고서, 긴 논증, 새로운 아이디어처럼 자유 문자열을 만들어야 하는 일은 못 합니다. 왜 그렇게 판단했는지 말로 풀어 주지도 않습니다. 반대로 "누구에게 넘길까, 진행할까, 위험도와 우선순위는, 어떤 도구를 부를까, 결과가 충분한가, 재시도할까, 사람에게 넘길까" 같은 결정에 잘 맞습니다.
출시 데모인 둠(Doom)은 화면 픽셀을 보는 것이 아니라 몬스터·아이템·좌표가 담긴 텍스트 게임 상태를 받습니다. 전략도 텍스트로 넣기 때문에 "쏘지 말고 피하기만 하라"고 바꾸면 행동이 바로 바뀝니다. 출시 일주일 동안 X에는 음성으로 조작하는 브라우저 에이전트(행동 후보는 코드가 만들고 Jev가 고르며, 타이핑처럼 생성이 필요한 부분만 작은 LLM에 맡김), 이미 코드에 있는 컴포넌트 중 무엇을 띄울지만 고르는 생성형 UI, 여러 게임을 동시에 플레이하는 사례, 이메일 분류 사례가 올라왔습니다.
영상은 이를 다섯 가지 패턴으로 묶었습니다. 라우팅과 인자 채우기, 생성 대신 선택, 근거 찾고 판정하기, 판단을 데이터로 만들기, 검증하고 넘기기입니다. 공통점은 코드가 주인이라는 점입니다. 규칙·계산·조회는 코드에 남기고 Jev는 의미 이해가 필요한 자리에만 들어갑니다.
10년 전 MNIST와 캘리브레이션
단테는 약 10년 전 『밑바닥부터 시작하는 딥러닝』으로 MNIST를 공부했습니다. 28×28 회색조 손글씨 숫자를 넣으면 모델은 "이건 7입니다"라고 답하지 않고 열 개 클래스 전부의 확률을 냈습니다. 영상을 위해 소프트맥스 회귀를 직접 학습시켜 보니 한 테스트 이미지에서 7일 확률이 0.928로 나왔고, 테스트 정확도는 약 92%였습니다. 그 숫자를 프로그램이 바로 받아 썼습니다.
LLM도 매 단계 확률을 계산하지만, 그 분포는 약 10만 개 어휘 위에 펼쳐져 있고 토큰 하나를 골라 다음 단계 입력에 붙입니다. 500토큰을 만들면 500번 반복합니다. Jev의 분포는 어휘가 아니라 사용자가 정의한 보기 위에 있고, 질문마다 자기 분포를 가지며 한 번에 나옵니다. MNIST는 확률에서 기계의 결정으로, LLM은 확률에서 토큰을 거쳐 사람의 언어로, Jev는 다시 확률에서 기계의 결정으로 갑니다. 의미 이해 능력은 현대적으로 가져가면서 출력 인터페이스만 기계용으로 바꾼 셈입니다.
확률이 분기 조건이 되면 숫자가 정직해야 합니다. 예를 들어 환불 확률이 0.95보다 크면 자동 처리하고, 그보다 낮은 구간은 확인을 받고, 더 낮으면 사람에게 넘기는 식입니다. TypeSafe는 이를 목표로 한 사후 학습에 RLCD(reinforcement learning for calibrated decisions)라는 이름을 붙였지만 보상 함수와 내부 구조는 공개하지 않았습니다. 임계값은 각자 자기 데이터로 정해야 합니다.
정리
- Jev는 문장을 만들지 않고, 미리 정의된 결정에 보정된 확률을 돌려주는 모델입니다.
- 빠른 이유는 모델이 작아서가 아니라 순차 샘플링 대신 여러 질문을 한 번에 평가하기 때문입니다.
- 자유 생성은 LLM이, 구조화된 판단은 Jev가, 실행은 코드가 맡는 구조가 영상이 제시한 그림입니다.
- 속도와 비용 수치는 대부분 TypeSafe 자체 평가이므로 임계값과 성능은 각자 도메인에서 확인해야 합니다.

