테크·AI전체 리포트내 보관함
시장 읽기 · 데이터2026년 9월 28일 월요일 · AI·테크
입력 100만 토큰 $0.042 · 출력 과금 없음 · 응답 0.07~0.5초

글 안 쓰는 AI ‘Jev’, 200배 빠르다는 말의 실제 크기

전 OpenAI 연구원이 세운 TypeSafe AI가 9월 15일 내놓은 Jev는 문장을 만들지 않는다. 정해 둔 선택지 중 하나를 고르고, 점수를 매기고, 예·아니요를 확률과 확신도로 돌려줄 뿐이다. 일본·중국 개발자들이 먼저 붙잡은 이 모델이 얼마나 빠르고 싸고 정확한지, 회사 발표와 독립 측정을 나란히 놓았다.

동이2026년 9월 28일 15:00 기준읽는 데 약 8분
공식 ‘193.6배’는 최대치, 독립 측정은 5~25배단위: 배
같은 판정을 LLM으로 할 때보다 몇 배 빠른가 · 갈색 = 회사 쪽 수치, 보라 = 독립 측정
TypeSafe 발표최대치 · 9월 15일 블로그
193.6배
가장 빠른 Jev 응답과 가장 느린 비교 모델을 맞댄 값이라는 분석
TypeSafe 표기 범위구조화 판정 기준
40~200배
공식 문서·언론 보도의 '40~200배'
Every대 Fable 5.1 · 판정 1,709건
약 25배
중앙값 0.35초 대 8.83초
Near Here대 Mistral Small 4 등 · 50건
약 5배
평균 0.59초 · 작은 모델과 비교하면 격차가 준다
배수는 비교 상대에 따라 달라진다. 큰 프런티어 모델과 비교하면 수십 배, 작은 경량 모델과 비교하면 한 자릿수 배다. 독립 측정 수치는 Every 공개 사례와 Moji·DataSci Ocean의 정리를 따랐다. 행에 마우스를 올리면(휴대폰은 누르면) 측정 조건이 보인다.
1Jev는 ‘똑똑한 if문’이다. 글 대신 정해진 답 하나와 그 답을 얼마나 믿는지(확신도)를 돌려준다. 선택지 밖의 답은 구조상 나올 수 없다.
2빠르고 싼 건 맞지만 배수는 상대에 따라 크게 다르다. 속도는 공식 193.6배, 독립 측정 5~25배. 비용은 1.6배에서 600배까지 벌어진다.
3정확도는 질문을 어떻게 쪼개느냐에 달렸다. 피싱 판정을 한 번에 물으면 62.6%로 Haiku(81.3%)에 뒤지지만, 작은 질문 다섯 개로 나누면 95.0%까지 오른다.
입력 단가100만 토큰당 · 출력은 과금 없음$0.04210억 토큰에 $42
응답 시간공식 범위0.07~0.5초Every 실측 중앙값 0.35초
선택지 한도선택형 질문 하나당255개넘으면 두 단계로 나눈다
창업자 발표 게시물 노출X · 9월 20일 기준3,700만 회+ITmedia
공식 4개 업무 일치율기준 답 = 두 프런티어 모델 평균67.8%GPT-5.6 솔 74.1%
무료 크레딧개발자 후기 기준$5공식 요금표에서는 미확인

수치는 9월 28일까지 공개된 회사 발표·언론 보도·개발자 글 기준이다. 커뮤니티 반응 수치는 시점에 따라 계속 바뀐다.

1무엇인가

답을 쓰는 대신 답을 고른다

TypeSafe AI는 Jev를 ‘System One 모델’의 첫 번째 제품이라고 부른다. 심리학자 대니얼 카너먼이 말한 빠르고 직관적인 사고(시스템 1)에서 따온 이름이다. 창업자 디오구 알메이다는 ChatGPT의 바탕이 된 InstructGPT 논문의 공저자 약 20명 가운데 한 명이다. 그는 Latent Space 인터뷰에서 Jev의 소비자는 사람이 아니라 코드라고 말했다.

쓰는 법은 단순하다. 판단할 글과 질문을 보내면, 질문마다 정해 둔 형식의 답이 확률과 함께 한 번에 돌아온다. 형식은 세 가지뿐이다. 글을 한 글자씩 생성하지 않으니 출력 토큰 요금이 없고, 응답이 짧다.

문의 한 건에 질문 셋, 146ms 만에 확률이 돌아왔다단위: %
고객 문의 한 건 · 응답 146ms
어느 부서로?선택형
기술 82%
짜증 정도는?점수형
1단계 100%
급한 문의인가?예·아니요
예 99%
Dale Seo 블로그의 예시 응답을 옮겼다. 성능 측정이 아니라 응답 모양을 보여 주는 예다.
질문 형식은 셋뿐이다SDK 함수 기준
형식묻는 것돌려받는 값
선택형 choice정해 둔 선택지 중 무엇인가 (최대 255개)선택지별 확률 + 확신도
점수형 score순서 있는 단계 중 어디쯤인가기대값 점수 (1.4처럼 단계 사이 값도)
예·아니요 noul참인가 거짓인가0~1 사이 확률 하나
Dale Seo 블로그·Vercel 공지 기준. 회사는 학습 방식을 ‘보정된 판단을 위한 강화학습(RLCD)’이라고 소개했다.

할 수 없는 일도 분명하다. ITmedia는 문장 생성, 수학 같은 ‘시스템 2’ 추론, 이미지 입력, 판단 이유 설명이 안 되고 특정 분야 지식도 따로 배우지 않았다고 정리했다. 한 사용자는 주사위 눈의 확률조차 맞히지 못했다고 전했다. Jev는 LLM을 대체하는 모델이 아니라 LLM 앞에 세우는 관문에 가깝다.

2스마트한 if문

확신도가 높으면 통과, 낮으면 비싼 쪽으로

ITmedia 기사 제목이 이 모델의 쓰임새를 가장 잘 요약한다. “똑똑한 if문으로 생각해 보라.” 확신도가 기준 이상이면 코드가 그대로 처리하고, 못 미치면 LLM이나 사람에게 넘긴다. 문의 분류, 우선순위 매기기, AI 에이전트 출력 검사, 대량 데이터 분류가 여기에 맞는다.

Jev는 분기문 한 줄을 대신한다개념도
확신도가 기준을 넘으면 코드가 그대로 처리하고, 못 넘으면 비싼 쪽으로 넘긴다
ITmedia가 전한 창업자의 설명(‘똑똑한 if문으로 생각해 보라’)을 그림으로 옮겼다. 기준값은 쓰는 사람이 정한다.

관건은 얼마나 많은 건이 첫 관문에서 끝나느냐다. 아래 계산기는 판정을 전부 LLM에 맡길 때와, Jev가 먼저 거르고 나머지만 LLM에 넘길 때의 월 비용을 비교한다. 넘어간 건은 Jev 요금도 이미 낸 상태로 계산했다.

Jev로 먼저 거를 때 월 비용 $76.20
전부 LLM일 때$360.00
Jev 몫 (전 건)$4.20
LLM으로 넘긴 몫$72.00
줄어드는 비율78.8%

추정치다. LLM 쪽은 건당 출력 200토큰을 더해 계산했고, Jev는 입력 100만 토큰당 $0.042 목록가만 넣었다. 캐시·배치 할인, 재시도, 네트워크 비용은 빠져 있다.

3속도와 값

‘193.6배’는 어떻게 나온 숫자인가

공식 블로그의 193.6배·444.6배는 네 가지 업무 중 가장 단순한 것을 공개한 값이다. 경쟁 모델도 TypeSafe의 어댑터를 거쳐 구조화 출력만 내게 했고, 기준 답은 사람이 매긴 정답이 아니라 GPT-6 아스트라와 Fable 5.1의 평균이었다. 회사 스스로도 “실사용 이득의 높은 쪽 끝”일 것이라고 적었다.

지디넷코리아 칼럼(안광섭)은 이를 두고 “가장 느린 모델과 가장 비싼 모델을 분모로 삼아 배수를 키운 셈”이라고 짚었다. 독립 측정은 비교 상대가 크면 수십 배, 작으면 한 자릿수 배로 모인다. 서버가 미국 서부에 가까워 일본에서 부르면 요청당 0.5~0.6초가 걸렸다는 실측도 Zenn 글에 인용됐다. 한국에서도 비슷한 왕복 시간을 감안해야 한다.

입력 단가는 가장 싼 비교 모델의 5분의 1 아래단위: 달러
입력 100만 토큰당 목록가 · Jev는 출력 과금이 없다
Jev
$0.042
비교 모델
$0.2~10
TypeSafe 공식 블로그 비교표 기준. 캐시·배치 할인은 반영되지 않은 목록가다.
비용 절감은 1.6배에서 600배까지 벌어진다단위: 배
같은 일을 할 때 비용이 몇 분의 1로 주나
Every대 Fable 5.1
약 600배
TypeSafe 발표최대치
444.6배
Near Here대 경량 모델
8.6배
Good Start Labs대 DeepSeek V4.1 Flash
1.6배
상대가 비싼 대형 모델이면 수백 배, 이미 싼 경량 모델이면 한두 배다. 독립 측정 수치는 Moji·DataSci Ocean 정리 기준.
4정확도

‘환각이 없다’와 ‘맞힌다’는 다른 말이다

Jev가 환각을 일으키지 않는다는 말은 형식에 관한 것이다. 허락된 선택지 밖의 답을 낼 수 없으니 형식 오류가 0%다. 그 답이 맞는지는 별개다. AI타임스도 “판단 자체가 100% 옳다는 것은 별개”라고 적었다.

한 번에 물으면 지고, 쪼개 물으면 이겼다단위: %
진한 막대 = Jev · 회색 = 비교 모델
피싱 메일 판정 · 질문 하나로 물었을 때Jev가 18.7%p 뒤졌다
Claude Haiku 4.5
81.3%
Jev
62.6%
같은 판정 · 작은 질문 다섯 개로 쪼갰을 때Jev가 95.0%로 앞섰다
Claude Haiku 4.5
93.2%
Jev
95.0%
TypeSafe 공식 4개 업무 · 기준 답과의 일치율회사 발표에서도 GPT-5.6 솔보다 6.3%p 낮다
GPT-5.6 솔
74.1%
Jev
67.8%
피싱 판정은 9월 17일 공개된 독립 벤치(PhishNChips 2,000통, 절반은 보정용) 결과를 THE D*AI*LY BRIEF가 정리한 것이다. ‘다섯 개로 쪼갠’ 값은 답 다섯 개를 로지스틱 회귀로 묶은 결과라 모델 단독 성적이 아니다. 공식 4개 업무의 기준 답은 GPT-6 아스트라·Fable 5.1의 평균이다.

독립 벤치의 결론은 간단하다. “이게 피싱인가?”처럼 크게 물으면 약하고, “링크가 단축 주소인가?”, “기관을 사칭하면서 무료 메일을 쓰는가?”처럼 잘게 물은 답을 묶으면 강하다. 쪼개기가 도움이 된 쪽은 Jev뿐이었다. Haiku는 가장 좋은 단일 신호(94.2%)가 오히려 다섯 질문 묶음보다 높았다.

5일본·중국·한국

일본·중국은 붙여 보고, 한국은 읽는 중

일본 개발 커뮤니티 Zenn에서는 9월 22일 ‘다들 Jev 얘기뿐, 안 해본 건 나뿐’이 좋아요 144개를 모았다. 정작 이 글의 필자는 직접 써 보지 않고 공개 자료를 정리했다는 점이 흥미롭다. 그 뒤를 이은 글들은 대부분 직접 만든 기록이다. 중국 개발 커뮤니티 쥐에진(掘金)에서는 Jev를 ‘벙어리 모델(哑巴模型)’이라 부르는 해설 글과 ‘Codex에 Jev를 붙이면 날아간다’ 같은 활용 글이 이어졌다.

한국에서는 9월 20일 AI타임스와 지디넷코리아, 21일 AI매터스와 개발 블로그 Dale Seo가 개념을 정리했다. 다만 일본처럼 ‘이렇게 붙여 봤다’는 실전 기록은 아직 드물다.

일본 상위 글 넷 중 셋은 ‘만들어 봤다’단위: 개
보라 = 직접 만들어 본 글 · 청록 = 개념 정리 글
Zenn 좋아요9월 28일 Zenn API로 확인
다들 Jev 얘기뿐, 안 해본 건 나뿐개념 정리 · 9/22
144
Cloudflare + Jev 사이트 검색만들어 봄 · 9/26
75
Jev에게 게임을 시키지 마라LLM 증류 · 9/25
55
하테나 북마크트렌드 수집 시점 값 · 이 글에서 재확인 못 함
Cloudflare + Jev 사이트 검색만들어 봄
203
하테나 댓글 가리기 확장만들어 봄 · 9/27
158
좋아요·북마크는 시간이 지나면 늘어난다. 하테나 수치는 트렌드 레이더가 모은 값을 그대로 옮겼다.
실전 기록 넷, 공개된 비용은 모두 2센트 아래공개 사례
사례한 일비용결과
Every 편집 점검 미국문서 37편 × 질문 21개, 판정 1,709건$0.01 미만심어 둔 결함 7개 중 6개
Cloudflare 사이트 검색 일본벡터 검색 후보 20개를 Jev가 관련도로 재정렬월 약 $0.016무료 크레딧 $5로 운영
사내 문의 에스컬레이션 일본문의 8건의 담당 부서 판정약 $0.0004정확도 미평가, 문제는 분기 규칙
하테나 댓글 가리기 일본공격성·유익함을 0~5로 매겨 36칸으로 분류공개 안 됨공격적 댓글 숨김 확장 공개
에스컬레이션 사례에서는 확신도 49%인 건이 걸러지지 않고 그대로 넘어갔다. 필자는 “모델은 맞았고, 어긋난 건 분기 규칙”이라고 결론 냈다.

공개부터 2주, 확산 순서

9월 15일
TypeSafe AI, Jev 공개. 대기자 명단 방식의 조기 접근으로 시작했고, 공식 블로그에 193.6배·444.6배를 실었다.
9월 16일
Vercel AI Gateway 탑재. 데이터 미보존(ZDR)·학습 제외 옵션을 함께 안내했다.
9월 17일
독립 피싱 판정 벤치 공개. 질문 하나 62.6%, 다섯 질문 95.0%.
9월 20일
ITmedia ‘똑똑한 if문’ 기사. 창업자 발표 게시물 노출 3,700만 회 이상. 같은 날 AI타임스·지디넷코리아가 국내 첫 보도를 냈다.
9월 21일
Latent Space 창업자 인터뷰, AI매터스·Dale Seo 정리 글.
9월 22일
Zenn ‘다들 Jev 얘기뿐’ — 좋아요 144.
9월 25~27일
일본 실전 글이 몰린 사흘. LLM 증류(25일), 사내 문의 판정(25일), Cloudflare 사이트 검색(26일), 하테나 댓글 가리기(27일).
6써 보기 전에

붙이기 전에 확인할 여섯 가지

독립 벤치 정리 글과 일본 실전 기록에서 공통으로 나온 권고를 추렸다.

확인 0 / 6 · 체크 상태는 이 브라우저에만 저장된다.

자주 묻는 것

1한국어도 잘하나?+

한국어 성능 수치는 확인되지 않았다. 일본에서는 Moji가 일본어 평가 데이터 150건을 무료로 공개해 비교를 시작했다. 한국어 업무에 쓰려면 위 체크리스트의 첫 항목처럼 자기 데이터로 먼저 돌려 보는 수밖에 없다.

영어 벤치 성적을 한국어 업무에 그대로 옮기지 않는다.
2무료로 써 볼 수 있나?+

일본 개발자 글에는 TypeSafe AI의 무료 크레딧 $5로 운영 중이라는 기록이 있다. 입력 단가가 워낙 낮아 소규모 실험은 이 안에서 끝난다. Vercel AI Gateway에도 9월 16일 탑재됐지만, Vercel 공지에는 가격이나 무료 이벤트 문구가 없다.

‘Vercel에서 무료’라는 SNS 글은 공식 공지로 확인되지 않았다. 행사성 무료라면 이미 끝났을 수 있다.
3LLM을 대체하나?+

아니다. 글을 쓰지 못하고, 추론형 문제와 이미지 입력을 다루지 못하며, 왜 그렇게 판단했는지 설명하지 않는다. 대신 LLM이 맡던 ‘분류·채점·예아니요’ 판단을 싸고 빠르게 넘겨받는다.

흐름은 ‘Jev가 먼저 거르고, 애매한 건만 LLM이나 사람에게’다.
4‘환각이 없다’는 말은 믿어도 되나?+

형식에 관해서는 맞다. 허용된 답 밖으로 나갈 수 없다. 하지만 답이 틀릴 수는 있다. 독립 정리 글은 학습 범위 밖 업무에서 확신도와 실제 정답률의 차이(보정 오차)가 0.107이었다고 전했다.

확신도 90%라고 해서 열 번 중 아홉 번 맞는다는 보장은 자기 데이터로 확인하기 전까지 없다.
5[수치 점검] 이 글에서 바로잡은 것+

① 100만 토큰당 0.042달러는 입력 단가다. 출력은 과금이 없다.
② 창업자는 전 OpenAI 연구원이 맞지만, ‘ChatGPT 핵심 개발자’보다는 InstructGPT 논문 공저자 약 20명 중 한 명이 정확하다(ITmedia).
③ ‘X 노출 3,700만’은 X 전체가 아니라 창업자 발표 게시물 하나의 노출 수다(9월 20일 기준).
④ ‘Vercel AI Gateway에서 무료’는 공식 공지에서 확인되지 않았다. $5 크레딧은 개발자 후기로 확인했다.
⑤ 하테나 북마크(203·158)와 ‘쥐에진 인기 글 10개 중 5개’는 트렌드 수집 시점의 관측값으로, 이 글에서 다시 확인하지 못했다. Zenn 좋아요는 9월 28일 API로 확인했다.
⑥ 속도 193.6배·비용 444.6배는 회사가 밝힌 최대치다. 독립 측정은 속도 5~25배다.

필요한 순간, 다시 꺼내 읽으세요.

이 브라우저의 내 보관함에 저장됩니다.

같은 분류의 다른 리포트
09.28미·중 ‘300억 달러’ 관세 합의, 세율도 시행일도 아직 비었다09.28‘인류사 최대 노동 절도’와 개발자 AI 피로, 두 반발이 한 주에 겹쳤다09.26AI가 알려준 명령어, 붙여넣기 전에: 가짜 캡차와 챗GPT 공유 대화 악성코드
연재 읽기지난 방문 이후 새 글
전체 리포트 · 소개 · 개인정보처리방침 · 문의

© 2026 LOCATEWISE · 데이터로 읽는 시장
이 페이지의 내용은 정보 제공을 위한 것이며 투자 권유가 아닙니다. 투자 판단과 그 결과에 대한 책임은 이용자 본인에게 있습니다.