9월 22일 같은 날 · 오퍼스 5.5 $4 / $20 · GPT-6 솔 $2 / $10 (100만 토큰)
GPT-6 솔 vs 오퍼스 5.5, 같은 날 나온 두 AI 무엇이 다른가
앤트로픽은 최상위급 성능을 60% 싼 값에 내놨고, 오픈AI는 솔·루나로 AI 작업을 계층별로 나눠 맡기는 가격표를 짰다. 회사 발표와 독립 평가를 나눠 읽으면, 누가 이겼다는 결론은 아직 이르다.
동이2026년 9월 23일 오전 기준읽는 데 약 10분
같은 100만 토큰 출력, 0.5달러에서 50달러까지 100배단위: 달러
각 사 API 정가(100만 토큰당). 캐시 읽기 할인·배치 할인·국내 부가세는 넣지 않았다. 제미나이 3.8 플래시는 12월 31일까지의 프로모션가이며 점선이 2027년 가격이다. 막대에 마우스를 올리면 입력·출력 단가가 보인다.
1오퍼스 5.5는 같은 회사 최상위 페이블 5.1보다 토큰 단가가 60% 싸다. 앤트로픽 표로는 코딩·지식노동 여러 항목에서 페이블 5.1을 앞섰고, 독립 기관 Vals의 터미널벤치 4.0에서도 1위(61.62%)다.
2GPT-6 솔은 오퍼스 5.5의 정확히 절반, 루나는 출력 단가 1/40이다. 오픈AI의 카드는 최고 점수보다 "싼 모델에 많이, 비싼 모델에 조금" 맡기는 계층 분업이다.
3두 회사 모두 상대의 신형과는 비교하지 않았다. 앤트로픽은 GPT-5.6 솔·아스트라와, 오픈AI는 오퍼스 5·페이블 5와 비교했다. Vals 종합 지수 1위는 여전히 페이블 5.1(68.83%)이다.
클로드 오퍼스 5.5입력 / 출력 · 100만 토큰$4 / $20오퍼스 5 대비 −20%
GPT-6 솔입력 / 출력 · 100만 토큰$2 / $10GPT-5.6 솔 대비 −50%
GPT-6 루나입력 / 출력 · 100만 토큰$0.10 / $0.50GPT-5.6 루나 $0.20 / $1.20
GPT-6 아스트라9월 4일 API 공개$10 / $50페이블 5.1과 같은 값
터미널벤치 4.0 (Vals 독립)오퍼스 5.5 · 아스트라61.62% · 57.07%31개 모델 중 1·2위
Vals 종합 지수1위 페이블 5.168.83%오퍼스 5.5 66.16%(4위)
가격은 각 사 발표·API 문서 기준, 벤치마크는 앤트로픽·오픈AI 발표와 Vals AI 공개 순위를 옮겼다. 출시 하루 뒤라 같은 조건에서 GPT-6 솔과 오퍼스 5.5를 직접 잰 독립 평가는 아직 적다.
1라인업
같은 날, 서로 다른 카드
이번에 나온 것은 오픈AI의 GPT-6 솔·루나와 앤트로픽의 클로드 오퍼스 5.5다. GPT-6 아스트라는 이보다 앞선 9월 3일에 발표됐다. 오픈AI는 아스트라에 쓴 학습·정렬 기술을 솔과 루나에 옮겼다고 설명했고, 앤트로픽은 오퍼스 5.5를 "클로드 5.5 제품군의 첫 모델"로 내놓으면서 소네트 5.5·하이쿠 5.5가 수주 안에 뒤따른다고 밝혔다.
층위
오픈AI
앤트로픽
구글
최상위
GPT-6 아스트라 ($10 / $50)
클로드 페이블 5.1 ($10 / $50)
이 글에서 다루지 않음
주력 고성능
GPT-6 솔 ($2 / $10) · 새로 나옴
클로드 오퍼스 5.5 ($4 / $20) · 새로 나옴
—
저가 대량
GPT-6 루나 ($0.10 / $0.50) · 새로 나옴
소네트 5.5 · 하이쿠 5.5 예정
제미나이 3.8 플래시 ($0.75 / $3.75)
이번 전략
단가를 반으로 — 성능 대비 가격
최상위급 성능을 오퍼스 가격으로
9월 2일 출시, 가격 대비 성능
9월 2일
제미나이 3.8 플래시 출시. 입력 $0.75 · 출력 $3.75는 12월 31일까지의 프로모션가이고 이후 $1.50 / $7.50이다.
9월 3~4일
GPT-6 아스트라 발표(3일), API 공개(4일). $10 / $50, 컨텍스트 약 105만 토큰. 회사가 밝힌 브라우즈컴프 91.5, 터미널벤치 사이언스 64.6.
9월 22일
오퍼스 5.5와 GPT-6 솔·루나가 같은 날 나왔다. 오퍼스 5.5는 입력·출력 단가 20% 인하, 캐시 읽기 $0.50 → $0.20(−60%), 출력 속도 30% 이상 향상. 솔은 GPT-5.6 솔의 $4 / $20에서 절반으로 내려왔다.
수주 안
클로드 소네트 5.5 · 하이쿠 5.5. 앤트로픽이 "앞으로 몇 주 안에" 낸다고만 밝혔다. 가격은 아직 없다.
숫자를 하나 짚어 둔다. 오픈AI는 솔·루나를 "50% 인하"라고 했지만 루나 출력은 $1.20 → $0.50으로 58% 인하다. 입력($0.20 → $0.10)만 정확히 절반이다. 그리고 앤트로픽이 말한 "40% 저렴"은 토큰 단가가 아니라 일반 작업 기준으로 회사가 계산한 운영 비용이다 — 토큰 단가 인하는 20%이고, 나머지는 토큰을 덜 쓰는 데서 나온다는 설명이다.
2벤치마크
회사 표와 독립 평가, 순위는 같고 격차는 달랐다
코딩 에이전트 능력을 재는 터미널벤치 4.0은 두 곳에서 모두 잴 수 있는 드문 항목이다. 앤트로픽 발표 표에서 오퍼스 5.5는 66.4%로 아스트라(57.9%)를 8.5%p 앞섰다. 독립 평가 기관 Vals AI의 측정에서도 1위였지만 차이는 4.55%p로 절반 가까이 줄었다. 앤트로픽도 실행 설정(effort)이 모델마다 다르다는 점을 표에 밝혀 두었다.
오퍼스 5.5는 두 표 모두 1위, 격차는 독립 평가에서 절반단위: %
위: 앤트로픽 9월 22일 발표 표(회사 측정). 아래: Vals AI 터미널벤치 4.0 공개 순위(9월 23일 확인). 두 측정은 실행 설정과 시도 횟수가 달라 숫자를 직접 빼거나 더하면 안 된다. 막대에 마우스를 올리면 값이 보인다.
다른 항목은 이렇게 갈린다. 앤트로픽 표와 아스트라 자체 발표값을 나란히 옮겼다. 에이전트 자동화(AutomationBench)와 과학 계산(터미널벤치 사이언스)은 아스트라가 앞선다.
항목
오퍼스 5.5
아스트라
페이블 5.1
앞선 쪽
프런티어코드 1.1 (코딩)
54.4
53.3
50.3
오퍼스 5.5 (근소)
GDPval-AA 2.1 (지식노동 · 엘로)
1846
1542
1735
오퍼스 5.5
오토메이션벤치 (업무 자동화)
40.0
41.4
31.4
아스트라
터미널벤치 사이언스 0.1
58.7
64.6
52.6
아스트라
OS월드 2.0 (컴퓨터 사용)
81.8
설정 다름
80.7
아스트라 72.6은 오프라인 부분 점수로 조건이 다르다
Vals 종합 지수 (독립)
66.16
66.61
68.83
페이블 5.1
오퍼스 5.5·페이블 5.1 값과 아스트라의 앞 네 항목은 앤트로픽 발표 표, 오토메이션벤치·사이언스 아스트라 값은 오픈AI 자체 발표와 같다. Vals 종합 지수만 제3자 측정이다.
GPT-6 솔은 이 표에 없다. 오픈AI는 솔을 오퍼스 5·페이블 5와 비교했다 — 오토메이션벤치에서 솔(xhigh)은 33.2%로 오퍼스 5(26.9%)를 넘었고 작업당 비용은 $0.27, 오퍼스 5의 9% 수준이었다. 딥SWE 1.1에서는 솔(max) 68.8%로 페이블 5에 근접하면서 작업당 비용은 약 80% 낮았다고 밝혔다. 루나(max)도 66.6%를 냈다. 솔과 오퍼스 5.5를 같은 조건에서 잰 결과는 아직 어느 쪽도 내놓지 않았다.
숫자 밖의 사례도 있다. 앤트로픽은 초기 사용자가 68만 줄 코드 마이그레이션을 하루 안에 끝냈고, 20만 줄 코드베이스 감사(audit)가 이전 20시간 이상에서 3시간 미만으로 줄었다고 소개했다. 기업 실적을 웹에서 찾아 보고서로 만드는 시험에서는 숫자·인용이 하나라도 틀리면 탈락시키는 기준으로 18번 중 16번을 통과했고(페이블 5.1·오퍼스 5는 0번), 가상 M&A 분석은 93분 → 63분, 비용 50% 감소였다. 모두 회사가 고른 사례다. 오픈AI는 솔의 사실 오류가 이전 세대의 약 절반이라고 했다.
3분업
한 명의 천재인가, 계층 조직인가
오픈AI 가격표의 뜻은 "모든 작업을 최상위 모델에 맡기지 말라"는 것이다. 작업 100건을 수집·분류, 분석, 최종 판단으로 나눠 단가가 다른 모델에 맡기면 혼합 단가가 어떻게 되는지 따라가 본다. 장면을 따라 내려가면 그림이 바뀐다.
작업을 나누면 단가는 50달러에서 4.40달러로단위: 달러
최종 판단 5%만 아스트라에 남기면 혼합 단가 $4.40 — 전부 아스트라의 8.8%다.
장면 1 · 기준
전부 최상위 모델에 맡기면
가장 단순한 설계는 모든 요청을 가장 좋은 모델로 보내는 것이다. 아스트라 출력 단가는 100만 토큰당 $50. 품질은 가장 높지만, 뉴스 3,000건을 분류하는 일에도 같은 값을 낸다.
장면 2 · 루나 80%
수집·분류는 가장 싼 모델로
중복 제거, 분류, 초벌 요약 같은 반복 작업 80%를 루나($0.50)로 넘긴다. 80% × $0.50 = $0.40. 오픈AI는 루나(max)가 딥SWE에서 66.6%를 냈다고 밝혔다 — 쉬운 일에 충분한지 먼저 시험해 볼 값이다.
장면 3 · 솔 15%
분석과 초안은 솔에게
자료 비교, 추가 조사, 초안 작성 15%를 솔($10)에 맡긴다. 15% × $10 = $1.50. 오픈AI가 이번 발표의 핵심으로 내세운 모델이고, 사실 오류가 이전 세대의 절반이라는 설명이 붙었다.
장면 4 · 아스트라 5%
최상위 모델은 마지막 5%에만
교차 검증과 최종 판단 5%만 아스트라에 남긴다. 5% × $50 = $2.50. 셋을 더한 혼합 단가는 $4.40, 전부 아스트라일 때의 8.8%다.
장면 5 · 앤트로픽의 답
마지막 칸을 오퍼스 5.5로 바꾸면
앤트로픽의 전략은 이 마지막 칸을 싸게 만드는 쪽이다. 최종 5%를 오퍼스 5.5($20)로 바꾸면 $1.00, 합계 $2.90. 오퍼스 하나에 장시간 코딩 작업을 통째로 맡기는 쓰임에서는 계층을 나누지 않아도 된다는 것이 앤트로픽의 주장이다.
이 그림은 출력 단가만으로 만든 단순 모형이다. 실제로는 같은 작업에도 모델마다 쓰는 토큰 수·재시도 횟수·입력 비중이 달라 비율이 바뀐다. 앤트로픽이 오퍼스 5.5의 강점으로 "더 적은 단계와 토큰"을 내세운 것도 그래서다.
4계산기
내 사용량이면 한 달에 얼마인가
한 달에 쓰는 입력·출력 토큰(백만 단위)과 캐시 적중 비율을 넣으면 여섯 모델의 API 정가 비용이 나온다. 캐시 읽기 단가는 각 사 공개값이며, 제미나이는 캐시 단가를 확인하지 못해 할인을 적용하지 않았다.
기준 모델 월 비용 (API 정가)
원화 (1,380원/달러)42만 1,000원
같은 양을 아스트라로 할 때 대비39.4%
같은 양을 루나로$7.75
GPT-6 아스트라
$775.00
클로드 페이블 5.1
$756.25
클로드 오퍼스 5.5
$305.00
GPT-6 솔
$155.00
제미나이 3.8 플래시
$75.00
GPT-6 루나
$7.75
캐시 쓰기 할증·배치 할인·장문 컨텍스트 할증·부가세는 넣지 않았다. 같은 작업이라도 모델마다 쓰는 토큰 수가 달라서, 토큰 양을 고정한 이 계산은 "단가 비교"이지 "작업당 비용 비교"가 아니다.
5원문 점수 다시 매기기
"종합 98.8점"은 누구의 가중치인가
이 글의 바탕이 된 원문은 다섯 모델에 용도별 실사용 점수를 매기고 리서치 20 · 코딩 20 · HTML·웹 15 · 투자분석 15 · 콘텐츠 10 · 에이전트 20의 가중치로 종합했다. 여러 벤치마크를 참고했다지만 측정값이 아니라 작성자의 판단이다. 가중치를 바꾸면 순위가 어떻게 흔들리는지 직접 움직여 볼 수 있게 옮겼다. 원문에 따로 있던 '비용효율' 점수도 가중치 0으로 넣어 두었다.
클로드 오퍼스 5.598.651위
클로드 페이블 5.197.702위
GPT-6 아스트라96.953위
GPT-6 솔92.754위
제미나이 3.8 플래시92.605위
막대는 85점부터 그렸다. 기본값(원문 가중치)에서 계산하면 오퍼스 5.5는 원문 표기 98.8이 아니라 98.65, 솔은 93.0이 아니라 92.75다(아래 [수치 점검] 1).
6용도별 선택
무엇을 할 때 어느 모델부터 시험할까
원문의 용도별 선택표를 확인된 수치에 맞춰 네 갈래로 다시 묶었다. 정답표가 아니라 먼저 시험해 볼 순서다. 좌우 화살표 키로도 넘길 수 있다.
장시간 코딩 에이전트
오퍼스 5.5부터. 터미널벤치 4.0이 회사 표(66.4%)와 Vals 독립 평가(61.62%) 양쪽에서 1위이고, 프런티어코드·커서벤치도 앞섰다.
대형 코드베이스
68만 줄 마이그레이션 하루 미만, 20만 줄 감사 3시간 미만은 앤트로픽이 소개한 초기 사용자 사례다. 내 저장소에서 같은 과제로 재 보는 것이 먼저다.
웹앱·HTML 제작
Vals 바이브 코드 벤치(요구사항만 주고 동작하는 앱을 처음부터 제작)는 페이블 5가 90.35%로 1위, 아스트라 89.59%였고, 오퍼스 5.5는 Vals 모델 페이지에서 98개 중 2위로 올라 있다. 상위권 차이는 1%p 안쪽이다.
비용이 먼저라면
솔은 딥SWE 68.8%(max)를 오퍼스 5.5의 절반 단가로 낸다. 반복 수정·테스트처럼 호출이 많은 단계에 먼저 넣어 볼 만하다.
기업·산업 보고서
오퍼스 5.5. 숫자·인용 하나만 틀려도 탈락인 실적 보고서 시험 18번 중 16번 통과, GDPval-AA 1846으로 지식노동 항목 1위(회사 측정).
순위는 바뀌지 않지만, 솔의 93.0은 반올림으로도 나오지 않는 값이다. 5장의 가중치 도구는 다시 계산한 값을 보여 준다.
2[수치 점검] 바이브 코드 벤치 90.35%는 페이블 5.1이 아니라 페이블 5의 점수다+
Vals 바이브 코드 벤치 1.1 페이지는 "Claude Fable 5 leads at 90.35%"라고 적고 있다. 아스트라 89.59%, 오퍼스 5 88.40%는 원문과 같다. 원문의 "오퍼스 5.5 90.29%"는 페이지 본문에서 확인하지 못했고, Vals 모델 페이지에는 오퍼스 5.5가 98개 모델 중 2위로 올라 있다.
상위권이 1%p 안에 몰려 있어 "HTML 제작은 누가 1위"라고 말하기 어려운 항목이다.
3[수치 점검] "20만 줄 코드베이스 수정 20시간 → 3시간"은 감사(audit) 사례다+
앤트로픽이 소개한 사례는 20만 줄 코드베이스 감사가 20시간 이상에서 3시간 미만으로 줄었다는 것이고, 수정 작업 사례는 따로 68만 줄 마이그레이션을 하루 안에 끝냈다는 것이다. 사내 C → 러스트 이전 9.5시간·비용 51% 절감, 딜로이트 시험 버그 탐지 72%(이전 56%)도 함께 소개됐다.
모두 회사가 고른 초기 사용자 사례라 일반화에는 주의가 필요하다.
4[수치 점검] 엑셀 모델링 76.7 · 72.2 · 71.7은 확인되지 않았다+
Vals 엑셀 모델링 벤치 페이지(스크래치 모드)의 상위는 페이블 5.1 72.6% · 오퍼스 5 72.3% · GPT-5.6 솔 69.1%다. 원문의 페이블 5.1 76.7%, 제미나이 72.2%, 아스트라 71.7%는 다른 모드이거나 갱신 전 값일 수 있어 본문에 쓰지 않았다.
같은 벤치마크도 모드·시점에 따라 값이 다르다. 인용할 때는 모드와 확인 날짜를 함께 적어야 한다.
5왜 회사 표와 독립 평가가 다르게 나오나+
회사 발표는 대개 가장 높은 추론 강도, 회사가 최적화한 실행 환경에서 잰다. 앤트로픽은 오퍼스 5.5 표에 모델별 effort 설정이 다르다고 적었고, 오픈AI의 솔 수치도 xhigh·max 설정이다. Vals 같은 제3자는 같은 환경에서 다시 잰다.
터미널벤치 4.0처럼 두 쪽 값이 모두 있는 항목에서는 순위가 같았다. 순위가 같아도 격차는 회사 표에서 더 크게 나오는 경향이 있다.
6확인하지 못해 본문에서 뺀 수치+
원문에 있었지만 원자료로 확인하지 못한 값: 오퍼스 5.5 Vals 바이브 코드 90.29% · 파이낸스 에이전트 2 58.59%(Vals 페이지에는 63개 중 8위만 확인) · 페이블 5 딥SWE 69.9% · 깃허브가 밝혔다는 "더 적은 단계와 토큰" 평가 · 페이블 5.1 HLE 65.0%와 12만8,000 토큰 출력 · 제미나이 3.8 창작 글쓰기 평가.
원문의 인용 번호는 원문 링크가 아니어서 수치마다 다시 찾았다. 찾은 값만 본문에 두었다.