모델 비교 · 영상 게시 2026-09-23 · 3분 58초

Opus 5 vs Opus 5.5: 가격 인하와 실제 품질 비교

Opus 5.5의 토큰 단가는 20% 내렸고 40%는 작업당 비용 추정치입니다. 공식 사례와 SonarSource Java 평가, 제작자 데모를 구분해서 살펴봤습니다.

Opus 5.5가 Opus 5보다 작업 비용을 40% 줄였다는 이야기가 X에서 빠르게 퍼졌는데, 정작 API 토큰 단가는 20%만 내렸습니다. 이 영상에서는 두 모델의 가격표와 공개된 비교 사례, 제3자 평가, 제작자 데모를 나눠 보면서 "더 싸고 더 잘한다"는 말이 어디까지 맞는지 확인했습니다. 모델 업그레이드를 검토하면서 숫자의 출처를 구분하고 싶은 분께 맞는 내용입니다. 아래 수치는 모두 영상 게시 시점(2026-09-23) 기준입니다.

40%는 토큰 단가가 아니다

비교 기준은 Opus 5입니다. API 단가는 백만 토큰당 다음과 같이 바뀌었습니다.

  • 입력: 5달러 → 4달러 (20% 인하)
  • 출력: 25달러 → 20달러 (20% 인하)
  • 캐시 읽기: 0.50달러 → 0.20달러 (60% 인하)

캐시 읽기는 에이전트 작업에서 자주 쓰이는 항목이라 인하 폭이 체감에 크게 작용합니다. Anthropic이 말한 "약 40%"는 기본 설정의 전형적인 업무에서 작업당 비용이 그만큼 낮다는 추정치로, 캐시 요금과 작업에 쓰는 토큰 수까지 반영한 값입니다. 즉 "토큰당 40% 싸다"는 뜻이 아닙니다. Anthropic은 출력 속도도 Opus 5보다 30% 이상 빠르다고 발표했습니다.

출시 반응도 컸습니다. Claude 공식 X 게시물은 공개 미러 스냅샷 기준 조회 약 1,290만 회를 기록했습니다. 영상은 반응이 크다는 것은 화제라는 뜻일 뿐, 성능이 검증됐다는 뜻은 아니라고 짚었습니다. 오프닝에서 언급한 "High 추론으로 4시간 넘게 돌려도 주간 사용량이 6% 정도만 줄었다"는 이야기는 출처를 따로 확인하지 못한 보고이고, 주간 구독 사용량은 API 토큰 비용과 다른 지표입니다.

Anthropic이 공개한 비교 사례

Anthropic이 소개한 초기 테스터 사례에서는 20만 줄 규모 코드베이스를 감사하고 수정하는 데 Opus 5.5는 3시간이 채 걸리지 않았고 Opus 5는 20시간 넘게 걸렸습니다. Opus 5의 토큰 사용량은 5.5의 약 2.5배였다고 합니다.

지식 업무 사례도 있습니다. 두 모델에게 가상의 HR 소프트웨어 회사 인수안을 검토하고 Excel 재무 모델과 임원용 발표 자료를 만들게 했습니다. 결론은 같았지만 Anthropic은 5.5의 재무 모델이 더 상세하고 발표 자료도 읽기 쉬웠다고 설명합니다. 걸린 시간은 Opus 5가 93분, 5.5가 63분이었고 비용은 5.5가 절반이었다고 합니다. 같은 과제에서 시간과 비용을 함께 공개한 점은 유용하지만, 회사가 만든 사례라는 점을 함께 봐야 합니다.

SonarSource Java 평가: 좋아진 것과 나빠진 것

다른 관점의 자료는 SonarSource의 Java 평가입니다. 실행 테스트가 있는 544개 과제에 같은 평가 틀을 썼고, 통과율은 Opus 5가 88.6%, Opus 5.5가 87.7%로 거의 같았습니다. 5.5는 코드 줄 수가 27.5%, 토큰 사용량이 40% 적었습니다.

반면 같은 평가에서 버그 밀도는 12%, 동시성 관련 지적은 44% 늘었습니다. 영상은 이 결과를 "더 잘한다"는 한 줄 요약 대신, 어떤 항목이 좋아지고 어떤 항목이 나빠졌는지 보여 주는 비교로 소개했습니다. 다만 한 회사의 자체 평가이므로 모든 코드 업무에 일반화할 수는 없습니다.

제작자 데모와 다른 모델 비교

실제 결과 화면도 여럿 공개됐습니다. Matthew Berman은 Opus 5.5로 샌프란시스코를 Unreal Engine에 재현했다고 밝혔는데, 사람과 차량의 행동은 Jev가 맡았습니다. 한 러시아 채널은 Opus 5.5로 만든 3D 수족관을, CodeRabbit은 Opus 5.5와 Astra, Fable 5.1이 만든 게임을 나란히 보여 줬습니다. 눈에 띄는 사례지만 통제된 성능 시험과는 구분해야 합니다.

Boris Cherny의 글은 Opus 5가 아니라 Fable 5.1과의 내부 비교입니다. 두 모델에게 C로 작성된 HAProxy를 Rust로 옮기게 했고 둘 다 기존 회귀 테스트를 거의 통과했습니다. Opus 5.5는 9시간 30분, Fable 5.1은 12시간이 걸렸고 비용은 5.5가 51% 적었다는 설명입니다. 이것도 회사 내부 시험입니다.

공식 자료: Anthropic Opus 5.5 발표, Anthropic Opus 5 발표

정리

  • 입력·출력 토큰 단가는 20%, 캐시 읽기 단가는 60% 내렸습니다.
  • "작업 비용 40% 절감"은 캐시와 토큰 사용량까지 반영한 Anthropic의 추정치이며 토큰 단가 인하율이 아닙니다.
  • SonarSource 평가에서 통과율은 거의 같았고 토큰은 40% 적었지만, 버그 밀도는 12%, 동시성 지적은 44% 늘었습니다.
  • 회사 사례, 제3자 평가, 제작자 데모는 성격이 다르므로 따로 읽어야 합니다. 가격 인하와 품질 평가도 분리해서 판단하는 것이 좋습니다.

영상: 유튜브에서 보기 · 정정 요청: dante@quokkalabs.net