본문 바로가기

IT/AI

GPT-6 Sol·Astra vs Fable 5.1·Opus 5.5 비교: 코딩 성능과 가격 정리

728x90
반응형

새 AI 모델을 고르려고 비교표를 열었는데, 비교표를 다 읽기도 전에 다음 모델이 나옵니다. 이제 모델 이름 외우기도 작은 자격증 시험 같습니다. 이번에는 GPT-6 Sol, GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5를 가격부터 코딩, 리서치, 실제 업무 활용까지 비교해 보겠습니다.

 

기준일은 2026년 9월 23일입니다. 날짜부터 짚으면 Fable 5.1은 9월 1일, Astra는 9월 3일 먼저 공개됐습니다. 이번 Sol 출시와 기존 Astra를 함께 비교하며, Opus 5.5의 공식 발표일 표기는 9월 22일입니다. 네 모델이 모두 같은 날 출시된 것은 아닙니다.

1. 가격과 기본 사양: Sol의 비용 경쟁력이 눈에 띈다

아래는 100만 토큰당 표준 API 가격입니다. 월 구독료가 아니며, 입력은 모델에 보내는 내용, 출력은 모델이 생성하는 내용의 과금 단위입니다. 캐시 읽기는 이전에 처리한 입력을 재사용할 때 적용됩니다.

모델 입력 / 출력 캐시 읽기 컨텍스트
GPT-6 Sol $2 / $10 $0.20 105만 토큰
GPT-6 Astra $10 / $50 $1.00 105만 토큰
Claude Fable 5.1 $10 / $50 $0.25 100만 토큰
Claude Opus 5.5 $4 / $20 $0.20 100만 토큰

일반 입력·출력 단가만 보면 Sol은 Opus 5.5의 절반, Astra와 Fable 5.1의 5분의 1입니다. 반복적인 코드 수정이나 대량 문서 처리에서는 상당히 매력적인 출발점입니다. 다만 실제 작업비는 추론량, 재시도, 캐시 적중률, 도구 사용료에 따라 달라집니다.

 

장문 입력에는 별도 조건이 있습니다. Sol·Astra는 입력이 27만 2천 토큰을 초과하면 해당 요청 전체의 입력·캐시 단가는 2배, 출력 단가는 1.5배가 됩니다. Fable 5.1·Opus 5.5는 100만 토큰까지 장문 할증 없이 기본 단가가 유지됩니다. 긴 저장소나 문서 묶음을 넣는다면 이 차이도 계산해야 합니다. 캐시 쓰기와 Fast 모드 등은 별도 요금 조건이 있습니다.

2. 코딩 성능: Opus 5.5가 강하지만 평가 조건을 보자

다음은 Opus 5.5 공식 발표의 비교표에서 가져온 점수입니다. 터미널 작업 수행, 병합할 만한 코드 변경, 도구를 사용하는 과학 작업을 각각 평가합니다. 모두 점수가 높을수록 좋습니다.

평가 GPT-6 Sol Astra Fable 5.1 Opus 5.5
Terminal-Bench 4.0 — 57.9% 55.8% 66.4%
FrontierCode 1.1 Main — 53.3% 50.3% 54.4%
Terminal-Bench-Science 0.1 — 64.6% 52.6% 58.7%

‘—’는 해당 발표의 비교표에 GPT-6 Sol이 없다는 뜻입니다. 원본 표에 있는 GPT-5.6 Sol을 신형 GPT-6 Sol로 바꿔 적으면 안 됩니다. 모델 이름에서 소수점 하나가 빠지면 비교 대상까지 바뀝니다.

 

또한 동일 조건의 독립 실험은 아닙니다. Terminal-Bench에서 Opus 5.5는 xhigh, Astra는 high 추론 설정이며, 일부 평가는 안전장치 개입 시 다른 모델의 대체 수행을 포함합니다. FrontierCode의 54.4%와 53.3% 같은 작은 차이를 모든 개발 업무의 확실한 우열로 확대해서도 안 됩니다.

GPT-6 Sol: 반복 개발과 비용 관리의 유력 후보

Sol의 별도 발표에서는 AutomationBench 1.0.6에서 xhigh 설정으로 33.2%, 작업당 $0.27을 기록했습니다. 여러 앱을 연결해 실제 업무를 수행하는 평가입니다. 저렴한 모델이라고 단순 문답용으로만 볼 이유는 없습니다.

 

실무에서는 API 구현, 테스트 보완, SQL 수정처럼 여러 번 요청하며 완성하는 작업에 먼저 시험해 볼 만합니다. OpenAI는 내부 사실성 평가에서 이전 Sol 대비 오류가 약 절반으로 줄었다고 밝혔지만, 이는 오류가 발생하기 쉬운 사례를 모은 평가이며 일반 사용의 오류율을 뜻하지 않습니다.

Claude Opus 5.5: Claude Code의 새로운 기본 후보

Opus 5.5는 위 공개 코딩 평가에서 높은 점수를 기록하면서 Fable 5.1보다 일반 토큰 단가가 낮습니다. Anthropic은 Opus 5 대비 출력 생성이 30% 이상 빨라졌고, 기본 설정의 전형적인 작업 비용은 40% 감소했다고 설명합니다. 토큰 단가 자체의 인하율은 20%이므로 두 수치를 구분해야 합니다.

3. Astra와 Fable 5.1은 어떤 작업에 어울릴까?

GPT-6 Astra: 복잡한 문제를 결과물까지 완성하는 선택

Astra는 복잡한 추론, 코딩, 컴퓨터 조작, 리서치와 문서 제작을 겨냥한 모델입니다. 위 과학 작업 평가에서는 세 모델 중 가장 높은 점수를 기록했습니다. 자료를 조사한 뒤 분석하고, 표와 보고서까지 만드는 업무라면 우선 검토할 만합니다.

 

Codex에서는 긴 작업의 앞선 맥락을 검색하고 메모를 유지하는 실험 기능도 소개됐습니다. 대규모 리팩터링에서 이전 실패 원인과 요구사항을 이어 가는 데 초점을 둔 기능입니다. 다만 이는 Codex와 결합된 기능이므로 Astra API를 호출하면 자동으로 같은 작업 환경이 생기는 것은 아닙니다.

Claude Fable 5.1: 어려운 문제에 선택적으로 투입

Fable 5.1은 고난도 추론과 장시간 에이전트 작업을 위한 모델입니다. 다만 비싸다는 이유만으로 항상 먼저 선택할 필요는 없습니다. Anthropic도 대부분의 업무는 Opus 5.5로 시작하고, 높은 추론 설정에서도 자체 평가를 만족하지 못하는 어려운 작업에 Fable 5.1을 검토하도록 안내합니다.

 

따라서 Fable은 장시간 분석이나 복잡한 연구 과제에서 실제 개선을 확인하며 선택하는 편이 합리적입니다. 공식 사양의 상대적 지연 분류도 Fable은 ‘Slower’, Opus 5.5는 ‘Moderate’입니다. 높은 단가와 응답 대기시간을 감수할 만큼 결과가 좋아지는지가 선택 기준입니다.

4. 한국어 글쓰기·이미지·API 연동에서 확인할 점

네 모델 모두 API 기준 텍스트·이미지 입력과 텍스트 출력을 지원하며, 일반 최대 출력은 12만 8천 토큰입니다. 컨텍스트 크기는 한 번에 다룰 수 있는 정보량이고, 최대 출력은 한 번의 응답에서 생성할 수 있는 양입니다. 100만 토큰을 넣을 수 있다고 100만 토큰짜리 답을 받는 것은 아닙니다.

 

이미지를 읽는 능력과 이미지 생성 기능도 구분해야 합니다. 챗봇 앱에 이미지 생성이나 음성 기능이 있더라도, 그것을 이 네 모델의 기본 API 출력 기능으로 해석하면 곤란합니다.

 

한국어 블로그 글쓰기에서는 확인한 공식 자료만으로 네 모델의 확정 순위를 매기기 어렵습니다. 같은 주제와 자료를 주고 사실 오류, 문체, 반복, HTML 형식 준수 여부를 비교하는 편이 낫습니다. 코딩 점수가 높다고 유머 감각까지 자동으로 만점은 아니니까요.

 

개발자는 API 호환성도 확인해야 합니다. Opus 5.5와 Fable 5.1은 thinking이 항상 켜져 있으며, tool_choice의 any 또는 특정 tool 강제 지정은 400 오류를 반환합니다. 모델 ID만 교체하는 작업에서도 기존 도구 호출 설정을 점검해야 합니다.

5. 실제로 무엇을 선택하면 좋을까?

공개 사양과 평가를 바탕으로 한 추천은 다음과 같습니다. 직접 수행한 네 모델의 실사용 순위는 아닙니다.

  • 반복 구현·대량 처리·API 비용 관리: GPT-6 Sol을 먼저 평가합니다.
  • Claude Code 중심의 개발·코드 검토: Opus 5.5를 기본 후보로 둡니다.
  • 깊은 분석·과학 작업·조사부터 문서 완성까지: GPT-6 Astra를 우선 검토합니다.
  • Opus의 높은 추론 설정으로도 해결되지 않는 과제: Fable 5.1의 개선 효과를 확인합니다.

Java·Spring 개발이라면 실제 버그, 트랜잭션 문제, SQL 튜닝 사례를 동일하게 주고 테스트 통과와 수정 범위, 총비용을 비교해 보세요. 평소에는 Sol이나 Opus를 사용하고 막히는 작업에 Astra나 Fable을 추가하는 방식도 가능합니다. 가장 비싼 모델을 늘 켜 두는 것보다, 재작업을 줄여 주는 모델을 골라 쓰는 것이 실속 있습니다.

참고 자료 및 출처

2026년 9월 23일 확인한 공식 자료입니다. 성능표는 Opus 5.5 발표 표를 기준으로 통일했으며, Sol의 별도 평가와 API 사양은 각 모델의 공식 문서를 사용했습니다.

728x90
반응형