본문 바로가기

IT/AI

GPT-6 Astra vs Claude Fable 5.1 비교(코딩,성능,가격 등)

728x90
반응형

AI 모델이 새로 나올 때마다 고민은 비슷하다. “그래서 지금 쓰는 걸 바꿔야 하나?” 발표 자료를 읽으면 둘 다 세계 최고인데, 카드 명세서에는 세계 최고의 구독료가 차곡차곡 쌓인다.

 

이번에는 GPT-6 Astra와 Claude Fable 5.1의 성능, 개발 활용도, API 가격, 구독 조건을 비교해보자. 모델이 잘하는 일과 내 통장에서 나가는 돈은 따로 따져볼 필요가 있다.

 

자료 확인 기준은 2026년 9월 5일이다. 직접 동일 과제를 실행한 사용기가 아니라, 공식 문서와 독립 평가기관의 공개 결과를 대조한 비교다.

GPT6 vs Fable5.1 비교

1. 출시일과 기본 사양부터 정리하자

공식 문서상 GPT-6 Astra는 9월 3일, Claude Fable 5.1은 9월 1일 출시됐다. 날짜는 각사의 공식 문서 표기 기준이다.

항목 GPT-6 Astra Claude Fable 5.1
API 모델명 gpt-6-astra claude-fable-5-1
컨텍스트 창 105만 토큰 100만 토큰
최대 출력 12만 8천 토큰 12만 8천 토큰
기본 입출력 텍스트·이미지 입력 → 텍스트 출력 텍스트·이미지 입력 → 텍스트 출력
지식 기준일 2026년 4월 30일 2026년 6월

 

위 수치는 각사의 API 모델 문서 기준이다. 컨텍스트는 한 번의 요청에서 참고할 수 있는 정보의 범위이며, ChatGPT나 Claude 앱의 대화·파일 한도가 그대로 100만 토큰이라는 뜻은 아니다.

 

또한 모델의 이미지 이해와 별도 도구를 이용한 이미지 생성은 구분해야 한다. “멀티모달이니까 음성·영상까지 전부 직접 처리한다”는 식으로 읽으면 안 된다. Astra 모델 문서도 기본 이미지 입력과 이미지 생성 도구 지원을 별도로 구분한다.

2. 벤치마크: GPT-6 압승이라고 쓰기 어려운 이유

먼저 OpenAI가 공개한 비교표다. 모두 높을수록 좋은 지표다.

평가 GPT-6 Astra Fable 5.1
Terminal-Bench 4.0: 터미널 코딩 57.9% 55.8%
DeepSWE v1.1: 소프트웨어 작업 74.1% 67.4%
AutomationBench: 업무 자동화 41.4% 31.4%
Terminal-Bench Science 0.1: 과학 연구 64.6% 52.6%
FrontierMath Tier 4 v2: 고난도 수학 97.6% 87.8%
Humanity’s Last Exam: 도구 사용 57.2% 65.0%

 

이 표에서는 Astra가 코딩·자동화·과학 분야 여러 항목에서 앞선다. 반면 Humanity’s Last Exam에서는 Fable이 높다. OpenAI는 여러 추론 설정 중 최고 점수를 제시했으며, 연구·API 환경의 결과가 실제 ChatGPT와 다를 수 있다고 명시했다. (OpenAI)

 

그런데 독립 평가기관 Artificial Analysis를 보면 이야기가 더 재미있어진다. 출시 분석의 코딩 에이전트 지수에서는 Astra+Codex가 67점, Fable 5.1+Claude Code가 70점이었다. (Artificial Analysis)

 

9월 5일 확인한 종합 지수인 Intelligence Index v4.2에서도 Astra는 55점, Fable은 57점이다. 양쪽 최대 추론 설정 비교이며, Fable은

기본 폴백 구성을 포함한다. 출시 당시 v4.1.1 점수와 최신 v4.2 점수를 섞어 비교하면 안 된다. (Artificial Analysis)

 

핵심은 간단하다. 특정 코딩 문제의 성적과 개발 도구까지 포함한 작업 성적은 다르다. 실행 환경과 폴백도 다른 만큼, 이 숫자만으로 모든 프로젝트의 승자를 정할 수는 없다.

3. 개발자라면 점수보다 작업 방식도 보자

Astra는 비동기 도구 호출과 작업 도중 요구사항을 바꾸는 기능을 API에서 지원한다. 도구 실행을 기다리는 동안 독립적인 작업을 진행하거나, 이미 수행한 작업을 보존하면서 변경 사항을 반영하는 식이다. 

 

Codex에서는 긴 작업의 이전 문맥을 다시 검색하고 메모를 유지하는 실험 기능도 발표했다. 다만 출시 시점에는 별도 설정으로 활성화하는 기능이므로, 모든 세션에 이미 적용됐다고 생각하면 안 된다. 

 

Fable 5.1을 기존 서비스에 붙일 때는 호환성을 확인해야 한다. tool_choice의 any와 tool은 지원하지 않아 400 오류가 발생한다. 정해진 JSON 형식이 필요하다면 auto와 strict tool use 또는 structured outputs를 검토해야 한다. 모델명만 바꾸는 업데이트가 아닐 수 있다는 뜻이다.

 

예를 들어 Spring 프로젝트를 비교한다면 “코드 개선해줘”보다 “Java 11 유지, 외부 API 변경 금지, 기존 테스트 통과”처럼 완료 조건을 고정하자. 멋진 리팩터링을 해놓고 실행 환경까지 업그레이드해버리면, 똑똑한 동료가 아니라 새로운 프로젝트를 받은 기분이 된다.

4. 속도와 한국어 글쓰기는 따로 평가해야 한다

Artificial Analysis의 최대 추론 설정 비교에서 출력 속도는 Astra가 초당 약 87.5토큰, Fable이 68.7토큰이었다. 하지만 첫 토큰을 받기까지의 대기 시간은 Fable 쪽이 짧았다. 이 수치는 해당 평가 조건의 측정값이지, 모든 질문에서 보장되는 속도는 아니다.

 

따라서 “출력 속도가 빠르다”와 “내가 결과를 빨리 받는다”는 같은 말이 아니다. 추론 시간, 출력 분량, 도구 호출을 함께 봐야 한다.

한국어 블로그 문체의 우열은 이번에 확인한 자료만으로 확정하기 어렵다. 기존 글을 같은 수만큼 제공하고, 번역투·반복 표현·형식 준수·수정 횟수를 비교하는 편이 낫다. 코딩 점수가 높다고 내 블로그 말투까지 자동으로 잘 아는 것은 아니다.

5. API 가격: 기본 단가는 같지만 긴 입력은 다르다

아래는 100만 토큰당 미국 달러 기준이다. Astra는 입력 27만 2천 토큰 이하의 표준 처리 요금이며, 캐시 쓰기·도구 사용료·세금은 별도다.

요금 항목 GPT-6 Astra Fable 5.1
일반 입력 $10 $10
출력 $50 $50
캐시 읽기 $1 $0.25

캐시는 이미 처리한 공통 입력을 재사용하는 기능이다. Fable의 캐시 읽기 단가는 Astra보다 75% 낮지만, 전체 청구액이 75% 저렴하다는 뜻은 아니다.

 

더 큰 차이는 긴 문서다. Astra는 입력이 27만 2천 토큰을 초과하면 요청 전체에 입력·캐시 2배, 출력 1.5배 요금이 적용된다. Fable은 100만 토큰 범위까지 기본 단가를 유지한다.

가령 캐시 없이 각 모델에 입력 50만 토큰과 출력 2만 토큰이 발생했다고 가정하면, 단순 토큰 요금은 Astra $11.50, Fable $6.00이다. 공식 단가를 적용한 계산이며, 같은 문서라도 모델별 토큰 수와 재시도 횟수가 다를 수 있으므로 실제 작업비는 별도로 측정해야 한다.

 

참고로 Anthropic의 “일반 작업 약 25%, 에이전트 작업 최대 약 45% 절감”은 전작 Fable 5 대비 추정치다. GPT-6보다 무조건 45% 싸다는 광고로 읽으면 계산기가 항의한다.

6. 구독료를 냈다고 둘 다 마음껏 쓰는 것은 아니다

GPT-6 Astra는 순차 배포 중이다. 최신 도움말상 ChatGPT의 GPT-6 Pro는 Astra 기반이며, Pro·Business·Enterprise 대상이다. Plus는 Work와 Codex에서 Astra를 순차 제공받는다. 제품별 활성화 시점과 사용량은 다를 수 있고, Pro 요금제도 GPT-6 Pro 무제한 사용을 뜻하지 않는다.

 

Claude도 주의할 부분이 있다. Pro 요금제에는 Fable 5.1 기본 사용량이 포함되지 않아 사용 크레딧으로 결제한다. Max는 기존 주간 한도의 최대 50%를 Fable에 사용할 수 있다. 별도의 한도를 50% 추가로 주는 것이 아니다.

 

결국 월 구독으로 쓸 사람과 API를 서비스에 연결할 사람은 서로 다른 가격표를 봐야 한다.

7. 회사 코드를 넣는다면 데이터 보관도 비교하자

OpenAI는 적격 API 고객에게 Astra의 데이터 무보관, 즉 ZDR을 지원한다고 밝혔다. Fable은 기본적으로 안전 점검을 위한 30일 데이터 보관 정책이 적용되며, 안전 조사나 법적 의무에 따른 예외가 있다.

 

다만 Anthropic도 적격 조직의 내부 업무용 애플리케이션에 한시적 ZDR을 제공하고, 2026년 가을부터 Enterprise Frontier Safeguards를 단계적으로 도입할 계획이다. 모든 계정이 자동으로 무보관이 되는 것은 아니다.

 

“학습에 사용하지 않는다”와 “서버에 보관하지 않는다”는 다른 조건이다. 업무용이라면 성능표보다 먼저 회사의 데이터 반출 기준과 계약 조건부터 확인하자.

 

지피티6vs페이블5 비교

결론: 모델 이름보다 내 작업의 완성 비용을 보자

공개 자료를 바탕으로 한 선택 기준은 이렇다. Codex와 브라우저를 오가는 복합 자동화가 중심이라면 Astra를 먼저 시험해볼 만하다. Claude Code 중심의 개발이나 긴 입력·캐시 재사용이 많은 API 작업이라면 Fable 5.1이 유력하다. 다만 어느 쪽도 모든 코딩·글쓰기 작업의 승자는 아니다.

 

최종 선택은 같은 저장소, 같은 요구사항, 같은 예산으로 비교하자. 테스트 통과율과 총 소요 시간, 사람이 다시 고친 횟수, 실제 청구액까지 기록하면 된다.

 

결국 좋은 AI는 코드를 가장 많이 작성하는 모델이 아니라, 내가 다시 고칠 일을 가장 적게 남기는 모델이다. 벤치마크 1등도 좋지만, 내 퇴근 시간을 지켜주는 쪽이 조금 더 반갑다.

참고 자료

OpenAI: GPT-6 Astra 모델 문서 및 API 요금표. (OpenAI Developers)
Anthropic: Claude Fable 5.1 모델 문서 및 요금 정책. (클로드 플랫폼)
Artificial Analysis: GPT-6 Astra 출시 평가 및 Fable 5.1 직접 비교 페이지. (Artificial Analysis)

 

728x90
반응형