모델 801건 · 국산 131 · 가격 643 추적 중
파운데이션 모델·LLM

클로드 오퍼스와 GPT, 3D 코딩 생성 비교 테스트

AI타임스·2026-09-23

요약

AI 모델 라우팅 업체 AI/ML이 앤트로픽과 오픈AI의 API를 통해 클로드 오퍼스 5.5와 GPT-6 솔에 동일한 프롬프트를 입력해 3D 애니메이션 생성 결과를 비교했다. 테스트에는 움직이는 물고기 떼, 소용돌이, 폭풍 속의 배, 쓰나미 등 4가지 프롬프트가 사용됐으며 지시문은 단 한 단어로 간결하게 주어졌다. 비교 결과 두 모델의 결과물 퀄리티와 비용은 서로 엇갈린 양상을 보였다.

큐레이터 노트

원문에 없는 맥락입니다

이 비교는 AI 모델 라우팅 서비스 업체가 자체적으로 실시한 테스트로, 독립 기관의 표준 벤치마크와는 성격이 다르다.

깊이 읽기

이 기사 한 건이 아니라, 같은 사안을 다룬 이 사이트의 기록을 근거로 정리했습니다

이 일이 어디서 왔나

같은 매체가 9월 6일 보도한 아레나 코딩 부문에서는 오픈AI의 'GPT-6 아스트라'가 앤트로픽의 클로드를 처음으로 제쳤고, 9월 10~11일에는 앤트로픽과 AWS가 각각 토큰 단가가 아닌 '작업당 실제 비용'으로 모델을 비교해야 한다는 가이드를 잇달아 내놨다. 이번 3D 코딩 비교는 이런 흐름 속에서 나온 것으로, 이번에는 벤치마크 점수가 아니라 API 라우팅 업체가 실제 생성물의 퀄리티와 비용을 직접 견줘봤다는 점이 다르다.

짚어야 할 점

  • AWS와 앤트로픽이 각각 강조한 '정답당 비용', '작업 완료당 총비용' 기준이 이번 3D 생성 테스트에도 그대로 적용된 셈이다 — 결과물 품질과 비용이 한쪽으로 쏠리지 않고 엇갈렸다는 점은 두 회사의 주장과 궤를 같이한다.
  • 9월 6일 아레나 코딩 순위에서는 GPT-6 계열이 앤트로픽을 앞섰는데, 이번 3D 생성 비교에서는 클로드 오퍼스 5.5와 GPT-6 솔의 결과가 엇갈렸다는 점에서 코딩 영역별로 우위가 다르게 나타날 수 있음을 시사한다.
  • 테스트를 진행한 주체가 앤트로픽·오픈AI가 아닌 AI 모델 라우팅 업체라는 점, 그리고 프롬프트가 단 한 단어로 극히 단순했다는 점은 결과 해석에 신중함이 필요한 대목이다.

아직 확인되지 않은 것

  • 결과물 '퀄리티'를 어떤 기준으로, 누가 평가했는지는 확인되지 않았다.
  • 두 모델의 실제 비용이 구체적으로 얼마였고 어느 쪽이 더 저렴했는지 수치는 확인되지 않았다.
  • AWS 비교에서 지적된 것처럼 이번 테스트에서도 추론 기능 활성화 여부 등 모델 설정이 동일하게 통제됐는지는 확인되지 않았다.

다른 매체는 이렇게 썼다

같은 사안을 다룬 다른 곳의 보도입니다

토큰 가격 아닌 '정답당 비용'으로 AI 모델 비교해야
AWS ML Blog · 2026-09-11

AWS는 Amazon Bedrock의 OpenAI 모델(gpt-5.6-luna, gpt-5.6-terra, gpt-5.6-sol)과 OpenAI API의 gpt-5.4-mini, gpt-5.4-nano를 오픈소스 벤치마킹 도구로 비교한 결과를 공개했다. 단순 토큰 가격이 아니라 정답 하…

이 사안의 흐름

같은 주제를 다룬 이 사이트의 기록 — 최신순

이 글에 나온 말

용어집 전체 →
벤치마크
AI 모델의 성능을 정량적으로 측정하고 서로 비교할 수 있도록 표준화한 평가용 문제 집합과 채점 기준을 말한다.
프롬프트
AI 모델에게 원하는 작업을 지시하기 위해 입력하는 텍스트를 말한다.
API
API는 서로 다른 소프트웨어가 기능이나 데이터를 주고받을 수 있도록 정해 놓은 규칙과 창구를 말한다.
토큰
언어 모델이 텍스트를 처리할 때 사용하는 최소 단위로, 단어나 단어의 일부, 문장 부호 등을 가리키는 말이다.

이 페이지는 원문을 요약·재서술하고 이 사이트가 쌓은 기록을 덧붙인 큐레이션입니다. 원문 본문은 싣지 않으며, 수치와 표기는 원문 기준을 유지했습니다.

AI타임스 원문 전체 보기 →

같은 분야의 다른 소식

전체 뉴스 →