이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
GPT-6 아스트라 ARC-AGI-3, 98.6%와 62.7%의 차이
같은 시험을 본 같은 모델의 점수가 98.6%와 62.7%로 갈렸습니다. 둘 다 틀린 숫자가 아닙니다. GPT-6 아스트라(GPT-6 Astra)의 ARC-AGI-3 성적이 그렇게 나왔습니다.
OpenAI는 2026년 9월 3일 새 대표 모델 GPT-6 아스트라를 공개하면서 ARC-AGI-3 점수를 98.6%로 제시했습니다. 같은 날 이 벤치마크를 만든 ARC Prize가 직접 돌린 결과는 조건에 따라 62.7%와 99.9%로 나뉘었습니다.
차이를 만든 것은 모델이 아니라 모델을 감싼 실행 환경, 이른바 하니스(harness)였습니다. 어떤 방식으로 문제를 풀게 했는지에 따라 37%포인트가 움직였습니다.
이 글에서는 발표된 수치와 검증된 수치를 나란히 놓고, 점수가 갈린 이유와 나머지 벤치마크·가격·안전성 발표를 순서대로 정리하겠습니다. 추론 능력을 다룬 발표를 읽을 때 어디를 봐야 하는지도 함께 짚습니다.
👉 핵심은 “AI가 몇 점을 받았나”가 아니라 “어떤 조건에서 받은 점수인가”입니다.

▲ 같은 모델, 같은 시험, 다른 조건. 이번 발표의 핵심은 여기에 있습니다
📑 목차 (클릭하면 해당 위치로 이동합니다)
OpenAI가 9월 3일 발표한 것
Q. GPT-6 아스트라는 언제 공개됐고 무엇이 달라졌나요?
A. 2026년 9월 3일 오전 11시(미국 태평양시)에 공개된 OpenAI의 새 대표 모델입니다. OpenAI는 추론이 필요한 여러 벤치마크에서 이전 모델 GPT-5.6 솔(Sol)을 크게 앞섰다고 밝혔고, ARC-AGI-3 점수로 98.6%를 제시했습니다. 벤처비트(VentureBeat)의 2026년 9월 3일 보도 기준입니다.
발표에서 가장 많이 인용된 문장은 그레그 브로크먼(Greg Brockman) OpenAI 공동창업자 겸 회장의 “AGI 시대에 온 것을 환영한다”였습니다. 에이든 클라크(Aidan Clark)는 솔에서 아스트라로 넘어오는 폭이 이전 세대 교체보다 크다고 설명했고, 미아 글리즈(Mia Glaese)는 사용자가 곧바로 쓸 수 있는 능력의 범위가 넓어졌다는 쪽을 강조했습니다.
눈여겨볼 대목은 발표의 무게가 ‘지식’이 아니라 ‘처음 보는 문제를 푸는 능력’에 실렸다는 점입니다. ARC-AGI 계열 벤치마크는 학습해 둔 답을 꺼내는 능력이 아니라, 처음 보는 규칙을 스스로 찾아내는 능력을 재도록 설계된 시험입니다. 그래서 이 숫자가 오르면 코딩·수학·과학처럼 논리를 밀고 나가야 하는 작업의 성능 기대치도 함께 올라갑니다.
💡 핵심 정의
ARC-AGI-3는 비영리 재단 ARC Prize가 운영하는 벤치마크로, 모델이 처음 접하는 추상적·시각적 문제를 스스로 규칙을 찾아 풀게 하는 시험입니다. 암기한 지식으로는 점수가 오르지 않도록 설계된 것이 특징이며, 채점은 문제를 공개하지 않는 세미프라이빗(Semi-Private) 세트로도 함께 이뤄집니다.
점수가 두 개로 갈린 이유
Q. 62.7%와 99.9%는 왜 같은 모델에서 나왔나요?
A. 모델을 어떤 실행 환경에 얹어 문제를 풀게 했는지가 달랐기 때문입니다. ARC Prize가 2026년 9월 3일 공개한 결과에서, 표준(Standard) 환경에 얹은 아스트라(max)는 세미프라이빗 기준 62.7%였고, 제공사 어댑터(Provider Adapter) 환경에 얹은 아스트라(high)는 99.9%였습니다. 모델 가중치는 같고 감싼 방식만 다릅니다.
두 환경의 차이는 ‘앞서 한 생각을 얼마나 그대로 가져갈 수 있는가’에 있습니다. ARC Prize의 설명에 따르면 표준 환경은 모델이 이어서 쓸 메모를 스스로 골라 남기는 방식입니다. 제공사 어댑터 환경은 요청과 요청 사이에 겉으로 드러나지 않는 추론 상태를 그대로 보존하고, 대화가 길어지면 압축해 관리하면서 앞선 작업을 다시 활용하게 해줍니다.
| 실행 환경 | 설정 | ARC-AGI-3 점수 | 평가 비용 |
|---|---|---|---|
| 표준(Standard) | 아스트라 max | 62.7% | 2만 6,098달러 |
| 제공사 어댑터(Provider Adapter) | 아스트라 high | 99.9% | 1만 8,817달러 |
| OpenAI 자체 발표 | 공개 자료 기준 | 98.6% | 공개되지 않음 |
※ 자료 : ARC Prize 블로그 ‘OpenAI’s GPT-6 Astra on ARC-AGI-3′(2026년 9월 3일), 벤처비트 2026년 9월 3일 보도. 점수는 세미프라이빗 세트 기준. (모바일에서는 표를 좌우로 밀어 보세요)
더 잘 풀면서 더 싸고 빨랐다
흔히 점수가 오르면 비용도 오른다고 생각하기 쉬운데, 이번에는 반대였습니다. ARC Prize 집계로 제공사 어댑터 환경이 표준 환경보다 전체 소요 시간이 약 3.66배 짧았고, 167개 게임·추론 쌍을 기준으로 총 토큰 사용량이 49% 줄었습니다. 평가 비용도 1만 8,817달러 대 2만 6,098달러로 더 낮았습니다.
이유는 어렵지 않습니다. 앞서 한 추론을 버리지 않고 이어 쓰면 같은 생각을 두 번 하지 않게 됩니다. 반대로 매 요청마다 상태가 끊기면 모델은 자기가 방금 무엇을 알아냈는지부터 다시 세워야 합니다. 그래서 이 벤치마크가 재는 대상은 사실상 모델 하나가 아니라 모델과 그것을 감싼 에이전트 시스템을 합친 결과에 가깝습니다.
나머지 벤치마크는 어떻게 나왔나
Q. GPT-6 아스트라의 다른 시험 성적은 얼마인가요?
A. OpenAI가 공개한 수치로 수학·과학·코딩·보안 영역 모두 90%대이거나 그에 근접합니다. 프론티어매스 티어4(v2) 97.6%, GPQA 다이아몬드 96%, 벤치캐드 95.9%, 익스플로잇벤치 100%, 딥SWE(v1.1) 74.1%입니다. 벤처비트가 정리한 2026년 9월 3일 발표 기준이며, ARC-AGI-3 외의 항목은 독립 검증 결과가 함께 공개되지 않았습니다.
| 벤치마크 | 무엇을 재는가 | 발표 점수 |
|---|---|---|
| ARC-AGI-3 | 처음 보는 추상 문제의 규칙 찾기 | 98.6% |
| FrontierMath Tier 4 (v2) | 가장 어려운 등급의 수학 문제 | 97.6% |
| GPQA Diamond | 대학원 수준 과학 문항 | 96% |
| BenchCAD | 설계 도면 관련 과제 | 95.9% |
| ExploitBench | 보안 취약점 공격 과제 | 100% |
| DeepSWE (v1.1) | 실제 소프트웨어 개발 과제 | 74.1% |
※ 자료 : OpenAI 발표 수치를 정리한 벤처비트 2026년 9월 3일 보도. 실행 환경과 시도 횟수 조건은 항목별로 공개되지 않았습니다. (모바일에서는 표를 좌우로 밀어 보세요)
표를 위아래로 훑어보면 한 항목이 눈에 걸립니다. 수학과 과학은 90%대인데 실제 소프트웨어 개발 과제인 딥SWE는 74.1%입니다. 정답이 하나로 정해진 시험보다, 남이 짜놓은 코드 안에서 원인을 찾아 고치는 일이 여전히 더 어렵다는 뜻으로 읽힙니다. 이 격차는 업무에 실제로 붙일 때 체감하는 부분이기도 합니다.
가격과 쓸 수 있는 시점
Q. GPT-6 아스트라는 지금 바로 쓸 수 있나요?
A. 공개 시점에는 기업 고객을 대상으로 한 ‘데이브레이크(Daybreak)’ 제한 접근 프로그램에서만 열렸습니다. OpenAI는 며칠 안에 ChatGPT 플러스·프로·비즈니스·엔터프라이즈와 OpenAI API, AWS 베드록, 마이크로소프트 애저로 순차 확대한다고 밝혔습니다. 2026년 9월 3일 발표 기준입니다.
| API 모드 | 입력 100만 토큰 | 출력 100만 토큰 |
|---|---|---|
| 스탠더드 | 10달러 | 50달러 |
| 패스트 | 20달러 | 100달러 |
※ 자료 : 벤처비트 2026년 9월 3일 보도(OpenAI 발표 가격). 환율과 세금은 포함되지 않은 정가 기준입니다. (모바일에서는 표를 좌우로 밀어 보세요)
가격표에서 봐야 할 것은 출력 단가입니다. 스탠더드 모드의 출력이 입력의 5배이고, 패스트 모드는 그 두 배입니다. 추론을 길게 하는 모델은 겉으로 보이지 않는 생각 토큰까지 출력으로 계산되기 때문에, 벤치마크에서 좋은 점수를 낸 방식을 그대로 업무에 쓰면 비용이 예상보다 빠르게 붙습니다. 앞서 본 ARC Prize의 평가 비용이 회당 1만 달러 단위였던 것도 같은 이야기입니다.
안전성 발표에서 눈에 띄는 대목
Q. 성능이 오른 만큼 위험도 커진 것은 아닌가요?
A. OpenAI는 아스트라를 사이버보안 영역에서 자사 기준상 ‘심각(Critical)’ 임계값에 처음 도달한 모델로 분류했습니다. 동시에 권한을 넘어서는 행동을 시험한 항목에서는 안전장치를 뺀 조건에서 이전 모델 GPT-5.6 솔이 48.2%였던 반면 아스트라는 0%였다고 밝혔습니다. 능력과 통제가 함께 올라갔다는 주장입니다.
이 두 숫자를 같이 놓고 보는 것이 중요합니다. 익스플로잇벤치 100%는 보안 과제를 전부 풀었다는 뜻이고, 그 능력은 방어에도 공격에도 쓰일 수 있습니다. OpenAI가 같은 발표에서 사이버보안 임계값을 언급한 것은 그 양면성을 스스로 표시한 것으로 보입니다.
벤처비트 보도에 따르면 OpenAI는 허깅페이스(Hugging Face) 관련 사건 이후 약 2주 동안 프론티어 모델 훈련을 멈춘 적이 있고, 야쿱 파초키(Jakub Pachocki) 수석과학자는 모델의 정렬 상태를 감시할 능력이 떨어지는 것은 받아들이지 않겠다는 뜻을 밝혔습니다. 발표된 내용은 회사의 설명이며, 외부 기관이 같은 항목을 재현해 확인한 결과는 공개되지 않았습니다.
이 숫자를 업무로 옮길 때 볼 것
Q. 벤치마크 발표를 읽을 때 무엇을 확인하면 되나요?
A. 점수 옆에 실행 환경, 데이터 세트, 시도 횟수, 비용이 함께 적혀 있는지를 보면 됩니다. 이번 ARC-AGI-3 사례처럼 네 가지 가운데 하나만 달라도 같은 모델의 점수가 62.7%에서 99.9%까지 움직입니다. 조건이 적히지 않은 점수는 비교에 쓸 수 없다고 보는 편이 안전합니다.
31년 동안 시스템을 설계하고 검수하는 일을 하며 늘 부딪힌 문제가 이것이었습니다. 성능 수치는 측정 환경을 함께 적지 않으면 의미가 없다는 것. 같은 프로그램도 어떤 장비, 어떤 데이터, 어떤 동시 사용자 조건에서 재느냐에 따라 결과가 달라지므로, 인수 시험에는 환경 명세가 반드시 붙습니다. 이번 ARC Prize의 발표는 AI 벤치마크에도 같은 규칙이 필요하다는 것을 그대로 보여줍니다.
실무 관점에서 더 참고할 만한 것은 오히려 비용과 시간 쪽입니다. 추론 상태를 이어 쓰는 구조가 점수와 속도와 비용을 동시에 개선했다는 결과는, AI를 붙여 무언가를 만드는 입장에서 설계 힌트가 됩니다. 모델을 더 좋은 것으로 바꾸는 일 못지않게, 앞서 한 작업을 버리지 않는 구조를 만드는 일이 성과를 바꿀 수 있다는 뜻입니다. AI 도구를 업무에 붙이는 방법에 관한 자료는 AI월드에서도 계속 정리하고 있습니다.
📌 이 글의 결론 3줄 요약
1. OpenAI는 2026년 9월 3일 GPT-6 아스트라를 공개하고 ARC-AGI-3 점수를 98.6%로 제시했습니다. 같은 날 ARC Prize의 검증 결과는 실행 환경에 따라 62.7%와 99.9%로 갈렸습니다.
2. 차이를 만든 것은 모델이 아니라 추론 상태를 이어 쓰게 해주는 실행 환경이었고, 그 환경은 점수뿐 아니라 소요 시간과 토큰 사용량, 평가 비용까지 함께 낮췄습니다.
3. 수학·과학은 90%대인데 실제 개발 과제인 딥SWE는 74.1%였고, 사이버보안은 자사 기준 ‘심각’ 임계값에 도달했습니다. 발표 점수만으로 업무 성능을 단정하기는 어렵습니다.
Q1. 98.6%와 62.7% 중 어느 쪽이 맞는 숫자인가요?
A. 조건이 다른 두 측정이라 어느 하나를 틀렸다고 하기는 어렵습니다. 62.7%는 ARC Prize가 표준 실행 환경에서 세미프라이빗 세트로 잰 값이고, 98.6%는 OpenAI가 자체 발표한 값입니다. 같은 기관이 제공사 어댑터 환경에서 잰 값은 99.9%였습니다.
Q2. 하니스(harness)라는 말이 정확히 무엇을 뜻하나요?
A. 모델을 감싸서 문제를 주고 답을 받아오는 실행 장치를 말합니다. 대화 이력을 어떻게 남기고, 앞선 추론을 얼마나 보존하고, 도구를 몇 번 쓰게 할지가 여기서 정해집니다. 모델 가중치가 같아도 하니스가 다르면 결과가 달라집니다.
Q3. 세미프라이빗 세트는 왜 따로 쓰나요?
A. 문제를 공개하지 않아야 모델이 미리 답을 익힌 상태로 시험을 보는 일을 막을 수 있기 때문입니다. ARC Prize가 이번에 공개한 62.7%와 99.9%는 모두 이 비공개 세트에서 나온 값입니다.
Q4. 이제 AGI가 왔다고 봐도 되나요?
A. “AGI 시대”라는 표현은 OpenAI 측 발언이며, 합의된 판정 기준이 있는 말은 아닙니다. 벤치마크 한 종목의 점수가 사람의 일반 지능과 같다고 볼 근거는 없고, 실제 개발 과제 점수는 74.1%에 머물렀습니다.
Q5. 지금 쓰는 유료 플랜에서도 아스트라를 쓸 수 있나요?
A. 발표 시점에는 기업용 제한 접근 프로그램이 먼저였고, ChatGPT 플러스·프로·비즈니스·엔터프라이즈로는 며칠 안에 확대한다고 안내됐습니다. 실제 적용 시점은 계정과 지역에 따라 다를 수 있어 OpenAI 공지를 확인하는 편이 정확합니다.
Q6. 비용은 이전보다 얼마나 더 드나요?
A. 발표된 정가는 스탠더드 모드가 100만 토큰당 입력 10달러·출력 50달러, 패스트 모드가 입력 20달러·출력 100달러입니다. 이전 모델과의 단가 비교는 발표에서 확인되지 않았습니다. 추론이 길어지면 출력 토큰이 늘어난다는 점을 함께 고려해야 합니다.
이 글은 2026년 9월 3일 공개된 ARC Prize 블로그 ‘OpenAI’s GPT-6 Astra on ARC-AGI-3’와 같은 날 벤처비트의 GPT-6 아스트라 출시 보도를 바탕으로 정리한 것이며, 원문 기사를 옮긴 것이 아닙니다. 점수·비용·가격은 모두 발표 시점 기준이고 이후 조건이 바뀔 수 있습니다. 정확한 수치와 적용 범위는 OpenAI와 ARC Prize의 공식 자료를 확인해 주세요.
×
#GPT6아스트라 #GPT6Astra #OpenAI #ARCAGI3 #ARCPrize #AGI #추론모델 #AI벤치마크 #FrontierMath #GPQADiamond #DeepSWE #AI가격 #AI안전 #AI동향


댓글 남기기