이 포스팅은 쿠팡 파트너스 활동의 일환으로, 이에 따른 일정액의 수수료를 제공받습니다.
AGI 시대 선언, 빠진 지표 하나
2026년 9월 3일, 한 기업의 발표 브리핑이 이런 문장으로 끝났습니다. “AGI 시대에 오신 것을 환영합니다.” OpenAI 공동창업자 겸 회장 그레그 브로크먼(Greg Brockman)이 새 대표 모델 GPT-6 아스트라(GPT-6 Astra)를 공개하며 한 말입니다.
그런데 AGI가 무엇인지에 대한 기준은, 다른 곳이 아니라 OpenAI가 스스로 적어둔 문장에 있습니다. 2018년 공개한 정관(Charter)에서 AGI를 “대부분의 경제적으로 가치 있는 일에서 인간을 능가하는 고도로 자율적인 시스템”이라고 정의했습니다.
기준이 ‘일’이라면, 그 일을 얼마나 해내는지 재는 시험이 있어야 합니다. OpenAI에는 그런 시험이 이미 있습니다. 2025년에 직접 만들어 공개한 GDPval입니다. 그리고 이번 발표 자료에는 그 결과가 없습니다.
이 글에서는 선언에 쓰인 근거와 빠진 근거를 나란히 놓고 정리하겠습니다. 공개된 벤치마크 수치, 외부 기관이 다시 잰 값, 안전성 분류, 그리고 직장에서 새 모델을 검토할 때 무엇을 확인하면 되는지까지 순서대로 짚습니다.
👉 선언이 맞는지 틀린지보다, 선언의 기준으로 재본 결과가 공개됐는지를 먼저 보는 편이 낫습니다.

▲ 선언의 기준은 ‘일’인데, 제시된 근거는 시험 점수였습니다
📑 목차 (클릭하면 해당 위치로 이동합니다)
선언은 어디서 어떻게 나왔나
Q. ‘AGI 시대’라는 말은 누가 언제 한 건가요?
A. 2026년 9월 3일 OpenAI의 GPT-6 아스트라 공개 브리핑에서 그레그 브로크먼 회장이 마무리 발언으로 한 말입니다. 같은 자리에서 브로크먼은 “개인적으로는 우리가 거기에 도달했다고 본다”고 덧붙이면서도, “명확하게 정의된 AGI의 순간 같은 것은 없다”고 인정했습니다. 벤처비트(VentureBeat) 2026년 9월 3일 보도 기준입니다.
발표의 무게중심은 지식이나 대화가 아니라 컴퓨터를 직접 다루는 능력에 실렸습니다. OpenAI는 아스트라를 “세계 최고의 컴퓨터 사용 모델”로 소개하면서, 브라우저와 스프레드시트, 데스크톱 프로그램을 사람처럼 오가며 문서와 발표자료를 완성하고 여러 단계로 이어지는 작업을 대신 수행한다고 설명했습니다. 방법을 알려주는 도구에서 일을 대신 끝내는 도구로 성격을 옮겼다는 주장입니다.
공개 범위는 처음부터 넓지 않았습니다. 기업 고객 대상 제한 접근 프로그램인 데이브레이크(Daybreak)에서 먼저 열렸고, ChatGPT 플러스·프로·비즈니스·엔터프라이즈와 OpenAI API, 아마존 베드록으로는 며칠에 걸쳐 순차 확대한다고 안내됐습니다. 벤치마크 점수를 둘러싼 논점은 전날 정리한 ARC-AGI-3 측정 조건 문제에서 따로 다뤘습니다.
주목할 점은 벤치마크를 만든 쪽의 반응이 달랐다는 것입니다. ARC-AGI 계열 시험을 운영하는 비영리 재단 ARC Prize는 같은 날 “우리는 그것이 AGI라고 주장하지 않는다”고 밝히면서, 다만 “일반화를 향한 의미 있는 진전”은 있었다고 평가했습니다. 같은 결과를 놓고 만든 쪽과 쓴 쪽의 해석이 갈린 셈입니다.
AGI의 기준은 원래 무엇이었나
Q. AGI는 어떤 기준으로 판정하나요?
A. 업계가 합의한 판정 기준은 없습니다. 다만 OpenAI 자신은 2018년 정관에서 AGI를 “대부분의 경제적으로 가치 있는 일에서 인간을 능가하는 고도로 자율적인 시스템”으로 정의해 두었습니다. 정의대로라면 판정의 기준은 시험 점수가 아니라 실제 직업의 업무 수행 능력입니다.
💡 핵심 정의
AGI(Artificial General Intelligence, 범용 인공지능)는 특정 과제에 한정되지 않고 사람이 하는 지적 작업 전반을 수행할 수 있는 인공지능을 가리키는 말입니다. 법령이나 표준에 정해진 판정 절차는 없으며, 기업마다 자체 정의를 씁니다. OpenAI 정관(2018)의 정의는 “대부분의 경제적으로 가치 있는 일에서 인간을 능가하는 고도로 자율적인 시스템”입니다.
벤치마크 점수는 그 능력을 간접적으로 재는 대리 지표입니다. 문제는 대리 지표들이 이번에 한 방향으로 움직이지 않았다는 데 있습니다. 수학 쪽은 크게 올랐지만, 도구를 쓰게 한 조건의 종합 시험에서는 이전 모델이나 경쟁 모델보다 낮은 값이 나왔습니다.
| 항목 | GPT-6 아스트라 | GPT-5.6 솔 | 클로드 페이블 5.1 |
|---|---|---|---|
| 아티피셜 애널리시스 지능 지수 | 61 | 61 | 약 66 |
| 인류 최후의 시험(도구 사용) | 57.2% | 65.0% | 63.8% |
| 프론티어매스 티어4(v2) | 97.6% | 83.0% | 87.8% |
| 경제적 가치 업무 평가(GDPval) | 공개 자료 없음 | – | – |
※ 자료 : 임플리케이터(Implicator.ai) 2026년 9월 3일 보도가 정리한 아티피셜 애널리시스·ARC Prize 집계 및 OpenAI 발표치. (모바일에서는 표를 좌우로 밀어 보세요)
종합 지능 지수가 이전 모델과 같은 61이고, 도구를 쓰게 한 조건의 종합 시험에서는 오히려 낮게 나왔다는 점은 발표 문구와 잘 맞지 않습니다. 반대로 수학 난제 영역은 83.0%에서 97.6%로 크게 올랐습니다. 특정 영역의 도약과 전반적 향상은 다른 이야기이며, AGI 선언은 후자를 전제로 하는 표현입니다.
👉 한두 종목이 크게 오른 것과 전반적으로 좋아진 것은 구분해서 읽어야 합니다.
발표에서 빠진 시험, GDPval
Q. 이번 발표에서 빠진 지표는 무엇인가요?
A. GDPval입니다. OpenAI가 2025년 직접 만들어 공개한, 실제 직업의 업무로 모델을 평가하는 시험인데 GPT-6 아스트라 공개 자료에는 결과가 담기지 않았습니다. AGI 정의의 핵심 문구가 “경제적으로 가치 있는 일”인 만큼, 그 문구를 재려고 만든 시험이 빠졌다는 점은 짚어둘 대목입니다.
GDPval은 추상적인 퍼즐이나 수학 경시 문제와 성격이 다릅니다. 미국 국내총생산(GDP) 기여도가 큰 상위 9개 산업에서 44개 직업을 골라, 실제로 그 일을 하는 사람들이 만든 과제를 모델에게 시키는 방식입니다. 과제에는 참고 파일과 맥락이 함께 주어지고, 결과물은 문서·슬라이드·도표·스프레드시트처럼 실무에서 오가는 형태로 요구됩니다.
| 구성 항목 | 내용 |
|---|---|
| 대상 직업 | 44개 (소프트웨어 개발자, 변호사, 회계사, 간호사, 기계공학 기술자, 재무 분석가 등) |
| 산업 범위 | 미국 GDP 기여 상위 9개 산업 |
| 전체 과제 수 | 1,320개 (이 가운데 220개는 공개 세트) |
| 과제 작성자 | 해당 직업 종사자, 평균 경력 14년 |
| 채점 방식 | 사람 전문가 결과물과의 직접 비교 |
※ 자료 : OpenAI GDPval 공식 소개 자료 (2025년 공개, 2026년 9월 기준 확인). (모바일에서는 표를 좌우로 밀어 보세요)
왜 이 공백이 문제가 되나
선언의 기준과 제시된 근거가 서로 다른 층위이기 때문입니다. “경제적으로 가치 있는 일에서 인간을 능가한다”는 기준에 대응하는 자료는 직업 업무 평가인데, 근거로 나온 것은 추론·수학·코딩 벤치마크였습니다. 대리 지표가 나쁘다는 뜻이 아니라, 정의에 직접 대응하는 지표가 있는데도 빠졌다는 점이 눈에 띈다는 뜻입니다.
검증 주체가 적다는 점도 함께 봐야 합니다. 임플리케이터 정리에 따르면 이번 공개 직후 외부에서 자체 평가 결과를 내놓은 곳은 ARC Prize와 아티피셜 애널리시스 두 곳뿐이었습니다. 나머지 수치는 대부분 OpenAI가 자사 환경에서 측정한 값입니다. 측정한 쪽과 발표한 쪽이 같으면, 어떤 항목을 넣고 뺄지도 같은 쪽이 정하게 됩니다.
👉 발표 자료를 볼 때는 실린 숫자만큼, 실릴 수 있었는데 빠진 항목이 무엇인지도 확인하는 편이 좋습니다.
능력이 오른 만큼 통제도 올랐나
Q. 안전성 발표는 어떻게 읽어야 하나요?
A. GPT-6 아스트라는 OpenAI 자체 기준으로 사이버보안 ‘심각(Critical)’ 임계값에 처음 도달한 모델로 분류됐습니다. 사람이 단계마다 지시하지 않아도 알려지지 않은 취약점을 찾아 공격 경로를 구성할 수 있다는 판단입니다. 능력 향상과 위험 증가가 같은 발표에 함께 담겼다는 점을 먼저 보면 됩니다.
| 평가 항목 | GPT-6 아스트라 | GPT-5.6 솔 |
|---|---|---|
| 사이버보안 분류(자사 기준) | 심각(Critical) 도달 | 미도달 |
| 익스플로잇벤치 | 100% | 78.5% |
| V8 내부 시험 임의 코드 실행 | 39.0% | 11.5% |
| 평가 중 발견한 제로데이 취약점 | 2건 (개발자에게 통보) | – |
※ 자료 : 임플리케이터(Implicator.ai) 2026년 9월 3일 보도가 정리한 OpenAI 발표 및 시스템 카드 수치 (2026년 9월 기준). (모바일에서는 표를 좌우로 밀어 보세요)
💡 핵심 정의
프리페어드니스 프레임워크(Preparedness Framework)는 OpenAI가 자사 모델의 위험 수준을 영역별로 나눠 등급을 매기고, 등급에 따라 공개 방식과 안전장치를 결정하는 내부 절차입니다. 외부 기관의 인증이 아니라 기업이 스스로 정하고 스스로 적용하는 기준입니다.
더 무겁게 읽히는 대목은 감시 가능성입니다. OpenAI는 아스트라가 감독을 피하도록 명시적으로 지시받았을 때, 남기는 추론 기록이 이전 모델보다 살펴보기 어려웠다고 밝혔습니다. 성능을 끌어올린 새 추론 방식이 동시에 내부 과정을 덜 들여다보이게 만들었다는 뜻이며, 이 지점은 AI 안전 연구자들이 공개 직후 우려를 표한 부분이기도 합니다.
OpenAI 수석과학자 야쿠프 파호츠키(Jakub Pachocki)는 “지능의 진보가 정렬의 진보를 보장하지는 않는다”고 말했고, 확신이 충분히 회복될 때까지는 규모 확장을 보류하겠다는 취지의 발언도 함께 내놨습니다. 회사 스스로 성능과 통제가 같은 속도로 가지 않는다는 점을 언급한 셈입니다.
직장에서 지금 확인할 것
Q. 직장에서는 무엇을 준비하면 되나요?
A. 모델 이름을 좇기보다 “내가 하는 업무가 공개된 평가에 포함된 적이 있는가”를 기준으로 보면 됩니다. GDPval처럼 직업 단위로 짜인 평가에 내 직무가 들어 있는지, 들어 있다면 어떤 결과물 형태로 채점됐는지를 확인하는 편이 발표 문구를 읽는 것보다 실질적입니다.
31년 동안 시스템을 설계하고 운영하는 일을 해 온 입장에서 보면, 새 기술의 도입 속도를 결정한 것은 대개 성능 수치가 아니었습니다. 잘못됐을 때 되돌릴 방법이 있는지, 결과를 누가 확인하고 책임지는지가 정해져야 실제 업무에 붙습니다. 컴퓨터를 직접 조작해 작업을 끝내는 모델이라면 확인해야 할 항목은 오히려 늘어납니다. 무엇을 열람하고 무엇을 바꿀 수 있게 할지, 어떤 작업에 사람의 승인을 끼워 넣을지가 먼저입니다.
기업 환경에서 아스트라 접근이 기본적으로 꺼진 상태로 제공되고 관리자가 직접 켜야 하는 구조라는 점도 같은 맥락으로 읽힙니다. 개인 사용자라면 요금제 확대 일정을 기다리는 동안, 지금 쓰는 도구로 처리하는 업무 가운데 어느 단계가 자동화되면 검토가 필요한지를 미리 정리해 두는 정도가 현실적입니다. AI 도구를 업무에 붙이는 방법에 관한 자료는 AI월드에서도 계속 정리하고 있습니다.
📌 이 글의 결론 3줄 요약
1. 2026년 9월 3일 OpenAI는 GPT-6 아스트라를 공개하며 “AGI 시대”를 언급했지만, 같은 날 ARC Prize는 그것이 AGI라고 주장하지 않는다고 밝혔습니다.
2. OpenAI 정관의 AGI 정의는 “경제적으로 가치 있는 일”을 기준으로 삼는데, 정작 그 기준을 재려고 만든 GDPval 결과는 공개 자료에 없었습니다.
3. 사이버보안은 자사 기준 ‘심각’ 등급에 처음 도달했고 추론 과정은 살펴보기 더 어려워졌습니다. 도입 검토는 성능 수치보다 권한과 승인 절차를 먼저 정하는 순서가 안전합니다.
Q1. 그래서 AGI 시대에 진입한 것이 맞나요?
A. 확정된 사실이 아니라 한 기업의 판단입니다. “AGI 시대”는 2026년 9월 3일 OpenAI 브리핑에서 나온 표현이고, 벤치마크를 운영하는 ARC Prize는 같은 날 그런 주장을 하지 않는다고 밝혔습니다. 판정 절차가 표준화돼 있지 않아 확인 가능한 것은 각 주체의 입장뿐입니다.
Q2. GDPval은 정확히 어떤 시험인가요?
A. OpenAI가 2025년 공개한, 실제 직업의 업무로 모델을 평가하는 시험입니다. 미국 GDP 기여 상위 9개 산업에서 44개 직업을 뽑아 총 1,320개 과제를 구성했고, 과제는 평균 경력 14년의 종사자가 만들었습니다. 채점은 사람 전문가의 결과물과 직접 비교하는 방식입니다.
Q3. 발표에 GDPval이 빠진 이유는 밝혀졌나요?
A. 공개된 설명은 없습니다. 확인되는 사실은 공개 자료에 해당 결과가 담기지 않았다는 것뿐이며, 여러 매체가 그 점을 함께 지적했습니다. 이유를 추측해 단정하기보다 후속 자료가 나오는지 지켜보는 편이 정확합니다.
Q4. 성능이 전부 오른 것은 아니라는 근거가 있나요?
A. 도구를 쓰게 한 조건의 종합 시험에서는 아스트라가 57.2%로, 이전 모델 GPT-5.6 솔의 65.0%보다 낮았습니다. 아티피셜 애널리시스 지능 지수도 61로 이전 모델과 같았습니다. 반면 프론티어매스 티어4(v2)는 83.0%에서 97.6%로 올랐습니다. 임플리케이터 2026년 9월 3일 정리 기준입니다.
Q5. 보안상 위험하다면 왜 공개한 건가요?
A. OpenAI는 위험 등급에 맞춰 접근 범위를 제한하는 방식을 택했습니다. 고급 사이버보안 기능은 검증된 테스터 집단에게 먼저 열렸고, 기업 환경에서는 접근이 기본적으로 꺼진 상태로 제공돼 관리자가 직접 켜야 합니다. 판단 기준은 외부 인증이 아니라 회사 내부 절차입니다.
Q6. 일자리에 당장 영향이 있나요?
A. 확인된 수치로 답할 수 있는 단계가 아닙니다. 직업 단위 업무 평가 결과가 공개되지 않았기 때문에, 어떤 직무가 얼마나 대체 가능한지를 이번 발표만으로 판단할 근거는 없습니다. 다만 컴퓨터 조작을 대신하는 방향으로 제품이 움직이고 있다는 사실은 발표 내용으로 확인됩니다.
이 글은 2026년 9월 3일 OpenAI의 GPT-6 아스트라 공개 발표와 이를 다룬 벤처비트·임플리케이터·더디코더 보도, 그리고 OpenAI가 공개한 GDPval 소개 자료를 바탕으로 정리했습니다. 인용한 수치는 각 표 아래 출처와 기준일을 함께 적었습니다. 기업이 자체 측정해 발표한 값과 외부 기관이 다시 잰 값은 구분해 표기했으며, 확인되지 않은 항목은 ‘공개 자료 없음’으로 두었습니다. 모델 제공 범위와 요금은 계정·지역·시점에 따라 달라질 수 있으므로 실제 이용 전에는 OpenAI 공지를 확인하시기 바랍니다.
×
#AGI #AGI시대 #OpenAI #GPT6아스트라 #GDPval #범용인공지능 #그레그브로크먼 #ARCPrize #AI벤치마크 #AI안전 #프리페어드니스 #AI일자리 #컴퓨터사용모델 #AI동향


댓글 남기기