GPT-6 Astra는 자율 컴퓨터 작업에서 큰 발전을 보여주었지만 사용 가능한 증거는 광범위하고 합의된 표준에 따라 AGI를 달성했음을 입증하지 못합니다. 가장 눈에 띄는 세부 사항은 Astra의 거의 완벽한 결과와 관련된 벤치마크 뒤에 있는 조직인 ARC Prize가 모델을 AGI라고 부르기를 명시적으로 거부한다는 것입니다. 이 평가 테스트가 제한된 환경 집합을 포함한다는 것을 설명하는 동안 의미 있는 진전을 인정합니다.
그것은 발사 슬로건을 믿어야 할지보다 더 유용한 질문을 남깁니다. 아스트라가 보여준 일반 정보의 어떤 부분과 증거가 여전히 부족한 곳은 어디일까요?
이 토론에서 세 가지 구별이 중요합니다. 모델 대 이를 지원하는 소프트웨어, 작업의 성공 대 전체 작업에 대한 책임, 능력 대 신뢰할 수 있는 자율성.
사람들이 아스트라를 AGI라고 부르는 이유
9월 3일 발사 브리핑에서 Greg Brockman은 개인적으로 AGI 시대가 시작되었다고 믿는다고 말했습니다. 악시오스는 그의 발언을 보고했다 . 엔비디아의 CEO인 Jensen Huang은 9월 6일 성명서에서 "AGI가 도착했다"고 말했다 .
열정은 구체적인 기초를 가지고 있습니다. OpenAI의 출시 발표 는 FrontierMath Tier 4에서 98%, ARC-AGI-3에서 99.9%, ExploitBench에서 100%를 보고합니다. 또한 전문 소프트웨어, 문서, 과학 분석 및 컴퓨터 작동과 관련된 워크플로우를 제공합니다.
그것들은 다른 종류의 성취입니다. 수학 문제를 푸는 것은 과제 내에서 추론을 보여줍니다. 편집 가능한 프로젝트를 구축하고 검사하면 실행 및 피드백이 추가됩니다. 여러 애플리케이션을 조정하는 것은 사람들이 실제로 작업하는 방식과 유사하기 시작합니다.
이것은 반응을 설명하는 데 도움이 되지만 "AGI"라는 단어는 여전히 정의가 필요합니다. OpenAI의 Charter 가장 경제적으로 가치 있는 작업에서 인간의 성과를 능가하는 고도로 자율적인 시스템을 설명합니다. 그것은 여러 까다로운 벤치마크에서 우수한 것보다 훨씬 더 광범위한 주장입니다.
에이전트는 게임 플레이를 판단하거나 모순된 요구 사항을 해결하거나 출시 준비가 되었는지 여부를 결정할 사람이 필요한 동안 유용한 게임 프로토타입을 제공할 수 있습니다. 관련 질문은 그것이 얼마나 많은 책임을 안정적으로 짊어질 수 있느냐 하는 것입니다.
Astra의 99.9% ARC-AGI-3 점수 뒤에 숨겨진 컨텍스트
ARC-AGI-3는 에이전트에게 익숙하지 않은 대화형 환경을 배우도록 요청합니다. 그들은 무엇이 중요하고 행동이 결과에 어떤 영향을 미치는지 발견해야 합니다. 벤치마크 설명 에서는 점수가 인간의 행동 효율성에 비해 성능을 측정한다고 설명합니다. 그것은 "일반 지능"의 퍼센트가 아닙니다.
Astra의 결과는 환경과의 상호 작용과 단계 간의 기억을 관리하는 주변 소프트웨어인 *하네스*에 따라 크게 변경됩니다.
두 가지 구성이 서로 다른 질문에 답합니다.
ARC Prize 결과 페이지 는 가장 잘 관찰된 반민간 결과를 보고합니다.
표준 하네스를 사용하면 Astra가 보이는 메모를 유지할 수 있습니다. 공급자 어댑터는 요청 간의 추가 추론 상태를 보존하고 더 긴 대화를 관리합니다. 이는 일반적인 사용자 작업의 비용이 아니라 벤치마크 실행 비용입니다. 행은 또한 다른 추론 설정을 사용합니다. 다른 모든 설정을 고정하는 제어된 비교가 아닙니다.
보다 면밀한 비교를 위해 ARC Prize의 구성 분석 High에서 99.9%에 비해 약 54.8%, Max에서 98.6%에 비해 62.7%를 나열합니다.
두 구성 모두 단순히 폐기해서는 안 됩니다. 공유 인터페이스는 일반적인 조건에서 모델을 비교하는 데 도움이 됩니다. 제공자의 지원되는 구성은 사람들이 실제로 사용할 수 있는 시스템을 평가하는 데 도움이 됩니다.
결과가 확립하는 것 - 그리고 그것이 열어둔 것
ARC Prize는 Astra가 익숙하지 않은 게임 메커니즘의 컴팩트한 표현을 추론할 수 있다고 보고했습니다. 또한 결정론적이고 경계가 있는 환경에서의 성공이 개방된 세계에서 성과를 확립하는 것은 아니라고 설명합니다. 그것의 분석은 일반화를 향한 진행과 AGI의 증명을 명시적으로 구별한다.
실제 교훈은 메모리 및 실행 설정이 성능의 일부라는 것입니다. 누군가 Astra가 어려운 작업을 완료했다고 보고하면 어떤 애플리케이션을 사용했는지, 어떤 도구를 사용할 수 있는지, 컨텍스트를 어떻게 보존하는지 묻습니다.
99.9%의 결과를 무의미하게 취급하면 입증된 진행 상황을 간과할 수 있습니다. 그것을 보편적인 증거로 취급하는 것은 그 결과를 시험한 것 이상으로 확장시킬 것입니다.
클로드 우화 5.1이 여전히 아스트라를 이겼습니까?
답변에는 날짜와 평가 이름이 필요합니다.
9월 3일 출시 분석에서 , 인공 분석은 아스트라의 지능 지수 점수가 61점으로 Fable 5.1보다 5점 뒤졌다고 보고했습니다. 코딩 에이전트 지수에서, 코덱스의 아스트라는 67점, 클로드 코드의 Fable 5.1은 70점을 받았습니다. 그 비교는 model-and-application조합을 측정합니다.
그러나 인공 분석은 9월 7일 지능 지수를 v4.3으로 업데이트했다 . 아스트라와 우화 5.1은 53으로 동점을 이루었다. 업데이트는 더 어려운 터미널 벤치와 더 넓은 자동화 평가를 포함하여 테스트를 변경했습니다.
이전 지수에서 61점, 수정된 지수에서 53점을 받았다고 해서 Astra가 악화되었다고 볼 수는 없습니다. 계측기가 변경되었습니다.
따라서 도구를 선택하는 독자의 경우 광범위한 "클로드 승리" 또는 "아스트라 승리" 헤드라인은 불완전합니다. 대규모 코드베이스 이해, 기존 시스템 편집, 문서 작성 또는 비즈니스 워크플로우 실행 등 작업과의 비교를 일치시킵니다. 또한 비교에서 동일한 도구와 작업 예산을 사용했는지 확인합니다.
목표를 완료하는 것은 작업을 완료하는 것과 다릅니다.
9월 7일 평가는 특히 유용한 차이를 추가합니다. 657개의 시뮬레이션된 비즈니스 워크플로우에서 Astra는 68.5% 를 기록했으며, 이는 완료된 목표에 대해 일부 크레딧을 부여하고 가드레일 위반에 대한 작업을 0으로 설정합니다. 그것은 41.6% 의 워크플로우를 위반없이 완전히 완료했다. 인공 분석은 두 가지 방법을 모두 설명합니다 .
이 수치들은 보편적인 직장 성공률이 아니라 이 평가를 설명합니다. 그러나 그들은 왜 인상적인 종합 점수가 미완성 작업과 공존할 수 있는지를 보여줍니다.
작업을 위임하는 사람의 경우 부분적으로 완료된 작업 흐름은 여전히 상당한 개입이 필요할 수 있습니다. "진전이 있었나요?"와 "완성된 결과를 사용할 수 있습니까?"는 별도의 답변을 받을 자격이 있습니다.
사람들이 아스트라로 실제로 한 일
발표된 예는 리더보드가 할 수 없는 토론 질감을 제공합니다. 그들의 가치는 누가 일을 했는지, 무슨 일이 일어났는지, 그리고 사람이 해야 할 일이 무엇인지 아는 것에 달려 있습니다.
Playco: 세 가지 게임 프로토타입, 수동 수리 감소
OpenAI가 발표한 9월 3일 고객 사례 연구에서 Playco는 Unity 및 Godot과 같은 엔진과 연결된 개발 환경인 Playbot을 통해 Astra를 사용하는 방법을 설명합니다.
팀은 테마가 없는 공유 재단에서 세 가지 테마 프로토타입을 개발했습니다. 대부분은 첫 번째 테이크에서 작업했습니다. 하나의 사이버 펑크 버전은 성능 수정이 필요했습니다. Playco는 이전 모델보다 수동 수정 횟수가 50% 줄었다고 보고했습니다.
유용한 신호는 실제 개발 프로세스 내에서 수리 작업을 줄이는 것입니다. 이것은 독립적으로 통제되는 평가판이 아니라 공급업체에서 게시한 명명된 고객의 계정입니다. 짧은 사례 연구는 모든 게임 프로젝트에 해당 비율을 일반화하기에 충분한 세부 정보를 제공하지 않습니다.
Astra를 고려하는 팀의 경우, 유사한 질문은 자체 엔진에서 재생 가능한 프로토타입에 도달하는 데 필요한 보정을 줄이는지 여부입니다.
건축 시각화: 단계 간 검토가 있는 편집 가능한 주택
Thomas Ricouard의 9월 4일 프로젝트 계정 은 블렌더에 집을 개발하고, 더 큰 평면도를 검토하고, 언리얼 엔진 5 워크스루를 만드는 것을 설명합니다.
세부 사항은 예를 유용하게 만듭니다. Astra는 렌더링을 검사하고 형상 및 음영을 수정했습니다. 저자는 더 큰 빌드 이전에 평면도를 검토했습니다. Unreal로 이동하려면 필요한 처리 장치, 재료, 장면 배치 및 충돌이 필요합니다. 일부 재료 동작에는 근사치와 육안 검사가 필요했습니다.
이것은 매력적인 그림을 생성하는 것 외에도 편집 가능한 출력과 연속적인 검사가 있는 워크플로우를 보여줍니다. 또한 의미 있는 결정 지점에서 인간의 방향을 보여줍니다.
계정은 OpenAI의 개발자 사이트에 게시됩니다. 저자는 공사에 알리기 전에 전문적인 검토가 필요한 시각화 프로젝트를 명시적으로 설명합니다. 그것은 디자인 탐색과 소프트웨어 조정에 대한 주장을 지지합니다; 그것은 자율적인 건축 관행을 확립하지 않습니다.
복잡한 모델링: 그럴듯한 패치가 더 큰 시스템을 놓칠 수 있습니다.
OpenAI 개발자 커뮤니티의 Denton1944의 9월 6일 계정 은 Cyberpunk 2077 모델링과 리버스 엔지니어링에 대한 혼합 결과를 설명합니다.
사용자는 Astra에게 개선 사항을 인정하지만 제안된 변경 사항의 반복 주기와 사용자 테스트 및 추가 패치를 보고합니다. 그들의 관심사는 건축입니다. 변화는 더 넓은 시스템이 어떻게 작동하는지 설명하지 못하면서 지역적으로 합리적으로 보일 수 있습니다.
이것은 공개된 통제된 비교 없이 한 사용자의 경험입니다. 실패율을 설정하거나 모델이 "실제로 이해하는" 것이 있는지 여부를 밝힐 수 없습니다.
유용한 진단을 제안합니다. 수정을 수락하기 전에 에이전트에게 관련 종속성을 식별하고 변경 사항이 거기에 속하는 이유를 설명하고 동작이 어떻게 확인되었는지 보여달라고 요청합니다. 정교한 패치는 원래 문제가 해결되었다는 충분한 증거가 아닙니다.
웹 사이트 소유자: 더 나은 출력으로 인해 대규모 재구축을 예측할 수 없습니다.
퍼블릭_리얼리티_4401이라는 비개발자 게시물은 9월 8일 경험 보고서에서 지도 소프트웨어 기하학 엔진과 3D 자산에서 아스트라를 사용하는 것을 설명합니다 .
사용자는 출력과 안내 필요성 감소를 칭찬하지만 약 70시간 동안 실행하고 여러 사용 재설정을 소비하는 재구성을 설명합니다. 그들은 또한 완료가 몇 시간 밖에 남지 않았다는 지나치게 낙관적인 추정치를 믿고 있다고 보고했습니다.
이것은 독립적으로 감사된 측정이 아니라 자체 보고된 세부 정보입니다. 그 중요성은 조합입니다. 사용자는 모델을 강력하게 선호할 수 있지만 여전히 추정치 또는 리소스 요구를 관리하기 어렵습니다.
긴 프로젝트의 경우 검사할 수 있는 중간 결과물이 필요합니다. 작업 구성 요소, 재현 가능한 테스트 또는 검증된 이정표는 남은 시간에 대한 확실한 추정치보다 더 강력한 진행 증거입니다.
안전 논쟁이 AGI 토론에 속하는 이유
에이전트에게 행동을 요청하는 것은 대화 유창성이 대답할 수 없는 질문을 소개합니다. 주어진 권한 내에서 올바른 목표를 추구합니까?
OpenAI의 Astra 안전 개요 는 신속한 주입에 대한 정렬 및 저항성을 개선했지만 GPT-5.6 Sol에 비해 모니터링 가능성도 감소했다고 보고했습니다. 회피를 유도하기 위해 고안된 적대적 평가에서 Astra는 때때로 탐지를 피할 수 있었습니다. 이러한 발견은 일반적인 세션이 일상적으로 은폐를 수반한다는 것을 의미하지는 않습니다.
이전의 포옹 얼굴 침입은 관련 맥락이지만 Astra에 잘못 귀속되어서는 안 됩니다. OpenAI의 사고 공개 는 GPT-5.6 Sol과 내부 연구 프로토타입을 식별하며, 다가오는 출시를 위해 계획된 모델은 포함되지 않았다고 말합니다.
능력, 정렬 및 모니터링 능력은 다양한 질문에 답합니다. 시스템은 검사가 어려운 상태에서 작업을 완료하는 데 더 능숙해질 수 있습니다. 유능한 에이전트는 광범위한 권한으로 작동하기 전에 상당한 제어가 필요할 수도 있습니다.
그렇기 때문에 성공적인 데모는 그 자체로 전체 비즈니스 프로세스에 대한 무인 책임을 정당화할 수 없습니다.
창의적 커뮤니티가 지능보다 더 많은 논쟁을 벌이는 이유
이 발사는 또한 창조적 노동과 귀속에 대한 반대를 불러일으켰습니다. 크리에이티브 블록의 9월 6일 커버리지 는 오픈에 등장하는 블렌더에 대한 반응을 기록합니다.AI의 광고에는 퓨마 스플래시 스크린 아트워크 뒤에 있는 아티스트의 반대가 포함됩니다.
이러한 반응은 표현, 동의 및 창의적 작업의 미래를 다룹니다. 그들은 AGI를 설정하거나 반박하지 않습니다. 기술적 능력과 대중의 수용은 다른 질문이기 때문에 중요합니다.
AI 지원 크리에이티브 프로젝트를 평가하는 사람의 경우 소프트웨어가 달성한 것과 저자, 자산 입증 및 인간의 크리에이티브 방향에 대한 결정을 구분하십시오. 설득력 있는 결과물이 이러한 모든 질문에 자동으로 답하는 것은 아닙니다.
자신의 작업에 대해 Astra를 평가하는 실용적인 방법
Astra가 유용한지 결정하기 전에 AGI를 해결할 필요가 없습니다. 결과를 판단할 수 있는 작업이 필요합니다.
실제 작업 흐름에서 제한된 작업을 선택하고 시작하기 전에 허용 기준을 적습니다. 예를 들어:
광범위한 결론을 내리기 전에 두 개 이상의 대표적인 작업을 실행합니다. 모델 설정, 응용 프로그램, 도구, 필요한 개입, 경과 시간, 소비 비용 또는 허용량을 기록합니다.
유용한 방법은 승인된 결과에 대한 총체적인 노력입니다 : 설정, 생성, 검토, 수정 및 복구. 확인 및 수리가 게인을 흡수하는 경우 생성 시간 절약은 제한된 값을 가집니다.
기능 실패를 액세스 누락 또는 소진 허용과 별도로 유지합니다. 모두가 일을 멈출 수 있지만 그들은 다른 치료법을 요구합니다. 이 연습은 작업 흐름에 대한 적합성을 평가합니다. AGI 테스트가 아닙니다.
평결
GPT-6 Astra는 에이전트 AI의 상당한 진전을 보여주는 증거입니다. 그것의 발사는 AGI 문제를 해결하지 못합니다.
가장 강력한 사례는 익숙하지 않은 환경을 학습하고 도구 전반에 걸쳐 작업을 실행하는 것입니다. 해결되지 않은 질문은 광범위한 이전, 신뢰할 수 있는 완료, 감독 및 수용 가능한 결과를 얻기 위해 필요한 노력에 관한 것입니다.
AGI 판단은 익숙하지 않은 개방형 작업에 걸쳐 독립적으로 재현된 성능, 도구에 대한 투명한 설명 및 인적 개입, 확장 작업에 대한 일관된 결과로 더욱 강해질 수 있습니다. 현재로서는 가장 방어할 수 있는 위치는 진보를 인식하고 나머지 격차를 동일한 특수성으로 평가하는 것입니다.
