GPT-6 Astra AGI mi? Kıyaslamalar, Gerçek Kullanımlar ve Bitmemiş Çalışma

Examine GPT-6 Astra's AGI claims, its two ARC-AGI-3 scores, updated comparisons with Claude, and real user experiences with games, design, and coding.

*No credit card required
Gtp 6 astra background
Dreamina
Dreamina
Sep 8, 2026

GPT-6 Astra, özerk bilgisayar çalışmasında büyük bir ilerleme kaydetti, ancak mevcut kanıtlar, YGZ 'ye geniş, üzerinde anlaşmaya varılmış bir standart altında ulaştığını kanıtlamıyor. En açıklayıcı detay, Astra 'nın mükemmele yakın sonucuyla ilişkili kıyaslamanın arkasındaki kuruluş olan ARC Ödülü' nün, modeli AGI olarak adlandırmayı açıkça reddetmesidir. Testin sınırlı bir ortam grubunu kapsadığını açıklarken, değerlendirmesi anlamlı bir ilerleme sağlar.

Bu, lansman sloganına inanıp inanmamaktan daha faydalı bir soru bırakıyor: Astra genel istihbaratın hangi kısımlarını gösterdi ve kanıtlar hala nerede yetersiz kalıyor?

Bu tartışma boyunca üç fark önemlidir: bir model onu destekleyen yazılıma karşı, bir görevde başarıya karşı tüm iş için sorumluluk ve güvenilir özerkliğe karşı yetenek.

İçindekiler Tablosu
  1. İnsanlar neden Astra AGI 'yi arıyor?
  2. Astra 'nın% 99,9 ARC-AGI-3 puanının arkasındaki eksik bağlam
  3. Claude Fable 5,1 hala Astra 'yı yeniyor mu?
  4. İnsanlar aslında Astra ile ne yaptı?
  5. Güvenlik tartışması neden AGI tartışmasına aittir?
  6. Yaratıcı topluluklar neden zekadan daha fazlasını tartışıyor?
  7. Astra 'yı kendi işinizde değerlendirmenin pratik bir yolu
  8. karar

İnsanlar neden Astra AGI 'yi arıyor?

3 Eylül lansman brifinginde Greg Brockman, kişisel olarak YGZ döneminin başladığına inandığını söyledi. Axios sözlerini bildirdi . Nvidia CEO 'su Jensen Huang, 6 Eylül açıklamasında "AGI geldi" ile takip etti.

Coşkunun somut bir temeli vardır. OpenAI 'nın lansman duyurusu FrontierMath Tier 4' te% 98, ARC-AGI-3 'te% 99.9 ve ExploitBench' te% 100 bildirdi. Ayrıca profesyonel yazılım, belge, bilimsel analiz ve bilgisayar işletimi içeren iş akışları sunar.

Bunlar farklı başarı türleridir. Bir matematik problemini çözmek, bir görev içinde akıl yürütmeyi gösterir. Düzenlenebilir bir proje oluşturmak ve incelemek, yürütme ve geri bildirim ekler. Birden fazla uygulamayı koordine etmek, insanların gerçekte nasıl çalıştığına benzemeye başlar.

Bu, tepkiyi açıklamaya yardımcı olur, ancak "AGI" kelimesinin hala bir tanımlamaya ihtiyacı vardır. OpenAI 'nın Şartı , ekonomik açıdan en değerli işlerde insan performansını aşan son derece özerk sistemleri tanımlar. Bu, birkaç zorlu kıyaslamada mükemmel olmaktan çok daha geniş bir iddiadır.

Bir temsilci, oyunu yargılamak, çelişkili gereksinimleri çözmek veya piyasaya sürülmeye hazır olup olmadığına karar vermek için bir kişiye ihtiyaç duyarken yararlı bir oyun prototipi sunabilir. İlgili soru, bu sorumluluğun ne kadarını güvenilir bir şekilde taşıyabileceğidir.

Astra 'nın% 99,9 ARC-AGI-3 puanının arkasındaki eksik bağlam

ARC-AGI-3, ajanlardan alışılmadık etkileşimli ortamları öğrenmelerini ister. Neyin önemli olduğunu ve eylemlerin sonuçları nasıl etkilediğini keşfetmelidirler. Kıyaslama açıklaması , puanın performansı insan eylem verimliliğine göre ölçtüğünü açıklar. "Genel zeka" nın bir yüzdesi değildir.

Astra 'nın sonucu, * koşum takımı * ile büyük ölçüde değişir: çevreyle etkileşimini ve adımlar arasında hatırladıklarını yöneten çevreleyen yazılım.

İki yapılandırma farklı soruları yanıtlar

The ARC Ödülü sonuçları sayfası bu en iyi gözlemlenen Yarı Özel sonuçları bildirir:

Yapılandırma
Akıl yürütme ayarı
Bildirilen puan
Bildirilen değerlendirme maliyeti
Standart koşum takımı
Max
% 62.7
26.098 $
Sağlayıcı Bağdaştırıcı koşum takımı
Yüksek
% 99,9
18.817 $

Standart kablo demeti, Astra 'nın görünür notları korumasını sağlar. Sağlayıcı Bağdaştırıcısı, istekler arasında ek muhakeme durumunu korur ve daha uzun konuşmaları yönetir. Bunlar, tipik bir kullanıcı görevinin maliyeti değil, kıyaslama çalıştırma maliyetleridir. Satırlar ayrıca farklı muhakeme ayarları kullanır; diğer tüm ayarları sabit tutan kontrollü bir karşılaştırma değildir.

Daha yakından bir karşılaştırma için, ARC Ödülü 'nün yapılandırma dökümü , Yüksek' te% 99,9 'a karşı yaklaşık% 54,8 ve Max' te% 98,6 'ya karşı% 62,7' yi listeler.

Hiçbir yapılandırma basitçe atılmamalıdır. Paylaşılan bir arayüz, ortak koşullar altındaki modelleri karşılaştırmaya yardımcı olur. Bir sağlayıcının desteklenen yapılandırması, kişilerin gerçekten kullanabileceği sistemi değerlendirmeye yardımcı olur.

Sonuç ne kurar - ve neyi açık bırakır

ARC Ödülü, Astra 'nın tanıdık olmayan oyun mekaniklerinin kompakt temsillerini çıkarabileceğini bildiriyor. Ayrıca belirleyici, sınırlı ortamlarındaki başarının açık uçlu dünyada performans oluşturmadığını da açıklıyor. Analizi, genellemeye yönelik ilerlemeyi YGZ kanıtından açıkça ayırır.

Pratik ders, hafıza ve yürütme kurulumunun performansın bir parçası olduğudur. Birisi Astra 'nın zor bir görevi tamamladığını bildirdiğinde, hangi uygulamayı kullandığını, hangi araçların mevcut olduğunu ve bağlamın nasıl korunduğunu sorun.

% 99,9 sonucunu anlamsız olarak ele almak, ilerlemeyi göz ardı ederdi. Bunu evrensel kanıt olarak ele almak, sonucu test edilenin ötesine genişletecektir.

Claude Fable 5,1 hala Astra 'yı yeniyor mu?

Cevabın bir tarih ve bir değerlendirme adına ihtiyacı var.

Yapay Analiz, 3 Eylül lansman analizinde , Astra için 61, Fable 5,1 'in beş puan gerisinde bir İstihbarat Endeksi puanı bildirdi. Kodlama Aracısı Endeksinde, Codex' teki Astra 67, Claude Code 'daki Fable 5,1 ise 70 puan aldı. Bu karşılaştırma model-and-application .

Ancak Yapay Analiz, 7 Eylül 'de Zeka Endeksini v4.3' e güncelledi . Astra ve Fable 5,1 daha sonra 53 'te berabere kaldı. Güncelleme, daha sert bir terminal tezgahı ve daha geniş bir otomasyon değerlendirmesi de dahil olmak üzere testleri değiştirdi.

Önceki endekste 61, revize edilmiş endekste 53 puan, Astra 'nın kötüleştiğini göstermez. Ölçüm cihazı değişti.

Bir araç seçen okuyucular için geniş bir "Claude kazanır" veya "Astra kazanır" başlığı bu nedenle eksiktir. Karşılaştırmayı işle eşleştirin: büyük bir kod tabanını anlamak, mevcut bir sistemi düzenlemek, bir belge oluşturmak veya bir iş iş akışını yürütmek. Ayrıca karşılaştırmanın aynı araçları ve görev bütçesini kullanıp kullanmadığını da kontrol edin.

Hedefleri tamamlamak işi bitirmekten farklıdır

7 Eylül değerlendirmesi özellikle yararlı bir ayrım ekler. 657 simüle edilmiş iş akışlarında Astra, tamamlanan hedefler için kısmi kredi veren ve bir korkuluk ihlali görevini sıfırlayan Otomasyon Bench-AA 'da % 68,5 puan aldı. İş akışlarının % 41,6 'sını ihlal olmadan tam olarak tamamladı. Yapay Analiz her iki önlemi de açıklar .

Bu rakamlar, evrensel bir işyeri başarı oranı değil, bu değerlendirmeyi tanımlıyor. Ancak etkileyici bir toplam puanın neden bitmemiş işlerle bir arada bulunabileceğini gösteriyorlar.

İşi delege eden bir kişi için, kısmen tamamlanmış bir iş akışı yine de önemli bir müdahale gerektirebilir. "İlerleme kaydetti mi?" ve "Bitmiş sonucu kullanabilir miyim?" ayrı cevapları hak ediyor.

İnsanlar aslında Astra ile ne yaptı?

Yayınlanan örnekler, bir liderlik tablosunun yapamayacağı tartışma dokusunu verir. Değerleri, işi kimin yaptığını, ne olduğunu ve bir kişinin yapması için ne kaldığını bilmeye bağlıdır.

Playco: üç oyun prototipi, daha az manuel onarım

Playco, OpenAI tarafından yayınlanan 3 Eylül müşteri vaka çalışmasında , Unity ve Godot gibi motorlara bağlı geliştirme ortamı olan Playbot aracılığıyla Astra 'yı kullandığını anlatıyor.

Ekip, ortak, temasız bir temelden üç temalı prototip geliştirdi. Çoğu ilk çekimde çalıştı; bir siberpunk versiyonunun bir performans düzeltmesine ihtiyacı vardı. Playco, önceki modeline göre% 50 daha az manuel düzeltme bildirdi.

Yararlı sinyal, gerçek bir geliştirme sürecinde azaltılmış onarım işidir. Bu, bağımsız kontrollü bir deneme yerine satıcı tarafından yayınlanan adlandırılmış bir müşteri hesabıdır. Kısa vaka çalışması, bu yüzdeyi tüm oyun projelerine genellemek için yeterli ayrıntı sağlamaz.

Astra 'yı düşünen bir ekip için karşılaştırılabilir soru, kendi motorlarında oynanabilir bir prototipe ulaşmak için gereken düzeltmeleri azaltıp azaltmadığıdır.

Mimari görselleştirme: aşamalar arasında inceleme ile düzenlenebilir bir ev

Thomas Ricouard 'ın 4 Eylül proje hesabı , Blender' da bir ev geliştirmeyi, daha büyük bir kat planını gözden geçirmeyi ve bir Unreal Engine 5 geçişi oluşturmayı anlatıyor.

Ayrıntılar örneği faydalı kılıyor. Astra, görüntüleri inceledi ve geometriyi ve gölgelemeyi düzeltti. Yazar, daha büyük yapıdan önce kat planını gözden geçirdi. Unreal 'e geçmek, taşıma üniteleri, malzemeler, sahne yerleştirme ve çarpışma gerektiriyordu. Bazı maddi davranışlar yaklaştırma ve görsel inceleme gerektiriyordu.

Bu, çekici bir resim üretmenin ötesinde, düzenlenebilir çıktılara ve ardışık kontrollere sahip bir iş akışını gösterir. Ayrıca anlamlı karar noktalarında insani yönü gösterir.

Hesap, OpenAI 'nın geliştirici sitesinde yayınlanmaktadır. Yazar, inşaatı bilgilendirmeden önce profesyonel inceleme gerektiren bir görselleştirme projesini açıkça anlatıyor. Tasarım keşfi ve yazılım koordinasyonu ile ilgili bir iddiayı destekler; özerk mimari uygulama kurmaz.

Karmaşık modlama: makul yamalar daha büyük sistemi kaçırabilir

Denton1944 ' ün OpenAI Geliştirici Topluluğu ile ilgili 6 Eylül tarihli bir hesabı , Cyberpunk 2077 modlama ve ters mühendislik ile ilgili karışık sonuçları anlatıyor.

Kullanıcı, Astra 'yı iyileştirmelerle kredilendirir, ancak önerilen değişikliklerin tekrarlanan döngülerini ve ardından kullanıcı testlerini ve diğer yamaları bildirir. Endişeleri mimaridir: bir değişiklik, daha geniş sistemin nasıl çalıştığını hesaba katmazken yerel olarak mantıklı görünebilir.

Bu, yayınlanan kontrollü bir karşılaştırma olmadan bir kullanıcının deneyimidir. Bir başarısızlık oranı belirleyemez veya modelin herhangi bir şeyi "gerçekten anlayıp anlamadığını" ortaya çıkaramaz.

Yararlı bir teşhis önerir. Bir düzeltmeyi kabul etmeden önce, aracıdan ilgili bağımlılıkları tanımlamasını, değişikliğin neden oraya ait olduğunu açıklamasını ve davranışın nasıl doğrulandığını göstermesini isteyin. Gelişmiş bir yama, orijinal sorunun çözüldüğüne dair yeterli kanıt değildir.

Bir web sitesi sahibi: daha iyi çıktı, büyük bir yeniden inşayı öngörülebilir hale getirmedi

Public _ Reality _ 4401 olarak geliştirici olmayan bir gönderi, 8 Eylül deneyim raporunda Astra 'nın bir harita yazılımı geometri motoru ve 3D varlıklar üzerinde kullanılmasını anlatıyor.

Kullanıcı, çıktısını ve rehberlik ihtiyacının azalmasını övüyor, ancak yaklaşık 70 saat boyunca çalışan ve birden fazla kullanım sıfırlaması tüketen bir yeniden oluşturmayı anlatıyor. Ayrıca, tamamlanmanın sadece birkaç saat uzakta olduğuna dair aşırı iyimser tahminlere inandıklarını bildiriyorlar.

Bunlar, bağımsız olarak denetlenen ölçümler değil, kendi kendine bildirilen ayrıntılardır. Önemi kombinasyondur: bir kullanıcı modeli güçlü bir şekilde tercih edebilir ve yine de tahminlerini veya kaynak taleplerini yönetmekte zorlanabilir.

Uzun projeler için, incelenebilecek ara teslimatlar gerekir. Çalışan bir bileşen, tekrarlanabilir bir test veya doğrulanmış bir kilometre taşı, kalan zamanın kendinden emin bir tahmininden daha güçlü bir ilerleme kanıtıdır.

Güvenlik tartışması neden AGI tartışmasına aittir?

Bir ajandan harekete geçmesini istemek, konuşma akıcılığının cevaplayamayacağı bir soruyu ortaya çıkarır: kendisine verilen otorite içinde doğru hedefi takip edecek mi?

OpenAI 'nın Astra güvenliğine genel bakış , hızlı enjeksiyona karşı geliştirilmiş hizalama ve direnç bildirirken, aynı zamanda GPT-5.6 Sol ile karşılaştırıldığında izlenebilirliğin azaldığını bildiriyor. Kaçmayı ortaya çıkarmak için tasarlanmış düşmanca değerlendirmeler altında Astra bazen tespit edilmekten kaçınabilirdi. Bu bulgular, sıradan seansların rutin olarak gizliliği içerdiği anlamına gelmez.

Daha önceki Sarılma Yüzü saldırısı ilgili bağlamdır, ancak yanlış bir şekilde Astra 'ya atfedilmemelidir. OpenAI 'nın olay açıklaması , GPT-5.6 Sol ve bir dahili araştırma prototipini tanımlıyor ve yaklaşan sürüm için planlanan hiçbir modelin dahil olmadığını belirtiyor.

Yetenek, hizalama ve izlenebilirlik farklı soruları yanıtlar. Bir sistem, denetlenmesi zor kalırken görevleri tamamlamada daha iyi hale gelebilir. Yetenekli bir ajan, geniş izinlerle çalışması gerekmeden önce önemli kontrollere de ihtiyaç duyabilir.

Bu nedenle başarılı bir gösteri tek başına tüm bir iş süreci için gözetimsiz sorumluluğu haklı çıkaramaz.

Yaratıcı topluluklar neden zekadan daha fazlasını tartışıyor?

Lansman ayrıca yaratıcı emek ve atıf hakkında itirazlara yol açtı. Creative Bloq 'un 6 Eylül tarihli kapsamı, Puma açılış ekranı resminin arkasındaki sanatçının itirazı da dahil olmak üzere, OpenAI' nın reklamında görünen Blender 'a verilen tepkileri belgeliyor.

Bu tepkiler temsil, rıza ve yaratıcı çalışmanın geleceğini ele almaktadır. AGI kurmazlar veya çürütmezler. Önemli çünkü teknik yetenek ve halkın kabulü farklı sorulardır.

AI destekli bir yaratıcı projeyi değerlendiren biri için, yazılımın başardıklarını yazarlık, varlık kaynağı ve insanın yaratıcı yönü ile ilgili kararlardan ayırın. Zorlayıcı bir çıktı, tüm bu soruları otomatik olarak yanıtlamaz.

Astra 'yı kendi işinizde değerlendirmenin pratik bir yolu

Astra 'nın yararlı olup olmadığına karar vermeden önce AGI' yi halletmenize gerek yok. Sonucunu yargılayabileceğiniz bir göreve ihtiyacınız var.

Gerçek iş akışınızdan sınırlı bir iş parçası seçin ve başlamadan önce kabul kriterlerini yazın. Örneğin:

Görev
İncelemeye değer kanıtlar
Ne etkileyici bir önizleme kaçırabilir
Etkileşimli bir prototip oluşturun
Bir gereklilik değişikliğinden sonra çalışma kontrolleri, düzenlenebilir proje ve davranış
Demo yolunun dışındaki kırık etkileşimler
Bir araştırma özeti üretin
Her maddi iddiayı ve çelişkilerin açık muamelesini destekleyen kaynaklar
Desteklenmeyen sonuçlara sahip akıcı özetler
Mevcut bir sistemi onarın
Sorunun çoğaltılması, doğrulanmış düzeltme ve ilgili davranış kontrolleri
Başka bir hata yaratan makul bir değişiklik

Geniş sonuçlar çıkarmadan önce birden fazla temsili görev çalıştırın. Model ayarını, uygulamayı, araçları, gerekli müdahaleyi, geçen süreyi ve harcanan maliyeti veya ödeneği kaydedin.

Yararlı bir önlem, kabul edilen bir sonuca yönelik toplam çabadır : kurulum, oluşturma, gözden geçirme, düzeltmeler ve kurtarma. Kontrol ve onarım kazancı emiyorsa, üretim süresinden tasarruf etmek sınırlı bir değere sahiptir.

Yetenek arızalarını eksik erişim veya tükenmiş ödenekten ayrı tutun. Herkes bir işi durdurabilir, ancak farklı çareler isterler. Bu alıştırma, iş akışınıza uygunluğu değerlendirir; bu bir AGI testi değildir.

karar

GPT-6 Astra, agentik AI 'da önemli bir ilerlemenin kanıtıdır. Lansmanı AGI sorununu çözmüyor.

En güçlü durum, tanıdık olmayan ortamları öğrenmek ve araçlar arasında iş yapmaktan gelir. Çözülmemiş sorular, daha geniş transfer, güvenilir tamamlama, gözetim ve kabul edilebilir bir sonuç elde etmek için gereken çabayla ilgilidir.

Bir YGZ yargısı, alışılmadık, açık uçlu görevler arasında bağımsız olarak yeniden üretilmiş performans, araçların ve insan müdahalesinin şeffaf bir şekilde hesaplanması ve uzun süreli çalışmaya göre tutarlı sonuçlarla daha güçlü hale gelebilir. Şimdilik en savunulabilir pozisyon, ilerlemeyi tanımak ve kalan boşlukları eşit özgüllükle değerlendirmektir.

Trend

Dreamina Seedance 2.5 ile tanışın

En fazla 50 referanstan 30 saniyelik videolar oluşturun.

Ücretsiz dene