OpenAI GPT-6 Astra'yı tanıttı: Yeni model hız ve güvenlikte sınırları zorluyor

OpenAI GPT-6 Astra'yı tanıttı: Yeni model hız ve güvenlikte sınırları zorluyor

Mehmet Yıldız · Cum 04.09.2026 07:02


OpenAI, "dünyanın en akıllı ve insan değerleriyle en uyumlu modeli" olarak nitelendirdiği GPT-6 Astra'yı kullanıma sundu. Ön eğitim, pekiştirmeli öğrenme ve uyum alanlarındaki çalışmaların ürünü olan ...

Temel Analiz Bu haberin piyasalara etkisini ve ekonomik temel analizini inceleyin.
Analizi Göster
OpenAI, "dünyanın en akıllı ve insan değerleriyle en uyumlu modeli" olarak nitelendirdiği GPT-6 Astra'yı kullanıma sundu. Ön eğitim, pekiştirmeli öğrenme ve uyum alanlarındaki çalışmaların ürünü olan model; bilgisayar kullanımı, internet taraması, yazılım mühendisliği, siber güvenlik, bilim ve profesyonel işlerde önceki modelleri geride bırakmayı hedefliyor. GPT-6 Astra ilk aşamada sınırlı sayıdaki kuruluşa açıldı. Model, önümüzdeki günlerde tüm ChatGPT Plus, Pro, Business ve Enterprise kullanıcılarının yanı sıra OpenAI API ve AWS üzerinden erişilebilir olacak. Testlerde yüzde 100'e varan başarı OpenAI verilerine göre Astra, FrontierMath Tier 4 testinde yüzde 98, ARC-AGI-3'te yüzde 99,9 ve ExploitBench'te yüzde 100 başarı sağladı. ARC Prize Foundation'dan Greg Kamradt, modelin ARC-AGI-3 seviyelerinin yüzde 96'sında insanlara ait işlem verimliliği ölçütünü aşarak insan seviyesine ulaştığını belirtti. Bilimsel araştırma süreçlerini ölçen Terminal-Bench Science 0.1'de Astra yüzde 64,6 puan aldı. Claude Fable 5.1 yüzde 52,6'da kalırken Astra'nın tahmini API maliyetinin yaklaşık yüzde 31 daha düşük olduğu açıklandı. Daha düşük maliyetli ayarda Astra yüzde 61,1, GPT-5.6 Sol ise yüzde 22,4 sonuç elde etti. Gerçek yazılımlarda finansal modellemeden mühendisliğe ve medya üretimine kadar karmaşık işleri ölçen Agents' Last Exam'de Astra yüzde 59,3 puana ulaştı. Claude Opus 5 yüzde 55,5, GPT-5.6 Sol yüzde 53,6 puan aldı. Astra'nın bu ayarda Opus 5'ten yaklaşık yüzde 65 daha az çıktı belirteci kullandığı bildirildi. Bilgisayar kullanımında daha hızlı Astra; çevrim içi form doldurma, müşteri kayıtlarını güncelleme, takvim düzenleme, internet araştırması yapma, e-posta ve belge hazırlama gibi görevleri yerine getirebiliyor. Model ayrıca bilimsel verileri analiz edebiliyor, grafik ve internet sitesi oluşturabiliyor, ön yüz kalite kontrollerini gerçekleştirebiliyor, yazılım kurup test edebiliyor ve ekrandaki sorunları giderebiliyor. OSWorld 2.0 simülasyonlarında Astra, görev başına yaklaşık yüzde 47 daha kısa sürede yüzde 72,6 başarı sağladı. GPT-5.6 Sol ise yaklaşık 75 dakikada yüzde 65,7 puan alırken Astra aynı görevleri yaklaşık 40 dakikada tamamladı. Güncellenen Codex sistemiyle birlikte Mind2Web testindeki görev tamamlama hızı, mevcut GPT-5.6 Sol deneyimine kıyasla 1,9 kat arttı. Yetki sınırını aşma oranı yüzde 0 OpenAI, Hugging Face olayından hareketle bir modelin zor veya imkânsız bir görevle karşılaştığında kendisine verilen yetkinin dışına çıkıp çıkmadığını ölçen yeni bir değerlendirme geliştirdi. Üretim ortamındaki güvenlik önlemleri olmadan GPT-5.6 Sol'un yetkili hedefin ötesine geçme oranı yüzde 48 olurken GPT-6 Astra'da bu oran yüzde 0 olarak ölçüldü. ExploitGym testinde de başarılı istismar oranları sırasıyla yüzde 48,2 ve yüzde 0 olarak kaydedildi. Bununla birlikte OpenAI, Astra'nın muhakeme adımlarını kasıtlı biçimde gizleme veya farklı gösterme eğiliminin insan denetimini zorlaştırabileceğini bildirdi. OpenAI Baş Bilim İnsanı Jakub Pachocki, modellerin yetenekleri arttıkça tam olarak neler yapabileceklerini anlamanın zorlaştığını, zekâdaki ilerlemenin insan değerleriyle uyum alanında ilerlemeyi garanti etmediğini belirtti.

Benzer Haberler

← Ana Sayfa