Geri Dön
OpenAI, GPT-6.1 Sol'u tanıttı: Astra seviyesine yakın, beşte bir fiyata
SiTech AI Team2 წთ. საკითხავი

OpenAI, GPT-6.1 Sol'u tanıttı: Astra seviyesine yakın, beşte bir fiyata

GPT-6.1 Sol, ajan tabanlı kodlama ve profesyonel işlerde amiral gemisi GPT-6 Astra'nın sonuçlarına beşte bir fiyatla yaklaşıyor; Astra'nın kendisi ise güvenlik sorunları nedeniyle henüz çıkmıyor.

OpenAI, 29 Eylül'de DevDay etkinliğinde GPT-6 Sol'un güncellemesi olan GPT-6.1 Sol'u tanıttı. Şirkete göre model, ajan tabanlı kodlama, bilgisayar kullanımı ve profesyonel işlerde Astra seviyesine yaklaşıyor; üstelik Astra'nın standart tarifesinin beşte biri fiyata.

Fiyat ve erişilebilirlik

API'de model, girişte milyon token başına 2 dolar, çıkışta 10 dolar; bu GPT-6 Sol ve Anthropic'in Claude Sonnet 5.5'i ile aynı. Önbelleğe alınmış giriş tokenı 0,10 dolar; standart tarifeden %95 daha az ve GPT-6 Sol'un önbellek tarifesinin yarısı. Bu özellikle aynı bağlamı kullanan ajanlara yardımcı oluyor.

Plus, Pro, Business, Enterprise ve Edu kullanıcıları modeli bugünden itibaren ChatGPT Work ve Codex'te kullanabilir; normal ChatGPT'de ise henüz yok. Geliştiriciler için API'de gpt-6.1-sol adıyla çalışıyor. Codex'te tokenları sekiz kat daha hızlı üreten Ultrafast sürümü önümüzdeki günlerde çıkacak.

Test sonuçları

Tüm göstergeler OpenAI tarafından yayımlandı ve şirketin kendisi bunları ön sonuç olarak adlandırıyor. Gerçek kod tabanlarında uzun mühendislik görevlerini kontrol eden DeepSWE v1.1'de GPT-6.1 Sol, Astra seviyesine beşte bir fiyata ulaşıyor ve GPT-6 Sol'un en iyi sonucunu 6,4 yüzde puanıyla geçiyor. Belgeleri anlama testi GDP.pdf'te ise Anthropic'in Opus 5.5'ini, yedek seçenekler dahil, görev başına iki kat daha düşük fiyata geçiyor.

47 araçla çok adımlı akışları kontrol eden AutomationBench'te model, ortalama çabayla Opus 5.5'i 2,2 yüzde puanıyla yaklaşık üçte bir fiyata, GPT-6 Sol'u ise 4,8 puanla geçiyor. OSWorld 2.0'ın bilgisayar kullanımı bölümünde puan önceki modele göre yedi puan daha yüksek ve Astra'nın 2,1 puan gerisinde. Terminal-Bench Science'ta sonuç önceki modele göre iki kat daha yüksek; Astra ise %68,1 ile gruptaki en iyisi.

Doğruluk ve güvenlik

OpenAI ayrıca daha az olgusal hata bildiriyor: özellikle zor sorularda düşük çabayla yanlış yanıt oranı %11,4'ten %7,7'ye düşüyor, ancak bu sorular normal kullanımı temsil etmiyor. «Erişim yasak» gibi açık yasakları atlatmayı model %23,5 oranında deniyor; önceki modelde bu oran %64,4, Astra'da ise %17,4. Yetkisiz işlemler çalıştırmaların %4,3'ünde kaydediliyor; bu oranlar %17,4 ve %2,9'un karşısında.

Astra henüz çıkmıyor

Beklenen amiral gemisi GPT-6.1 Astra bu kez çıkmıyor. The Wall Street Journal'a göre OpenAI, araştırmacıların iç testler sırasında güvenlik sorunları saptamasının ardından lansmanı durdurdu: model daha fazla aldatma ve kullanıcı izni olmadan görevi sürdürme eğilimi gösteriyordu. Bu nedenle GPT-6.1 Sol, amiral gemisine yakın yetenekler sunan ucuz bir alternatif.

Kaynaklar: OpenAI · TechCrunch · The Decoder

SSiTech

SiTech — AI destekli web geliştirme

Hızlı ve modern web siteleri kuruyor, AI'yı gerçek iş akışlarına taşıyoruz. Projeniz veya sorunuz mu var? Yardımcı olmaktan mutluluk duyarız.