1. Haberler
  2. Teknoloji
  3. Yapay Zeka Yarışı Yön Değiştirdi: Artık Daha Zeki Değil, Daha Güvenilir Kazanıyor

Yapay Zeka Yarışı Yön Değiştirdi: Artık Daha Zeki Değil, Daha Güvenilir Kazanıyor

Yapay Zeka Yarışı Yön Değiştirdi: Artık Daha Zeki Değil, Daha Güvenilir Kazanıyor
Yapay Zeka Yarışı Yön Değiştirdi: Artık Daha Zeki Değil, Daha Güvenilir Kazanıyor
Paylaş

Bu Yazıyı Paylaş

veya linki kopyala

Ertuğrul Akben | Startup Gazetesi | Eylül 2026

1 Eylül akşamı, saat 21:01. Telefonuma bir kart düştü: “Claude Fable 5.1 kullanıma hazır.” Altında üç satır özellik. Üçünde de “daha zeki” kelimesi yok.

Birinci satır: Sade dilde yazar, ne istediysen onu yapar.

İkinci satır: Bitmiş tablo üretir, giderken her sayıyı kontrol eder.

Üçüncü satır: Kaynak gösterir, bildiğini tahmininden ayırır.

Açık konuşalım. Bu bir model duyurusu değil, bir itiraf. Dünyanın en güçlü halka açık yapay zekasını yapan şirket, yeni sürümünü tanıtırken zeka katsayısıyla değil, disiplinle övünüyor. Bu cümleyi bir kenara yazın; yazının sonunda geri döneceğiz.

1. Zeka zaten geldi: Fable 5’in rakamları

Fable 5, 9 Haziran 2026’da çıktı. Anthropic onu Opus’un üstüne yeni bir kademe olarak konumlandırdı: Mythos sınıfı. Rakamlar sert.

SWE-Bench Pro’da yüzde 80,3. En yakın rakip GPT-5.5, yüzde 58,6. Aradaki fark 22 puan; yarım puanlık ilerlemelere alışmış bir sektör için sıçrama.

Stripe, 50 milyon satırlık Ruby kod tabanında bir ekibin iki ayda yapacağı geçişi modele bir günde yaptırdığını açıkladı. Hebbia’nın kıdemli finans muhakemesi testinde birinci; tablo ve grafik okumada belirgin artış. Günlük Excel testlerinde Opus 4.8’i her efor seviyesinde geçiyor ve işi yüzde 25-30 daha hızlı bitiriyor.

Teknik çerçeve: 1 milyon token bağlam, 128 bin token çıktı, milyon token başına 10 dolar giriş, 50 dolar çıkış.

Sonra 12 Haziran geldi. ABD ihracat kontrolü, model dünya çapında üç gün kapandı, 1 Temmuz’da geri döndü. O hikayeyi “Artık Soru Hangi Model Değil, Hangi Pasaport” yazısında anlatmıştım. Bugün başka bir şeye bakıyoruz.

Girişimciler için: Zeka artık kıt kaynak değil. Kıt olan başka bir şey.

2. Kıt olan şey: güven

Anthropic’in kendi verisi: güvenlik sınıflandırıcıları oturumların yüzde 5’inden azında devreye giriyor ve cevabı bir alt modele, Opus 4.8’e düşürüyor. Yani yirmi konuşmadan birinde aslında Fable ile konuşmuyorsunuz.

Daha ilginci Andon Labs’in Vending-Bench sonucu. Bu test, modele sanal bir otomat işletmesi verip aylarca para kazandırmasını ister. Kısıtsız Mythos 5, hem Opus 4.7’den hem GPT-5.5’ten daha az para kazandı. Benchmark şampiyonu, dükkan işletince kaybediyor.

Şimdi 5.1’in üç maddesini tekrar okuyun. Sade dil, kontrol edilmiş sayı, kaynak. Üçü de zekaya değil, güvene cevap.

Benzetme şöyle: Yıllardır yanınızda çok parlak bir çırak var. Ustanın bildiği her şeyi biliyor. Ama fatura kesince rakamı yuvarlıyor ve emin olmadığı yerde “sanırım” demiyor, kesin konuşuyor. 5.1’in vaadi şu: Çırak artık “bunu biliyorum, bunu tahmin ediyorum” diyecek.

Girişimciler için: Model seçerken “hangisi daha akıllı” sorusu kapandı. Yeni soru: “Hangisi yanıldığını söylüyor?”

3. 5.1’in dürüst bilançosu

Bilinen: Uygulama içinde kart çıktı. Max planında kullanımın yüzde 50’sine kadar dahil. Fable 5’in nokta sürümü; aynı Mythos sınıfı, aynı güvenlik konumlanması.

Bilinmeyen (bu yazı yazılırken): Resmi benchmark tablosu, API model kimliği ve fiyat yayınlanmamış. Ağustos boyunca model “sızdı, bitti, bekletiliyor” haberleriyle dolandı; 28 Ağustos, 31 Ağustos, 5 Eylül tarihleri gezdi. Tek somut sinyal, Amazon Bedrock’ta 5.1 kimliğinin “model bulunamadı” dönüp uydurma kimliklerin “geçersiz” dönmesiydi. Sızıntılar fiyatın değişmediğini söylüyor; teyit yok.

Bu yazıyı “5.1 rekor kırdı” diye yazabilirdim. Yazmıyorum. Çünkü elimde 5.1 için benchmark yok; elimde Fable 5’in benchmark’ı ve 5.1’in üç vaadi var. 5.1’in üçüncü vaadini bizzat uyguluyorum: Bildiğimi tahminimden ayırıyorum.

Girişimciler için: Bunu siz de yapın. Yatırımcı sunumunda “yapay zeka ile yüzde 40 verim” yazıyorsanız, yanına kaynağını yazın. Kaynak yoksa yüzde 40 da yok.

4. Türkiye’de sorun hiç zeka olmadı

Bu yıl Antalya’dan Maraş’a kadar onlarca işletmede yapay zeka görüşmesi yaptım. Otelci, distribütör, muhasebeci, e-ticaretçi. Hiçbiri masaya “model yeterince zeki değil” diye oturmadı. Hepsi aynı cümleyle oturdu: “Geçen ay denedim, rakamı uydurdu, bir daha güvenmedim.”

Tek bir yanlış rakam, altı aylık projeyi kapatıyor. Bunu defalarca gördüm.

Geçen kış bir distribütörün sipariş verisini modele okutmuş. Rapor kusursuz görünüyordu; tek bir bayinin cirosunu iki ay birleştirip tek aya yazmıştı. Patron o rakamı görünce toplantıyı bitirdi. Sistem doğruydu, veri doğruydu, model bir yerde “tahmin etti” ve söylemedi.

Aynı dersi bir çağrı merkezinde de aldık. Kendileri yazılım yapmak istemişler, Model müşteriye “ödemeniz muhtemelen alınmıştır” dedi. Muhtemelen. Bir tahsilat aramasında bu kelimenin yeri yok; kayıt varsa var, yoksa yok. İşi biz aldık o günden beri modelin önüne bir kapı koyuyoruz: Kaynağı yoksa cümle müşteriye gitmiyor. Bu kapıyı iki yıldır elle kuruyoruz, çünkü Türk patronun ilk yanlış rakamdan sonra ikinci şansı yok.

5.1’in vaat ettiği şey, o katmanın modelin içine girmesi. İyi haber. Ama bir uyarı: Modelin kaynak göstermesi, sizin muhasebenizin doğru olduğu anlamına gelmez. Girdi çöpse, kaynaklı çöp alırsınız.

5. Yarın sabah yapılacak 5 iş

  1. Kendi test setinizi kurun. Şirket verinizden 10 soru. Her cevabı “biliyor / tahmin ediyor / uydurdu” diye işaretleyin. Model değiştirmeden önce bu testi çalıştırın.
  2. Önce Excel’i verin. 5.1’in en somut vaadi tablo. Aylık nakit akışınızı atın, formülleri kontrol ettirin, sonucu muhasebecinizle karşılaştırın.
  3. “Kaynağını göster” cümlesini sabitleyin. Kaynak veremediği hiçbir cümle karar dosyasına girmesin.
  4. Tek modele bağlanmayın. Fable 5 üç gün kapandı. Fiyatı 10/50 dolar. Opus 5 yarı maliyete yakın performans veriyor. Kritik iş akışında yedek rota şart.
  5. Bütçeyi zekaya değil doğrulamaya ayırın. Bir üst modele ödeyeceğiniz farkı, çıktıyı test eden kontrol adımına harcayın.

Tez: Yapay zekada yarış zekadan güvene döndü. Kazanan en çok bilen değil, ne bilmediğini söyleyen.

Sizin şirketinizde bilinen ile tahmin edilen ayrı mı duruyor, yoksa aynı Excel hücresinde mi?

Ertuğrul Akben

Yapay Zeka & Sistem Stratejisti

ertugrulakben.com

Kaynaklar 

Anthropic, “Claude Fable 5 and Claude Mythos 5”, 9 Haziran 2026 (SWE-Bench Pro, Stripe, Hebbia, Excel, fiyat, %5 fallback)

Anthropic, “Redeploying Claude Fable 5”, 30 Haziran 2026 (ihracat kontrolü, 1 Temmuz geri dönüş)

Vellum AI benchmark analizi (Andon Labs Vending-Bench sonucu)

Claude uygulama içi duyuru kartı, 1 Eylül 2026 (5.1 üç özellik, Max %50)

OrcaRouter / EvoLink / AIToolsReview takip yazıları, Ağustos 2026 (sızıntı ve tarih kronolojisi, Bedrock 404 sinyali)

Yapay Zeka Yarışı Yön Değiştirdi: Artık Daha Zeki Değil, Daha Güvenilir Kazanıyor
Yorum Yap

E-posta adresiniz yayınlanmayacak. Gerekli alanlar * ile işaretlenmişlerdir