Londra merkezli fintech şirketi Saturn’ün 14 Eylül 2026’da yayımladığı araştırmaya göre 18 popüler yapay zekâ modeli, finansal soruların yüzde 57’sinde yanlış yanıt verdi. Haberi Financial Times 19 Eylül’de duyurdu; bulgular İngiliz finans basınında da geniş yer buldu.

Araştırmada 121 finansal soru beşer kez soruldu ve toplam 10 binden fazla yanıt puanlandı. Karmaşık sorularda ortalama hata oranı yüzde 88’e çıktı; bazı modeller bu sorularda yüzde 99’a kadar yanıldı. Ücretsiz modeller yüzde 63, ücretli modeller yüzde 49 hata verdi. En zor sorularda ücretsiz modellerin hata oranı yüzde 93 oldu.

Model tablosunda en kötü performans Claude Haiku 4.5’te: yüzde 82. Gemini 3.1 Pro yüzde 73, Grok 4.5 yüzde 59, ChatGPT 5.6 Luna yüzde 58 hata yaptı. En iyi sonucu Claude Opus 5 (reasoning) aldı: yüzde 39.

Puanlama, yanıt olgusal hata içerdiğinde, kilit noktaları kaçırdığında veya önemli uyarıları atladığında başarısız sayıldı. Raporda iki hata doğrudan maliyet taşıyor: Emeklilik vergisi kurallarına dair bir yanıt, kullanıcıyı 17.500 sterlinlik vergi yüküyle karşı karşıya bırakabilirdi. Borç yönetimi senaryolarında modeller, kira ve belediye vergisi gibi öncelikli faturalar yerine en yüksek faizli borcun önce kapatılmasını önerdi. Bu tavsiye, borçlu bir kişiyi tahliye, icra ve yasal süreç riskiyle karşı karşıya bırakıyor.

Rapordaki diğer iki hata da somut zarar üretiyor: Bir model, mezun bir kişinin yurt dışına taşınırsa öğrenci kredisi ödemelerini durdurabileceğini iddia etti; kural böyle işlemiyor ve ödemeler aylık artıyor. Bir Gemini modeli ise ipotek ödemesine ara verilmesinin kredi notunu etkilemeyeceğini söyledi.

Saturn, İngiltere’nin finans düzenleyicisi FCA’dan yapay zekâ finansal tavsiyesini düzenleme kapsamına almasını istiyor. Ancak araştırmayı yapan şirketin bu düzenlemeden ticari çıkarı var. Test, Saturn’ün kendi metodolojisi ve kendi puanlama kriterleriyle yapıldı; sonuçları bağımsız bir kuruluş yeniden çalıştırmadı ve raporun tamamı yalnızca form dolduranlara açık.

İngiltere’de düzenleyici taraf da harekete geçti: FCA’nın yayımladığı Mills Review, tüketicilerin yüzde 26’sının genel amaçlı yapay zekâ araçlarına finansal tavsiye için güvendiğini buldu. FCA, düzenlenmiş tavsiyenin sağladığı korumalardan yoksun kalan tüketiciler için risk uyarısı yaptı ve yapay zekâ tavsiyesini düzenlemeyi değerlendiriyor. Saturn, FCA araştırmasına dayandırdığı bir hesapla, tüketicilerin yapay zekâ araçlarına başvurma olasılığının uzman danışmana gitmekten üç kat fazla olduğunu söylüyor; bu oran bağımsız olarak doğrulanamadı. Saturn’ün CEO’su Amal Jolly, ana akım modellerin verdiği düşük kaliteli finansal tavsiyenin yaygın bir tüketici zararına yol açabileceğini söyledi.

Sonuçlar, sohbet botlarının finansal kararlarda tek başına başvuru kaynağı olmadığını gösteriyor. ChatGPT ile Gemini’nin kullanıcı eşiğini aşması, bu soruları sıradan kullanıcılar için de kritik hale getiriyor. Saturn’ün verisi, en zor sorularda hiçbir modelin güvenilir kalmadığını söylüyor: ücretli sürümlerde bile hata oranı yarıya yakın.

Share.
Exit mobile version